Nyhet · AI-burken · Ollama

Ollama stöder Nemotron 3.5 Lightning (30B)

NVIDIAs nya modell Nemotron 3.5 Lightning är nu officiellt tillgänglig via Ollama. Det är en imponerande modell optimerad för agent-flöden, men den kräver att du har koll på minnet.

Av C. Leijon · Publicerad · Senast granskad · 3 min läsning

En mörk teknisk miljö. Ett tungt fysiskt datablock märkt '30B' håller på att installeras i ett tomt instickskort på en mattsvart server. Små, skarpa smaragdgröna lampor indikerar tillräcklig minneskapacitet.

I augusti 2026 lade Ollama till NVIDIAs Nemotron 3.5 Lightning i sitt modellbibliotek. Det är en MoE-modell (mixture of experts) med 30 miljarder parametrar totalt, varav omkring 3 miljarder används per token, byggd för agentflöden. Innan du kör kommandot lokalt behöver du veta hur stor filen är och hur mycket grafikminne du har – annars hamnar en del av modellen i vanligt RAM och den blir betydligt långsammare.

Vad Ollama säger om modellen

Ollama beskriver Nemotron 3.5 Lightning som byggd för ”always-on agents”, alltså agenter som körs kontinuerligt. Enligt samma sida ger den fyra gånger högre genomströmning och 30 procent kortare tid per uppgift än andra ledande öppna modeller av liknande storlek. Det är leverantörens egen jämförelse, inte ett oberoende test – prova modellen på din egen uppgift innan du bygger på den.

Hårdvarukrav för en 30B-modell

Ett vanligt misstag när en ny modell släpps i Ollama är att ladda ner standardversionen utan att kontrollera hur stor modellen faktiskt är. Modeller med 7–8 miljarder parametrar ryms ofta i 6–8 GB VRAM med kvantisering. En 30B-modell gör det inte, även när bara en del av den används per token.

Standardtaggen latest – samma fil som 30b – är 25 GB och har ett kontextfönster på upp till 1M token. För Apple Silicon finns 30b-mlx på 23 GB med 256K token. Filstorleken är ett golv: därtill kommer KV-cache för den kontextlängd du faktiskt använder. Ett grafikkort med 24 GB VRAM rymmer alltså inte hela standardfilen, och resten hamnar i vanligt RAM. Att bara omkring 3B parametrar är aktiva per token påverkar hastigheten, inte hur mycket av filen som måste få plats i minnet.

Så testkör du den

Om din hårdvara klarar kraven är installationen extremt enkel. Öppna din terminal och skriv:

ollama run nemotron-3.5-lightning

Om du saknar VRAM för att rymma hela modellen i grafikkortet, kommer Ollama automatiskt att dumpa de överblivna lagren till din dators ordinarie RAM-minne. Modellen kommer fortfarande att fungera, men du kommer att märka en drastisk sänkning i genereringshastighet. Vill du veta mer om hur VRAM-avlastning fungerar rekommenderar vi vår djupdykning i minneskontroll och avlastning eller att se över om du föredrar Ollama eller LM Studio för tyngre diagnostik.

Källor

Ollamas modellsida kontrollerades 10 september 2026. Den första versionen av artikeln angav kommandot nemotron-lightning, en filstorlek på 18 GB och att 24 GB VRAM rymmer hela modellen; det stämde inte med modellsidan och är rättat. Taggar och filstorlekar kan ändras – kontrollera sidan innan du hämtar modellen.

Nästa steg

Har du tillräckligt med minne? Gå vidare till modellhubben för att ladda ner och testa modellen.

Visa alla modeller