
Vår guide Kom igång kräver att hårdvara, energi, backup och förvaltningstid är prissatta innan piloten släpps på fler användare. Tre av de fyra posterna går att läsa av en faktura. Energiposten gör det inte: den ligger inbakad i ett hushålls- eller kontorsabonnemang och syns först när du mäter den separat. Den här texten mäter den i watt, räknar om till wattimmar per svar och lämnar priset till dig.
På maskinen i den här artikeln kostade tomgången efter ett enda svar drygt tolv gånger så mycket som svaret självt, eftersom modellen enligt Ollamas dokumenterade standardvärde ligger kvar i minnet i fem minuter. Mäter du bara under generering mäter du fel post.
Tre tillstånd, inte ett
En lokal modell har tre effektnivåer som ska hållas isär. Grundtomgång är maskinen påslagen utan laddad modell — den finns oavsett AI och ska räknas bort. Laddad tomgång är modellen resident i minnet utan trafik; skillnaden mot grundtomgången är den post keep-alive styr. Generering är de sekunder modellen faktiskt producerar token.
Uppdelningen är densamma som i vår genomgång av kallstart, promptbearbetning och generering, fast med effekt på y-axeln i stället för tid. Poängen med att skilja dem åt är att de har olika knappar: generering styrs av modellstorlek och kvantisering, laddad tomgång av keep_alive, och grundtomgången av hårdvaran och operativsystemets strömprofil.
Två instrument som inte mäter samma sak
En eluttagsmätare mellan vägguttaget och nätaggregatet ger hela maskinens förbrukning inklusive processor, minne, fläktar och nätaggregatets egna förluster. Det är talet som hamnar på elräkningen. Koppla bort skärm och kringutrustning till ett annat uttag, annars mäter du arbetsplatsen och inte datorn.
NVIDIA:s referens för nvidia-smi beskriver fältet power.draw som den senast uppmätta effekten för hela kortet, angiven i watt. Det är ett annat tal: grafikkortets bräda, inte maskinen. Referensen anger också att medelvärdet över den senaste sekunden bara stöds på Ampere och senare, med undantag för GA100, så kontrollera vad fältet faktiskt ger på just ditt kort innan du planerar provet. Använd de två talen till olika saker — uttagsmätaren till kalkylen, power.draw till att se vad som faktiskt belastas.
# Kontrollera att kortet redovisar effekt över huvud taget
nvidia-smi --query-gpu=name,power.draw,power.limit --format=csv
# Logga en avläsning per sekund medan provet körs
nvidia-smi --query-gpu=power.draw --format=csv,noheader,nounits -l 1 > effekt.csv
Formatet csv är obligatoriskt för --query-gpu enligt referensen, och -l upprepar frågan med angivet intervall i stället för bara en gång; utan angivet intervall är förvalet fem sekunder. Med en avläsning per sekund ger ett svar på tre sekunder tre mätpunkter, vilket är för lite för ett medelvärde. Kör därför samma prompt i en slinga i sextio sekunder och ta medelvärdet över hela fönstret.
Protokollet: fyra avläsningar i rad
Kör allt i samma session, utan att röra maskinen mellan stegen. Bakgrundslast förstör provet snabbare än något annat.
- Grundtomgång. Bekräfta med
ollama psatt ingen modell ligger i minnet. FAQ:n beskriver kommandot och dess kolumnProcessor, som visar om en laddad modell ligger på GPU, CPU eller delat. Läs av uttagsmätaren efter två minuters stillestånd. - Ladda och vänta. Skicka ett anrop med
keep_alive: -1så att modellen stannar. Vänta två minuter och läs av igen. Skillnaden mot steg 1 är den laddade tomgången. - Generering. Kör samma prompt i slinga i sextio sekunder med
stream:false,temperature:0,seed:42och ett fastnum_predict. Läs medelvärdet över fönstret. - Räkna sekunderna. Svaret från
/api/generateinnehållereval_countocheval_duration, och referensen anger att tidsfälten är i nanosekunder. Genereringens längd i sekunder äreval_duration / 1 000 000 000.
Från watt till kronor
Räkningen är två multiplikationer. Energi per svar är tillskottet över grundtomgången gånger genereringstiden, delat med 3 600 för att få wattimmar. Kostnaden är wattimmar delat med 1 000, gånger ditt elpris per kWh.
Mätvärdena nedan togs 16 september 2026 på Windows 11 med Ollama 0.33.3, ett NVIDIA GeForce RTX 4070 på 12 GB, Ryzen 7 7700 och 32 GB RAM. De gäller den maskinen och går inte att flytta till din.
| Tillstånd | Vägguttag | power.draw | Tillskott över grundtomgång |
|---|---|---|---|
| Maskin på, ingen modell laddad | 62 W | 12 W | – |
| Modell laddad, ingen trafik | 78 W | 22 W | 16 W |
| Under generering, medel över 60 s | 186 W | 138 W | 124 W |
Ett svar på 96 token tog 3,1 sekunder vid 31 token/s. Energin blir 124 W × 3,1 s / 3 600 = 0,107 Wh, alltså ungefär 0,11 Wh per svar. Tusen svar blir 0,11 kWh. Med ett antaget totalpris på 2,00 kronor per kWh — sätt in ditt eget, inklusive skatt, överföring och påslag — kostar tusen svar drygt tjugo öre. Det är inte den post som bär en kalkyl.
Tomgångssvansen är det du betalar för
Ollamas FAQ anger att en modell som standard hålls i minnet i fem minuter innan den lastas av. Efter varje svar följer alltså ett tomgångsfönster som kostar 16 W i 300 sekunder, det vill säga 1,33 Wh. Det är drygt tolv gånger energin i själva svaret. Ligger modellen resident hela arbetsdagen i stället — åtta timmar, 22 dagar — blir posten 16 W × 176 h = 2,82 kWh per månad, som på antagandet ovan landar kring 5,60 kronor. Fortfarande litet, men nu är det ett tal du kan skriva in i pilotspecifikationen i stället för ett frågetecken.
Knappen är samma som i vår artikel om hur länge modellen ligger kvar i minnet: parametern keep_alive tar värden som 5m eller 0 för att lasta av direkt, och miljövariabeln OLLAMA_KEEP_ALIVE flyttar samma inställning för hela servern. Avvägningen kostar åt båda hållen: kortare tomgång betyder fler omladdningar, och varje omladdning kostar både väntetid och den effekttopp som laddningen drar.
Kvantisering är också ett effektmått
Samma prompt, samma seed, samma num_ctx och samma num_predict på två kvantiseringar av samma modell. Den avsedda skillnaden är kvantiseringen och ingenting annat.
| Kvantisering | Token/s | Laddad tomgång | Under generering | Energi per svar (96 token) |
|---|---|---|---|---|
q4_K_M | 31 | +16 W | +124 W | 0,11 Wh |
q8_0 | 19 | +21 W | +129 W | 0,18 Wh |
Den tyngre varianten drar bara några watt mer medan den räknar, men den räknar längre, och det är tiden som avgör energin. Vår genomgång av vilken kvantisering du ska välja väger minne mot kvalitet; det här är ett tredje mått att lägga bredvid dem. Talen ovan säger ingenting om kvalitetsskillnaden mellan varianterna — den mäts med ett provpaket, inte med en wattmätare.
Fyra fallgropar
Nollan som inte är noll. Räknar du energi från 0 W i stället för från grundtomgången tillskriver du modellen hela maskinens förbrukning. I tabellen ovan blir svaret då 186 W i stället för 124 W, alltså halvannan gång dyrare, och tomgångssvansen 78 W i stället för 16 W, nästan fem gånger dyrare.
För få mätpunkter. Ett svar på tre sekunder ger tre avläsningar med sekundintervall, och den högsta av dem är inte ett medelvärde. Mät över ett fönster, inte över ett svar.
Fel instrument för fel post. Kortets power.draw missar processorn, som gör jobbet när modellen inte får plats på GPU:n. En modell som enligt ollama ps ligger delat mellan CPU och GPU går inte att prissätta på grafikkortets siffra.
Termisk drift. Den första minuten efter en kall start körs kortet svalt och drar ofta mer än efter tio minuter under last, när klockfrekvensen sjunkit. Läs av efter att temperaturen planat ut, och anteckna rumstemperaturen.
Vad siffran inte är
Den är en mätning på en maskin med en modell och en promptlängd. Den säger inget om hur en annan GPU beter sig, inget om hur mycket kylningen av rummet kostar ovanpå, och inget om vad samma arbetslast skulle kosta någon annanstans. Den duger till precis det den är gjord för: att fylla energiraden i pilotkalkylen med ett uppmätt tal och att visa vilken av knapparna som faktiskt flyttar den.
Spara grundtomgången, den laddade tomgången, genereringsmedelvärdet och ditt elpris i samma anteckning som modelltagg och Ollama-version. Nästa gång du byter modell eller kvantisering kör du om provet på en kvart och ser om bytet flyttade energiposten eller bara tokenhastigheten.
Källor och tekniskt underlag
- Ollama /api/generate: svarets fält eval_count och eval_duration, tidsenheten nanosekunder och parametern keep_alive
- Ollama FAQ: standardvärdet fem minuter i minnet, OLLAMA_KEEP_ALIVE och kommandot ollama ps
- NVIDIA nvidia-smi: power.draw i watt, medelvärdets stöd på Ampere och senare, csv-formatet och loopflaggan
Källorna kontrollerades 16 september 2026. Samtliga watt- och wattimmestal är egna avläsningar på den maskin som anges i avsnittet om omräkningen, gjorda med en eluttagsmätare och med nvidia-smi, som mäter olika saker och inte ska jämföras rad mot rad. Talen är inte ett omdöme om någon hårdvara eller modell och är inte överförbara till annan utrustning. Elpriset 2,00 kronor per kWh är ett uttalat räkneantagande i artikeln, inte en uppgift om vad el kostar.