
Frågan ”är det billigare att köra modellen själv?” har inget allmänt svar. Den har ett svar för din arbetslast, ditt elpris, din hårdvara och den API-modell du faktiskt skulle använda i stället. Den här texten ställer upp de två kostnaderna i samma enhet — kronor per månad — och visar var de korsar varandra. Alla tal i räkneexemplet utom API-priserna är påhittade för att visa räkningen; byt ut dem mot dina egna.
API-vägen är nästan helt rörlig: varje svar kostar ungefär lika mycket, och noll svar kostar noll. Den lokala vägen är nästan helt fast: hårdvaran och arbetstiden kostar lika mycket oavsett om maskinen svarar tio eller tiotusen gånger. Brytpunkten är där den fasta kostnaden har slagits ut på tillräckligt många svar.
Formeln
Allt som följer bygger på en division. Den fasta lokala månadskostnaden delas med skillnaden mellan vad ett svar kostar via API och vad samma svar kostar lokalt i el:
brytpunkt (svar per månad) =
fast lokal kostnad per månad
/ (API-kostnad per svar − lokal elkostnad per svar)
Med en positiv fast lokal kostnad och en API-kostnad per svar som är högre än den lokala elkostnaden finns en positiv brytpunkt: under den är API-vägen billigare i den här kalkylen, över den den lokala. Är skillnaden i nämnaren noll eller negativ finns ingen volym där den lokala vägen tar igen en positiv fast kostnad; dividera då inte fram en brytpunkt. Alla poster måste dessutom ha samma valuta och jämförbara tidsenheter, och arbetslasten ska vara densamma på båda sidor. Det sista är svårast att uppfylla och tas upp i slutet.
Steg 1: tokenmängden per svar
API-priset anges per token, inte per svar, och ingående och utgående token kostar olika mycket. Du behöver därför två tal per svar: hur många token som skickas in (systemprompt, historik, dokument och fråga) och hur många som kommer ut. Gissa inte. Ollamas svar från /api/generate innehåller fälten prompt_eval_count och eval_count, som enligt API-referensen anger antalet ingående token respektive genererade token. Anthropics API-referens har motsvarande fält input_tokens och output_tokens i svarets usage.
Två tokeniserare räknar inte likadant, så samma text ger olika tal hos en lokal modell och hos en API-modell. Mät på den sida du ska prissätta. Kör ett representativt urval av riktiga frågor och ta medelvärdet; en fråga ensam säger lite.
En fallgrop som inte syns i svarstexten: modeller som resonerar internt producerar fler token än de visar. Anthropics API-referens beskriver fältet thinking_tokens som de utdatatoken modellen genererade som internt resonemang, och anger att värdet är högst lika med output_tokens — resonemanget ligger alltså i utdataposten. Räknar du orden i det synliga svaret underskattar du utdatakostnaden.
Räkneexempel (påhittat): 1 500 ingående och 500 utgående token per svar.
Steg 2: API-kostnaden per svar
Hämta priset ur leverantörens egen prislista samma dag som du räknar, och skriv ner datumet. Som exempel används här Anthropics prislista, eftersom dokumentationssidan uttryckligen anger valutan (”All prices are in USD”) och var prisgränserna går. Talen kontrollerades 9 oktober 2026.
| Modell | Ingående token | Utgående token | Villkor enligt prislistan |
|---|---|---|---|
| Claude Sonnet 5.5 | 2 USD per miljon | 10 USD per miljon | Standardpris |
| Claude Haiku 5.5 | 0,10 USD per miljon | 0,50 USD per miljon | Prompter upp till 100 000 token; över den gränsen 0,50 respektive 2,50 USD per miljon |
Prislistan anger också att priserna inte innehåller tillämplig skatt och att batchbehandling ger 50 procents rabatt, vilket passar arbetslaster som inte behöver svar direkt. Andra leverantörer har egna listor med egna villkor; läs dem på samma sätt — pris in, pris ut, valuta, gräns.
Kostnaden per svar är token gånger pris, delat med en miljon, för in- och utdata var för sig:
- Sonnet 5.5: 1 500 × 2 / 1 000 000 = 0,003 USD in, plus 500 × 10 / 1 000 000 = 0,005 USD ut, totalt 0,008 USD per svar.
- Haiku 5.5: 1 500 × 0,10 / 1 000 000 = 0,00015 USD in, plus 500 × 0,50 / 1 000 000 = 0,00025 USD ut, totalt 0,0004 USD per svar.
För att jämföra med el i kronor behövs en växelkurs. Här antar vi 10,00 kronor per US-dollar för att göra räkneexemplet lätt att följa; det är ingen uppgift om dagens kurs. Med antagandet blir Sonnet-svaret 0,0800 kronor, 8,0 öre, och Haiku-svaret 0,0040 kronor, 0,4 öre — före eventuell skatt. Hämta en aktuell kurs när du gör din egen kalkyl och anteckna källa och datum. Räkna också med växlingspåslag om betalningssättet har sådana.
Steg 3: elen per svar
Hur du mäter tillskottet i watt under generering står i vår artikel om att mäta elen för en lokal modell. Här behövs bara resultatet: tillskott över grundtomgång gånger sekunder per svar, delat med 3 600 för wattimmar.
Räkneexempel (påhittat): 120 W tillskott i 4 sekunder ger 120 × 4 / 3 600 = 0,133 Wh per svar. Med ett antaget elpris på 2,00 kronor per kWh blir det 0,000133 kWh × 2,00 = 0,00027 kronor, knappt tre hundradels öre per svar.
Det är den minsta posten i hela kalkylen. Det som brukar glömmas är tomgången: en modell som ligger laddad i minnet drar ström också när ingen frågar något. Påhittat: 15 W laddad tomgång i 8 timmar om dagen, 22 dagar i månaden, är 15 × 176 / 1 000 = 2,64 kWh, alltså 5,28 kronor per månad. Den posten är fast, inte rörlig, och hör hemma i nästa steg. Hur länge modellen ligger kvar styrs av keep-alive. Är maskinen dessutom inköpt enbart för AI, och står på för den skull, ska även grundtomgången räknas in.
Steg 4: de fasta posterna
Hårdvara. Räkna bara den merkostnad som AI-användningen orsakar. Ett grafikkort som köps för ändamålet räknas fullt; en arbetsstation som ändå skulle ha köpts räknas inte. Slå ut beloppet på den tid du tror att utrustningen används. Påhittat: 18 000 kronor på 36 månader ger 500 kronor per månad.
Arbetstid. Uppdateringar, modellbyten, felsökning och omstarter tar tid som inte syns på någon faktura. Påhittat: 2 timmar per månad à 400 kronor ger 800 kronor. Räkna ärligt även med den tid API-vägen kräver — nycklar, kostnadstak, uppföljning av fakturan — och lägg bara in skillnaden.
Laddad tomgång från steg 3: 5,28 kronor.
Summan blir 500 + 800 + 5,28 = 1 305,28 kronor per månad.
Steg 5: brytpunkten och kapaciteten
Insatt i formeln, med de påhittade posterna ovan och de verkliga API-priserna:
Tabellen är ett ifyllt räkneexempel. API-priserna är kontrollerade 9 oktober 2026; växelkursen och övriga tal är antaganden, inga mätresultat.
| Jämförelse | Fast lokal kostnad | Brytpunkt | Genereringstid vid brytpunkten | Vad raden ska bevisa |
|---|---|---|---|---|
| Mot Sonnet 5.5, med arbetstid | 1 305,28 kr | ca 16 400 svar/mån | ca 18 h | Att brytpunkten ryms i maskinens kapacitet |
| Mot Haiku 5.5, med arbetstid | 1 305,28 kr | ca 350 000 svar/mån | ca 388 h | Att valet av API-modell flyttar brytpunkten mer än elpriset |
| Mot Sonnet 5.5, utan arbetstid | 505,28 kr | ca 6 300 svar/mån | ca 7 h | Hur mycket den osynliga posten väger |
Med den orundade elkostnaden 0,0002666… kronor per svar blir första raden: 1 305,28 / (0,0800 − 0,0002666…) ≈ 16 371 svar. Andra raden: 1 305,28 / (0,0040 − 0,0002666…) ≈ 349 629 svar. Tredje raden: 505,28 / (0,0800 − 0,0002666…) ≈ 6 337 svar. Kolumnen med genereringstid är brytpunkten gånger 4 sekunder. I andra raden behöver maskinen generera i cirka 388 timmar per månad för att nå brytpunkten, men exemplet har den påslagen 176 timmar. Den lokala vägen hinner alltså inte bli billigare i det exemplet, eftersom hårdvaran inte räcker till den volymen. Hur kapaciteten dimensioneras står på hårdvarusidan.
Det kalkylen inte fångar
Brytpunkten jämför kostnad per svar, inte värde per svar. En lokal modell och en API-modell ger inte samma kvalitet på samma fråga, och skillnaden går åt båda håll beroende på uppgift. Om den lokala modellen behöver två försök där API-modellen behöver ett, kostar varje godkänt lokalt svar dubbelt så mycket el, och maskinen hinner bara hälften så många. Prova båda med samma frågor och samma bedömningskriterium först — vår artikel om att testa en lokal modell på svenska visar ett sätt — och räkna sedan bara på de svar som håller.
Kalkylen säger heller inget om var data får behandlas. Den frågan avgör ibland valet innan kostnaden ens blir aktuell, och den ska vara besvarad separat. Vår guide Kom igång börjar därför med arbetslast och data, inte med pris.
Kopiera tom mall
KOSTNADSKALKYL — LOKAL MODELL ELLER API
Upprättad: <datum> Arbetslast: <vad svaren används till>
Token per svar ........... in: <medel> ut: <medel> (mätt på <antal> riktiga frågor)
API-modell ............... <namn>, pris in <x> / ut <y> per miljon token, <valuta>
prislistan läst <datum>, villkor: <gränser, skatt, batch>
Växelkurs ................ <kurs>, källa <var>, datum <datum>
API-kostnad per svar ..... <kr>
El per svar .............. <W tillskott> × <s> / 3 600 = <Wh>; × <kr/kWh> = <kr>
Fast per månad ........... hårdvara <kr> + arbetstid <kr> + laddad tomgång <kr> = <kr>
Brytpunkt ................ fast / (API per svar − el per svar) = <svar per månad>
Kapacitet ................ brytpunkt × <s per svar> = <h> mot <h påslagen per månad>
Kvalitet ................. <andel godkända svar lokalt> mot <andel via API>
Nästa kontroll ........... <datum då pris och kurs läses om>Källor och tekniskt underlag
- Anthropic, prisdokumentation: priser per miljon token för in- och utdata, valutan USD och Haiku 5.5:s gräns vid 100 000 token
- Anthropic, prislista: att priserna inte innehåller tillämplig skatt och att batchbehandling ger 50 procents rabatt
- Anthropic API-referens: fälten input_tokens, output_tokens och thinking_tokens
- Sveriges Riksbank, räntor och valutakurser: dagliga valutakurser publicerade kl. 16.15, US-dollar i API-serien SEKUSDPMI
- Ollama /api/generate: fälten prompt_eval_count och eval_count
- Ollama releases: utgåva 0.40.2 publicerad 8 oktober 2026
Källorna kontrollerades 9 oktober 2026. API-priserna gäller standardpris enligt Anthropics prislista den dagen och kan ändras; läs om listan innan du räknar. Växelkursen 10,00 kronor per US-dollar, tokenmängd, watt, sekunder per svar, elpriset 2,00 kronor per kWh, hårdvarubeloppet, avskrivningstiden, arbetstiden och timkostnaden är antaganden i räkneexemplet, inte mätresultat eller uppgifter om marknaden. Artikeln drar ingen slutsats om vilken väg som är billigast; det avgörs av läsarens egna tal. Kalkylen är oberoende av Ollama-version; senaste utgåva vid kontrollen var 0.40.2.