Artikel · drift · kostnad

API eller lokal AI: räkna kostnaden per svar och hitta brytpunkten

Ett API tar betalt per token. En lokal modell tar betalt i förväg, i hårdvara, och sedan löpande i el och arbetstid. Lägg båda i samma kalkyl så får du ett antal svar per månad där vägarna kostar lika mycket — med dina egna siffror, inte med någon annans.

Av C. Leijon · Publicerad · Senast granskad · 9 min läsning

En låg svart låda med ventilationsgaller står på ett mörkt podium i ett grönbelyst rum. En kabel löper från podiet ut över golvet förbi en glasvägg; till vänster står två små högtalare på stativ framför en upplyst grön gardin, och till höger skymtar en mörk soffa.
Maskinen köps en gång, men drar ström varje timme den står på – också när ingen frågar något. Båda posterna hör hemma i samma kalkyl.

Frågan ”är det billigare att köra modellen själv?” har inget allmänt svar. Den har ett svar för din arbetslast, ditt elpris, din hårdvara och den API-modell du faktiskt skulle använda i stället. Den här texten ställer upp de två kostnaderna i samma enhet — kronor per månad — och visar var de korsar varandra. Alla tal i räkneexemplet utom API-priserna är påhittade för att visa räkningen; byt ut dem mot dina egna.

Två sorters kostnad

API-vägen är nästan helt rörlig: varje svar kostar ungefär lika mycket, och noll svar kostar noll. Den lokala vägen är nästan helt fast: hårdvaran och arbetstiden kostar lika mycket oavsett om maskinen svarar tio eller tiotusen gånger. Brytpunkten är där den fasta kostnaden har slagits ut på tillräckligt många svar.

Formeln

Allt som följer bygger på en division. Den fasta lokala månadskostnaden delas med skillnaden mellan vad ett svar kostar via API och vad samma svar kostar lokalt i el:

brytpunkt (svar per månad) =
  fast lokal kostnad per månad
  / (API-kostnad per svar − lokal elkostnad per svar)

Med en positiv fast lokal kostnad och en API-kostnad per svar som är högre än den lokala elkostnaden finns en positiv brytpunkt: under den är API-vägen billigare i den här kalkylen, över den den lokala. Är skillnaden i nämnaren noll eller negativ finns ingen volym där den lokala vägen tar igen en positiv fast kostnad; dividera då inte fram en brytpunkt. Alla poster måste dessutom ha samma valuta och jämförbara tidsenheter, och arbetslasten ska vara densamma på båda sidor. Det sista är svårast att uppfylla och tas upp i slutet.

Steg 1: tokenmängden per svar

API-priset anges per token, inte per svar, och ingående och utgående token kostar olika mycket. Du behöver därför två tal per svar: hur många token som skickas in (systemprompt, historik, dokument och fråga) och hur många som kommer ut. Gissa inte. Ollamas svar från /api/generate innehåller fälten prompt_eval_count och eval_count, som enligt API-referensen anger antalet ingående token respektive genererade token. Anthropics API-referens har motsvarande fält input_tokens och output_tokens i svarets usage.

Två tokeniserare räknar inte likadant, så samma text ger olika tal hos en lokal modell och hos en API-modell. Mät på den sida du ska prissätta. Kör ett representativt urval av riktiga frågor och ta medelvärdet; en fråga ensam säger lite.

En fallgrop som inte syns i svarstexten: modeller som resonerar internt producerar fler token än de visar. Anthropics API-referens beskriver fältet thinking_tokens som de utdatatoken modellen genererade som internt resonemang, och anger att värdet är högst lika med output_tokens — resonemanget ligger alltså i utdataposten. Räknar du orden i det synliga svaret underskattar du utdatakostnaden.

Räkneexempel (påhittat): 1 500 ingående och 500 utgående token per svar.

Steg 2: API-kostnaden per svar

Hämta priset ur leverantörens egen prislista samma dag som du räknar, och skriv ner datumet. Som exempel används här Anthropics prislista, eftersom dokumentationssidan uttryckligen anger valutan (”All prices are in USD”) och var prisgränserna går. Talen kontrollerades 9 oktober 2026.

ModellIngående tokenUtgående tokenVillkor enligt prislistan
Claude Sonnet 5.52 USD per miljon10 USD per miljonStandardpris
Claude Haiku 5.50,10 USD per miljon0,50 USD per miljonPrompter upp till 100 000 token; över den gränsen 0,50 respektive 2,50 USD per miljon

Prislistan anger också att priserna inte innehåller tillämplig skatt och att batchbehandling ger 50 procents rabatt, vilket passar arbetslaster som inte behöver svar direkt. Andra leverantörer har egna listor med egna villkor; läs dem på samma sätt — pris in, pris ut, valuta, gräns.

Kostnaden per svar är token gånger pris, delat med en miljon, för in- och utdata var för sig:

För att jämföra med el i kronor behövs en växelkurs. Här antar vi 10,00 kronor per US-dollar för att göra räkneexemplet lätt att följa; det är ingen uppgift om dagens kurs. Med antagandet blir Sonnet-svaret 0,0800 kronor, 8,0 öre, och Haiku-svaret 0,0040 kronor, 0,4 öre — före eventuell skatt. Hämta en aktuell kurs när du gör din egen kalkyl och anteckna källa och datum. Räkna också med växlingspåslag om betalningssättet har sådana.

Steg 3: elen per svar

Hur du mäter tillskottet i watt under generering står i vår artikel om att mäta elen för en lokal modell. Här behövs bara resultatet: tillskott över grundtomgång gånger sekunder per svar, delat med 3 600 för wattimmar.

Räkneexempel (påhittat): 120 W tillskott i 4 sekunder ger 120 × 4 / 3 600 = 0,133 Wh per svar. Med ett antaget elpris på 2,00 kronor per kWh blir det 0,000133 kWh × 2,00 = 0,00027 kronor, knappt tre hundradels öre per svar.

Det är den minsta posten i hela kalkylen. Det som brukar glömmas är tomgången: en modell som ligger laddad i minnet drar ström också när ingen frågar något. Påhittat: 15 W laddad tomgång i 8 timmar om dagen, 22 dagar i månaden, är 15 × 176 / 1 000 = 2,64 kWh, alltså 5,28 kronor per månad. Den posten är fast, inte rörlig, och hör hemma i nästa steg. Hur länge modellen ligger kvar styrs av keep-alive. Är maskinen dessutom inköpt enbart för AI, och står på för den skull, ska även grundtomgången räknas in.

Steg 4: de fasta posterna

Hårdvara. Räkna bara den merkostnad som AI-användningen orsakar. Ett grafikkort som köps för ändamålet räknas fullt; en arbetsstation som ändå skulle ha köpts räknas inte. Slå ut beloppet på den tid du tror att utrustningen används. Påhittat: 18 000 kronor på 36 månader ger 500 kronor per månad.

Arbetstid. Uppdateringar, modellbyten, felsökning och omstarter tar tid som inte syns på någon faktura. Påhittat: 2 timmar per månad à 400 kronor ger 800 kronor. Räkna ärligt även med den tid API-vägen kräver — nycklar, kostnadstak, uppföljning av fakturan — och lägg bara in skillnaden.

Laddad tomgång från steg 3: 5,28 kronor.

Summan blir 500 + 800 + 5,28 = 1 305,28 kronor per månad.

Steg 5: brytpunkten och kapaciteten

Insatt i formeln, med de påhittade posterna ovan och de verkliga API-priserna:

Tabellen är ett ifyllt räkneexempel. API-priserna är kontrollerade 9 oktober 2026; växelkursen och övriga tal är antaganden, inga mätresultat.

JämförelseFast lokal kostnadBrytpunktGenereringstid vid brytpunktenVad raden ska bevisa
Mot Sonnet 5.5, med arbetstid1 305,28 krca 16 400 svar/månca 18 hAtt brytpunkten ryms i maskinens kapacitet
Mot Haiku 5.5, med arbetstid1 305,28 krca 350 000 svar/månca 388 hAtt valet av API-modell flyttar brytpunkten mer än elpriset
Mot Sonnet 5.5, utan arbetstid505,28 krca 6 300 svar/månca 7 hHur mycket den osynliga posten väger

Med den orundade elkostnaden 0,0002666… kronor per svar blir första raden: 1 305,28 / (0,0800 − 0,0002666…) ≈ 16 371 svar. Andra raden: 1 305,28 / (0,0040 − 0,0002666…) ≈ 349 629 svar. Tredje raden: 505,28 / (0,0800 − 0,0002666…) ≈ 6 337 svar. Kolumnen med genereringstid är brytpunkten gånger 4 sekunder. I andra raden behöver maskinen generera i cirka 388 timmar per månad för att nå brytpunkten, men exemplet har den påslagen 176 timmar. Den lokala vägen hinner alltså inte bli billigare i det exemplet, eftersom hårdvaran inte räcker till den volymen. Hur kapaciteten dimensioneras står på hårdvarusidan.

Det kalkylen inte fångar

Brytpunkten jämför kostnad per svar, inte värde per svar. En lokal modell och en API-modell ger inte samma kvalitet på samma fråga, och skillnaden går åt båda håll beroende på uppgift. Om den lokala modellen behöver två försök där API-modellen behöver ett, kostar varje godkänt lokalt svar dubbelt så mycket el, och maskinen hinner bara hälften så många. Prova båda med samma frågor och samma bedömningskriterium först — vår artikel om att testa en lokal modell på svenska visar ett sätt — och räkna sedan bara på de svar som håller.

Kalkylen säger heller inget om var data får behandlas. Den frågan avgör ibland valet innan kostnaden ens blir aktuell, och den ska vara besvarad separat. Vår guide Kom igång börjar därför med arbetslast och data, inte med pris.

Kopiera tom mall
KOSTNADSKALKYL — LOKAL MODELL ELLER API
Upprättad: <datum>    Arbetslast: <vad svaren används till>

Token per svar ........... in: <medel>  ut: <medel>  (mätt på <antal> riktiga frågor)
API-modell ............... <namn>, pris in <x> / ut <y> per miljon token, <valuta>
                           prislistan läst <datum>, villkor: <gränser, skatt, batch>
Växelkurs ................ <kurs>, källa <var>, datum <datum>
API-kostnad per svar ..... <kr>
El per svar .............. <W tillskott> × <s> / 3 600 = <Wh>; × <kr/kWh> = <kr>
Fast per månad ........... hårdvara <kr> + arbetstid <kr> + laddad tomgång <kr> = <kr>
Brytpunkt ................ fast / (API per svar − el per svar) = <svar per månad>
Kapacitet ................ brytpunkt × <s per svar> = <h>  mot <h påslagen per månad>
Kvalitet ................. <andel godkända svar lokalt> mot <andel via API>
Nästa kontroll ........... <datum då pris och kurs läses om>

Källor och tekniskt underlag

Källorna kontrollerades 9 oktober 2026. API-priserna gäller standardpris enligt Anthropics prislista den dagen och kan ändras; läs om listan innan du räknar. Växelkursen 10,00 kronor per US-dollar, tokenmängd, watt, sekunder per svar, elpriset 2,00 kronor per kWh, hårdvarubeloppet, avskrivningstiden, arbetstiden och timkostnaden är antaganden i räkneexemplet, inte mätresultat eller uppgifter om marknaden. Artikeln drar ingen slutsats om vilken väg som är billigast; det avgörs av läsarens egna tal. Kalkylen är oberoende av Ollama-version; senaste utgåva vid kontrollen var 0.40.2.

Nästa steg

Mät elen per svar och den laddade tomgången på din egen maskin, så att den lokala sidan av kalkylen bygger på avläsningar i stället för antaganden.

Mät elen