En modell kan skriva flytande svenska och ändå missa ett datum, bryta ett formatkrav eller fylla en kunskapslucka med något som låter rimligt. Därför räcker inte frågan ”är den bra på svenska?”. Du behöver fem fasta prov som liknar arbetet du ska göra, samma inställningar för varje modell och ett protokoll som skiljer språklig yta från användbart resultat. Paketet här kompletterar modellguidens urvalskriterier och kan läggas in som den svenska delen av kom igång-guidens pilot.
Lås villkoren innan du läser ett svar
Börja med exakt modellidentifierare, modellfil och kvantisering. Två filer med samma modellnamn men olika kvantisering är två testobjekt. Spara även runtimeversion, datum och hårdvara. Jämför helst modeller i samma runtime; byter du både modell och körmiljö samtidigt vet du inte vilken förändring som gav skillnaden.
| Villkor | Låst värde | Varför |
|---|---|---|
| Kontext | 4 096 token | Alla fem proven ryms och modellerna får samma arbetsyta. |
| Temperatur | 0 | Minskar variationen mellan körningar. |
| Maximal utdata | 512 token | Förhindrar att en pratigare modell får obegränsat utrymme. |
| Systemtext | ”Följ instruktionen. Lägg inte till uppgifter som saknas.” | Samma grundregel gäller varje modell. |
| Historik | Ny konversation för varje prov | Ett tidigare svar får inte hjälpa eller störa nästa. |
| Upprepningar | 3 per prov och modell | Visar om ett lyckat svar var en engångsträff. |
LM Studios aktuella /api/v1/chat tar bland annat temperature, max_output_tokens, context_length och en systemtext i anropet. I appen kan systemtext och parametrar sparas som en namngiven Preset. Dokumentationen påpekar däremot att laddningsparametrar inte ingår i det nya presetformatet, så skriv modellens laddningskonfiguration separat. Ollamas Modelfile kan låsa temperature, num_ctx, num_predict, seed och SYSTEM. Använder du seed 42 i Ollama ska värdet finnas i protokollet; använd inte seed som en falsk garanti för jämförbarhet mot en annan runtime som inte exponerar samma kontroll.
Spara svaren som A, B och C och poängsätt utan att titta på modellnamnet. Det minskar risken att en välkänd modell får välvilligare tolkning. Fart och minne hör hemma i egna kolumner efter kvalitetsbedömningen.
Så poängsätter du de fem proven
Varje prov ger 0, 1 eller 2 poäng. Två poäng kräver att alla angivna kontrollpunkter är uppfyllda. En poäng betyder att svaret är användbart efter en mindre rättning. Noll betyder att ett centralt krav bryts, att uppgifter förvanskas eller att svaret kräver omskrivning. Kör varje prov tre gånger och använd medianpoängen för provet. Maxpoängen blir 10.
Kopiera prompten tecken för tecken. Rätta inte stavning mellan modellerna och lägg inte till följdfrågor. Om just din arbetslast främst består av exempelvis tabeller kan du vikta formatprovet dubbelt, men bestäm vikterna före körningen och redovisa både råpoäng och viktad poäng.
Prov 1: följ svensk instruktion och exakt format
Gör om anteckningen till exakt tre rader. Varje rad ska börja med
ett av orden BESLUT, ÄGARE och DATUM i den ordningen. Använd inga
punktlistor och skriv inget före eller efter raderna.
Anteckning: Karin bokar lokalen. Gruppen valde Hamnen. Bokningen
ska vara klar senast 4 september 2026.
2 poäng: exakt tre rader i rätt ordning, Hamnen som beslut, Karin som ägare och 4 september 2026 som datum, utan inledning eller avslutning. 1 poäng: alla fakta är rätt men ett rent formatfel finns. 0 poäng: någon uppgift ändras, saknas eller placeras under fel etikett. Provet fångar modellen som låter professionell men inte går att använda i ett låst arbetsflöde.
Prov 2: skriv enkelt utan att ändra innebörden
Skriv om texten till klarspråk för en mottagare. Använd högst 45 ord,
du-tilltal och två meningar. Lägg inte till ett löfte om när beslut fattas.
Text: För att handläggningen av ärendet ska kunna fortskrida behöver
kompletterande underlag avseende boendekostnad inkomma till enheten
senast den 12 oktober. Avsaknad av sådant underlag kan medföra att
ärendet avgörs på befintligt material.
2 poäng: högst 45 ord, två meningar, du-tilltal, datumet bevaras och följden uttrycks som en möjlighet — inte ett säkert avslag. 1 poäng: innebörden är rätt men ett formkrav missas. 0 poäng: svaret lovar en beslutsdag, gör följden säkrare än originalet eller tappar det efterfrågade underlaget. Här är vardagligt myndighetsspråk viktigare än eleganta synonymer.
Prov 3: håll isär negation och säkerhet
Förklara meningen på enkel svenska i exakt en mening:
”Det är inte osannolikt att leveransen blir försenad, men besked
saknas.” Säg inte att förseningen är säker.
2 poäng: svaret säger att en försening är möjlig eller ganska möjlig, samtidigt som slutligt besked saknas, i en mening. 1 poäng: kärnan är rätt men formuleringen blir onödigt tvärsäker eller består av två meningar. 0 poäng: modellen tolkar ”inte osannolikt” som osannolikt, lovar försening eller utelämnar osäkerheten. Provet är litet med flit: ett kort svar gör semantikfelet svårt att gömma i utfyllnad.
Prov 4: sammanfatta utan att tappa tal och villkor
Sammanfatta rapporten i exakt tre punkter. Ta med tid, omfattning
och nästa kontroll. Lägg inte till en orsak.
Rapport: Tjänsten var otillgänglig 08.17–08.43 den 6 augusti.
Fjorton användare berördes. Orsaken är ännu inte fastställd.
Loggarna ska kontrolleras av driftgruppen klockan 13.00 samma dag.
2 poäng: tre punkter som bevarar intervallet, datumet, 14 användare och kontrollen klockan 13.00, utan påhittad orsak. 1 poäng: ingen fakta är fel men en efterfrågad detalj saknas eller formatet bryts. 0 poäng: tal ändras, kontrollen beskrivs som genomförd eller en orsak hittas på. Detta är provet där flytande svenska måste underordna sig källtrohet.
Prov 5: säg vad som saknas
En förening har 48 000 kronor på kontot. Hur många månader räcker
pengarna? Svara med rubrikerna SVAR och SAKNAS. Hitta inte på några
kostnader.
2 poäng: modellen säger under SVAR att tiden inte kan beräknas och anger under SAKNAS åtminstone kostnad per månad. 1 poäng: den avstår korrekt men missar en rubrik eller beskriver luckan otydligt. 0 poäng: den antar en månadskostnad och ger ett antal månader. Det här provet belönar ett användbart stopp, inte ett långt resonemang.
Protokollet som gör jämförelsen möjlig att upprepa
| Prov | Körning 1 | Körning 2 | Körning 3 | Median | Felnotering |
|---|---|---|---|---|---|
| 1. Format | 0–2 | 0–2 | 0–2 | 0–2 | Fakta eller format? |
| 2. Klarspråk | 0–2 | 0–2 | 0–2 | 0–2 | Ord, ton eller innebörd? |
| 3. Negation | 0–2 | 0–2 | 0–2 | 0–2 | Hur ändrades säkerheten? |
| 4. Sammanfattning | 0–2 | 0–2 | 0–2 | 0–2 | Vilken uppgift tappades? |
| 5. Kunskapslucka | 0–2 | 0–2 | 0–2 | 0–2 | Antog modellen något? |
| Summa | — | 0–10 | Beslut och gränsfall | ||
Spara prompt, råsvar och poäng tillsammans. Notera även modellfilens storlek, minnesanvändning och svarstid, men blanda inte in dem i språkpoängen. En modell med 8 poäng som ryms och svarar i tid kan vara ett bättre val än en modell med 10 poäng som inte fungerar på målmaskinen. Kvantiseringstestet visar varför du också ska jämföra två närliggande modellfiler i stället för att behandla modellnamnet som hela beslutet.
Bestäm godkäntgränsen före resultatet
Använd inte 8 av 10 som en universell gräns. Ett formatstyrt exportflöde kan kräva 2 poäng i prov 1 vid alla tre körningar, även om totalsumman är hög. Ett arbetsflöde med beslutsunderlag kan på samma sätt kräva full poäng i prov 4 och 5. Skriv därför först ”måste klara”, ”bör klara” och ”spelar mindre roll” för din last.
När två modeller hamnar nära varandra ska du läsa felnoteringarna, inte bara summan. Ett återkommande fel är mer betydelsefullt än ett stilval. Byt sedan in två eller tre anonymiserade exempel från din verkliga arbetslast, med samma poängprincip. De fem fasta proven ger en jämförbar bas; de egna exemplen avgör om basen överförs till arbetet. Använd inga personuppgifter eller hemligheter i testmaterialet bara för att modellen körs lokalt — integritetsguiden visar varför hela dataflödet måste kontrolleras.
Källor
- LM Studio Presets — systemtext, avancerade parametrar och vad som inte sparas som laddningsparameter
- LM Studio chat-API — modellidentifierare, systemtext, temperatur, maximal utdata och kontext
- Ollama Modelfile —
FROM,PARAMETER,SYSTEM, temperatur, kontext, utdatalängd och seed
Källorna kontrollerades 22 september 2026. Provtexterna, poänggränserna och rekommendationen om tre körningar är AI-burkens testmetod, inte leverantörernas kvalitetslöften. Nästa kontroll sker när LM Studio eller Ollama ändrar de dokumenterade konfigurationsfälten eller senast 22 oktober 2026.