
En vecka efter att Bionic fick ett Linuxbygge kommer nästa Linuxpunkt. Changelogposten för Bionic 1.1.3, daterad 15 september 2026, inleds med »Voice transcription for Linux.« och innehåller längre ner en andra rad: »Voice transcription on Linux systems with NVIDIA GPUs.« Ingen av raderna förklaras, och det finns ingen bloggpost. Dokumentationssidan för röstinmatning är ett stycke och ett inställningsavsnitt. Det räcker för att veta vad du ska prova, men inte för att veta vad resultatet blir på din maskin.
Första punkten säger Linux. Sista punkten säger Linux med NVIDIA-GPU. När samma post innehåller två formuleringar om samma funktion är det den snävare som gäller tills något annat är dokumenterat. Changeloggen säger inte om NVIDIA är ett tekniskt krav, en testad konfiguration eller en första etapp – och dokumentationssidan nämner inte GPU över huvud taget. Har du en burk med AMD-grafik eller bara processor är det alltså ingen som lovat dig något, och det enda sättet att få veta är att prova.
Vad dokumentationen säger, och var den tar slut
Sidan Voice Input in Bionic anger tre saker. Transkriptionen sker lokalt och skickar texten in i Bionic. Modellen är »för närvarande« Voxtral från Mistral AI, beskriven som en flerspråkig realtidsmodell för transkription. Och den första transkriptionen kan dröja medan modellen laddas, vilket du kan slippa genom att slå på Auto load voice model under Settings → Voice, så att transkriptionsmodellen hålls laddad.
Det är allt. Sidan anger ingen storlek eller variant av Voxtral, inget minnesbehov, ingen språklista utöver ordet »multilingual«, inga kortkommandon och ingen siffra för hur lång startfördröjningen är. Svenska varken bekräftas eller utesluts. Ordet »för närvarande« är också värt att notera: modellen kan bytas ut utan att changeloggen behöver säga det. Samma post lägger för övrigt till översättningar av appen till sex språk – tyska, spanska, franska, japanska, brasiliansk portugisiska och traditionell kinesiska – och svenska är inte ett av dem. Det är gränssnittets språk, inte röstmodellens, men det säger något om var svenska står i prioriteringen.
Transkriptionsfunktionen fanns i appen före Linuxstödet: posten för 1.1.0 den 27 augusti nämner en rättning av färgerna på transkriptionens stoppknapp. Vilka plattformar den då gällde anger changeloggen inte, så det som är nytt den 15 september är Linux, inte röstinmatningen i sig.
Steg ett: se att GPU:n faktiskt syns
Eftersom changeloggen pekar på NVIDIA är det första du kontrollerar att drivrutinen ser kortet. Gör det innan du öppnar Bionic, så att du vet om ett eventuellt problem ligger i systemet eller i appen. Har du inte gjort hårdvarukontrollen från Linuxinstallationen – arkitektur, minne, uppskattning med lms load --estimate-only – gör den först; röstmodellen kommer ovanpå den budgeten, inte i stället för den.
$ nvidia-smi --query-gpu=name,driver_version,memory.total,memory.used --format=csv
$ free -g
Får du ett kortnamn, en drivrutinsversion och en minnessiffra är du i den konfiguration changeloggen beskriver. Får du command not found eller ett felmeddelande om att drivrutinen inte kan nås är det där problemet ska lösas, inte i Bionic. Spara utskriften: raden memory.used är din nollpunkt för nästa steg.
Steg två: mät minnet före och efter röstmodellen
Röstmodellen laddas bredvid språkmodellen, och dokumentationen säger ingenting om hur mycket den tar. På en burk där språkmodellen redan fyller det mesta av GPU-minnet är det den frågan som avgör om röstinmatning är användbar eller om den tränger ut det du egentligen ville köra. Tre avläsningar räcker, med samma kommando varje gång.
# 1. Bionic igång, ingen modell laddad, Auto load voice model av
$ nvidia-smi --query-gpu=memory.used --format=csv,noheader
$ free -g | awk 'NR==2{print "used_gb", $3}'
# 2. Direkt efter den första transkriptionen – samma kommandon
$ nvidia-smi --query-gpu=memory.used --format=csv,noheader
$ free -g | awk 'NR==2{print "used_gb", $3}'
Den tredje avläsningen gör du med den språkmodell du faktiskt använder laddad och röstmodellen kvar i minnet. Klocka också den första transkriptionen med en vanlig klocka från det att du börjar tala tills texten står i rutan; det är den fördröjning inställningen Auto load voice model är till för att ta bort. Fyll i tabellen med dina egna siffror.
| Avläsning | GPU-minne använt (MiB) | RAM använt (GB) | Vad skillnaden betyder |
|---|---|---|---|
| 1. Före röstmodellen | Nollpunkten | ||
| 2. Efter första transkriptionen | Röstmodellens eget avtryck | ||
| 3. Med språkmodellen laddad | Om båda får plats samtidigt |
Ligger avläsning 3 nära kortets totala minne har du ett val att göra: mindre kontextfönster, hårdare kvantisering av språkmodellen, eller röstmodellen avstängd mellan dikteringarna. Ryms allt med marginal är frågan avgjord. Räkneexemplen för vad marginalen bör vara finns i hårdvarugenomgången.
Steg tre: dikteringsprov med tio svenska meningar
»Multilingual« är inte ett svar på om modellen klarar svenska, och särskilt inte svenska med tekniska termer och siffror. Provet är kort och görs en gång per maskin. Skriv tio meningar i förväg, läs upp dem i normalt tempo, och jämför transkriptionen ord för ord med facit. Det är samma princip som i svenskaproven för språkmodeller: lås villkoren innan du läser resultatet.
- Tre meningar med å, ä och ö i betydelsebärande ord, till exempel mäta, höra och lås.
- Två meningar med tal och enheter: »sexton gigabyte«, »åtta tusen token«.
- Två meningar med negation: »ladda inte modellen förrän minnet är mätt«.
- Två meningar med engelska termer i svensk mening: »kör nvidia-smi och läs av memory used«.
- En lång mening, minst tjugofem ord, med bisats.
Poängen är antal felaktiga ord av totalen, inte ett allmänt intryck. Räkna ett utbytt ord, ett saknat ord och ett tillagt ord som ett fel vardera, och notera separat hur talen kom ut – »16 GB« och »sexton gigabyte« är båda rätt, »60 GB« är fel. Bestäm gränsen innan du läser: för diktering till en agent som ska köra kommandon är ett fel i en siffra allvarligare än fem fel i bindeord. Faller provet på siffrorna dikterar du prosa och skriver kommandona för hand.
Bestäm om Auto load voice model ska vara på
Inställningen har en dokumenterad effekt: den håller röstmodellen laddad så att transkriptionen startar snabbare. Priset står inte i dokumentationen, men du har just mätt det – det är skillnaden mellan avläsning 1 och 2, betald hela tiden Bionic är igång. Avvägningen är enkel att skriva ner:
- Ryms avläsning 3 med marginal och var startfördröjningen märkbar: slå på.
- Ligger avläsning 3 vid taket: lämna av och acceptera väntan vid första dikteringen per session.
- Föll dikteringsprovet: spelar ingen roll – då är det inte minnet som avgör.
Två andra punkter i samma post rör Linux och är värda att känna till när du ändå uppdaterar: tilläggspaketen för llama.cpp går till 2.38.0, och en rättning gäller cirkulära symlänkar som orsakade loopar i filbevakningen på Linux. Körmotorn versioneras för sig, som i genomgången av Linuxinstallationen, så kontrollera vilken runtime som faktiskt kör efter uppdateringen.
Vad changelograderna inte lovar
De lovar att funktionen finns på Linux med NVIDIA-GPU. De säger ingenting om vilka NVIDIA-kort, vilka drivrutinsversioner, hur mycket minne, vilken latens eller vilka språk. Dokumentationen fyller på med modellens namn och en inställning. Resten – om den ryms bredvid din språkmodell och om den hör svenska – är tre avläsningar och tio meningar bort.
Källor och tekniskt underlag
- LM Studio Bionic changelog: posten för 1.1.3 den 15 september 2026 med raderna »Voice transcription for Linux« och »Voice transcription on Linux systems with NVIDIA GPUs«, översättningspunkten, llama.cpp 2.38.0 och symlänkrättningen, samt posterna 1.1.2 (Linuxbygget) och 1.1.0 (transkriptionens stoppknapp)
- Voice Input in Bionic: lokal transkription, Voxtral från Mistral AI, startfördröjningen vid första transkriptionen och inställningen Auto load voice model under Settings → Voice
Källorna kontrollerades 15 september 2026. Artikeln innehåller inga egna mätvärden. Formuleringen om NVIDIA-GPU återges som changeloggen anger den; varken changeloggen eller dokumentationen anger om kravet är strikt, vilken Voxtral-variant som används, minnesbehov, språklista eller kortkommandon, och artikeln anger därför inga sådana uppgifter. Kommandona nvidia-smi och free är generella Linuxverktyg och inte hämtade ur LM Studios dokumentation.