Nyhet · LM Studio Bionic · röstinmatning

LM Studio Bionic 1.1.3 ger röstinmatning på Linux – lokal Voxtral, NVIDIA-GPU enligt changeloggen: prova svenska och mät minnet

Två changelograder och en kort dokumentationssida är hela underlaget. De säger att transkriptionen sker lokalt med Voxtral och att Linuxstödet gäller system med NVIDIA-GPU. De säger inte hur mycket minne röstmodellen tar bredvid språkmodellen, och inte om den klarar svenska. Det mäter du på tjugo minuter.

Av C. Leijon · Publicerad · Senast granskad · 8 min läsning

En svart datorlåda med sidofönster står på en mörk bänk; innanför fönstret lyser en fläkt och ett grafikkort i grönt, en grön ljuslist löper längs lådans underkant och på fronten sitter ett grönt ormliknande märke. Framför lådan står en liten mikrofon på ett trebensstativ med sladden hängande ner, och på bänkkanten ligger en pappersremsa med ett tryckt vågformsmönster.
Mikrofonen är den enkla delen. Det som avgör är vad som händer bakom sidofönstret när röstmodellen laddas bredvid språkmodellen – och det står inte i dokumentationen utan i din mätning.

En vecka efter att Bionic fick ett Linuxbygge kommer nästa Linuxpunkt. Changelogposten för Bionic 1.1.3, daterad 15 september 2026, inleds med »Voice transcription for Linux.« och innehåller längre ner en andra rad: »Voice transcription on Linux systems with NVIDIA GPUs.« Ingen av raderna förklaras, och det finns ingen bloggpost. Dokumentationssidan för röstinmatning är ett stycke och ett inställningsavsnitt. Det räcker för att veta vad du ska prova, men inte för att veta vad resultatet blir på din maskin.

Läs den snävare raden

Första punkten säger Linux. Sista punkten säger Linux med NVIDIA-GPU. När samma post innehåller två formuleringar om samma funktion är det den snävare som gäller tills något annat är dokumenterat. Changeloggen säger inte om NVIDIA är ett tekniskt krav, en testad konfiguration eller en första etapp – och dokumentationssidan nämner inte GPU över huvud taget. Har du en burk med AMD-grafik eller bara processor är det alltså ingen som lovat dig något, och det enda sättet att få veta är att prova.

Vad dokumentationen säger, och var den tar slut

Sidan Voice Input in Bionic anger tre saker. Transkriptionen sker lokalt och skickar texten in i Bionic. Modellen är »för närvarande« Voxtral från Mistral AI, beskriven som en flerspråkig realtidsmodell för transkription. Och den första transkriptionen kan dröja medan modellen laddas, vilket du kan slippa genom att slå på Auto load voice model under Settings → Voice, så att transkriptionsmodellen hålls laddad.

Det är allt. Sidan anger ingen storlek eller variant av Voxtral, inget minnesbehov, ingen språklista utöver ordet »multilingual«, inga kortkommandon och ingen siffra för hur lång startfördröjningen är. Svenska varken bekräftas eller utesluts. Ordet »för närvarande« är också värt att notera: modellen kan bytas ut utan att changeloggen behöver säga det. Samma post lägger för övrigt till översättningar av appen till sex språk – tyska, spanska, franska, japanska, brasiliansk portugisiska och traditionell kinesiska – och svenska är inte ett av dem. Det är gränssnittets språk, inte röstmodellens, men det säger något om var svenska står i prioriteringen.

Transkriptionsfunktionen fanns i appen före Linuxstödet: posten för 1.1.0 den 27 augusti nämner en rättning av färgerna på transkriptionens stoppknapp. Vilka plattformar den då gällde anger changeloggen inte, så det som är nytt den 15 september är Linux, inte röstinmatningen i sig.

Steg ett: se att GPU:n faktiskt syns

Eftersom changeloggen pekar på NVIDIA är det första du kontrollerar att drivrutinen ser kortet. Gör det innan du öppnar Bionic, så att du vet om ett eventuellt problem ligger i systemet eller i appen. Har du inte gjort hårdvarukontrollen från Linuxinstallationen – arkitektur, minne, uppskattning med lms load --estimate-only – gör den först; röstmodellen kommer ovanpå den budgeten, inte i stället för den.

$ nvidia-smi --query-gpu=name,driver_version,memory.total,memory.used --format=csv
$ free -g

Får du ett kortnamn, en drivrutinsversion och en minnessiffra är du i den konfiguration changeloggen beskriver. Får du command not found eller ett felmeddelande om att drivrutinen inte kan nås är det där problemet ska lösas, inte i Bionic. Spara utskriften: raden memory.used är din nollpunkt för nästa steg.

Steg två: mät minnet före och efter röstmodellen

Röstmodellen laddas bredvid språkmodellen, och dokumentationen säger ingenting om hur mycket den tar. På en burk där språkmodellen redan fyller det mesta av GPU-minnet är det den frågan som avgör om röstinmatning är användbar eller om den tränger ut det du egentligen ville köra. Tre avläsningar räcker, med samma kommando varje gång.

# 1. Bionic igång, ingen modell laddad, Auto load voice model av
$ nvidia-smi --query-gpu=memory.used --format=csv,noheader
$ free -g | awk 'NR==2{print "used_gb", $3}'
# 2. Direkt efter den första transkriptionen – samma kommandon
$ nvidia-smi --query-gpu=memory.used --format=csv,noheader
$ free -g | awk 'NR==2{print "used_gb", $3}'

Den tredje avläsningen gör du med den språkmodell du faktiskt använder laddad och röstmodellen kvar i minnet. Klocka också den första transkriptionen med en vanlig klocka från det att du börjar tala tills texten står i rutan; det är den fördröjning inställningen Auto load voice model är till för att ta bort. Fyll i tabellen med dina egna siffror.

AvläsningGPU-minne använt (MiB)RAM använt (GB)Vad skillnaden betyder
1. Före röstmodellen  Nollpunkten
2. Efter första transkriptionen  Röstmodellens eget avtryck
3. Med språkmodellen laddad  Om båda får plats samtidigt

Ligger avläsning 3 nära kortets totala minne har du ett val att göra: mindre kontextfönster, hårdare kvantisering av språkmodellen, eller röstmodellen avstängd mellan dikteringarna. Ryms allt med marginal är frågan avgjord. Räkneexemplen för vad marginalen bör vara finns i hårdvarugenomgången.

Steg tre: dikteringsprov med tio svenska meningar

»Multilingual« är inte ett svar på om modellen klarar svenska, och särskilt inte svenska med tekniska termer och siffror. Provet är kort och görs en gång per maskin. Skriv tio meningar i förväg, läs upp dem i normalt tempo, och jämför transkriptionen ord för ord med facit. Det är samma princip som i svenskaproven för språkmodeller: lås villkoren innan du läser resultatet.

Poängen är antal felaktiga ord av totalen, inte ett allmänt intryck. Räkna ett utbytt ord, ett saknat ord och ett tillagt ord som ett fel vardera, och notera separat hur talen kom ut – »16 GB« och »sexton gigabyte« är båda rätt, »60 GB« är fel. Bestäm gränsen innan du läser: för diktering till en agent som ska köra kommandon är ett fel i en siffra allvarligare än fem fel i bindeord. Faller provet på siffrorna dikterar du prosa och skriver kommandona för hand.

Bestäm om Auto load voice model ska vara på

Inställningen har en dokumenterad effekt: den håller röstmodellen laddad så att transkriptionen startar snabbare. Priset står inte i dokumentationen, men du har just mätt det – det är skillnaden mellan avläsning 1 och 2, betald hela tiden Bionic är igång. Avvägningen är enkel att skriva ner:

Två andra punkter i samma post rör Linux och är värda att känna till när du ändå uppdaterar: tilläggspaketen för llama.cpp går till 2.38.0, och en rättning gäller cirkulära symlänkar som orsakade loopar i filbevakningen på Linux. Körmotorn versioneras för sig, som i genomgången av Linuxinstallationen, så kontrollera vilken runtime som faktiskt kör efter uppdateringen.

Vad changelograderna inte lovar

De lovar att funktionen finns på Linux med NVIDIA-GPU. De säger ingenting om vilka NVIDIA-kort, vilka drivrutinsversioner, hur mycket minne, vilken latens eller vilka språk. Dokumentationen fyller på med modellens namn och en inställning. Resten – om den ryms bredvid din språkmodell och om den hör svenska – är tre avläsningar och tio meningar bort.

Källor och tekniskt underlag

Källorna kontrollerades 15 september 2026. Artikeln innehåller inga egna mätvärden. Formuleringen om NVIDIA-GPU återges som changeloggen anger den; varken changeloggen eller dokumentationen anger om kravet är strikt, vilken Voxtral-variant som används, minnesbehov, språklista eller kortkommandon, och artikeln anger därför inga sådana uppgifter. Kommandona nvidia-smi och free är generella Linuxverktyg och inte hämtade ur LM Studios dokumentation.

Nästa steg

Kör nvidia-smi innan du öppnar Bionic och skriv upp memory.used. Den siffran är nollpunkten för hela provet.

Räkna på minnet