Nyhet · 25 sep 2026Ollama 0.34.4 ger JSON-schema från tänkande modeller i ett pass – mät formen med tänkandet på
Releasen lovar snabbare och mer tillförlitlig strukturerad utdata från tänkande modeller: tänkandet går fritt och bara svaret efter det tvingas in i schemat, i en enda generering. Kör tio anrop med tänkandet på och av och räkna giltig JSON, svarstid och läckage.
Kör tioanropsprovet →
Nyhet · 24 sep 2026Open WebUI 0.11.4 täpper säkerhetsluckor – pröva vad slim-imagen tappar innan du byter
Releasen ber dig uppdatera produktion snarast för säkerhets- och behörighetsfixar. Slim-imagen på cirka 175 MB vägrar starta på MySQL eller S3 och tappar PDF-läsning, tal och DDGS-webbsök utan externa tjänster — gå igenom förprovslistan innan du byter.
Gå igenom förprovet →Splash kör Qwen lokalt på Apple Silicon — kontrollera M3, macOS 26.4 och 36 GB före installationen
LM Studios experimentella backend Splash kräver M3 eller nyare, macOS 26.4 och minst 36 GB unified memory, och stöder två Qwen-modeller. Bocka av kraven på två minuter och mät sedan själv — inläggets tal om 74 och 170 token per sekund är Incos, mätta på en 48 GB M5 Pro.
Kontrollera kraven →
Nyhet · 22 sep 2026llama-server läser nu temperatur och top-p ur miljövariabler – sätt förvalen i tjänstefilen i stället för kommandoraden
Bygge b11078 ger --temp, --top-p, --min-p och de tre straffparametrarna egna LLAMA_ARG-variabler. Flytta förvalen till en EnvironmentFile, se vad serverns README säger om företrädet och läs av vad servern faktiskt kör med i generation_settings.
Flytta förvalen →
Artikel · 21 sep 2026Samma fråga tio gånger: mät hur mycket den lokala modellen varierar innan du sätter temperatur och seed
Kör samma prompt tio gånger vid tre inställningar, räkna unika svar och svar som skiljer sig i sak och sätt sedan temperature och seed med mätt skäl. Med förvalen i Ollama, llama.cpp-servern och LM Studio som de står i dokumentationen 21 september 2026.
Mät variationen →
Nyhet · 19 sep 2026Ollama 0.34.3-rc1 visar modellens tänknivåer i /api/show – mät innan du låser nivån
Förhandsversionen visar vilka think-nivåer modellen tar och dess förval. Kör samma prompt med av, low, high och max och fyll en tabell med första svarstoken, total tid och tänkspårets längd.
Mät tänknivåerna →
Nyhet · 18 sep 2026Ollama 0.34.2 frågar om inloggning första gången du kör den – så fortsätter du lokalt och stänger av molnet
Förstagångsdialogen ger två val: logga in i webbläsaren eller fortsätt lokalt. Inloggningen gäller molnmodeller och webbsökning. Se vilka kommandon som visar dialogen, var valet sparas per operativsystem och hur OLLAMA_NO_CLOUD eller server.json stänger molnet med en loggrad som kvitto.
Stäng av molnet →
Artikel · 17 sep 2026Uppdateringen bröt något? Backa Ollama och llama.cpp till förra versionen – och lås den tills du provat
Läs av versionen som kör, hämta den senast fungerande utgåvan av Ollama eller ett pinnat llama.cpp-bygge, kör samma prov före och efter och fyll i ett versionskort. Med gränsen för autouppdatering på macOS och Windows.
Backa versionen →
Artikel · 16 sep 2026Vad drar den lokala modellen i el? Mät watt per svar och räkna om till kronor
Mät grundtomgång, laddad tomgång och generering var för sig med en uttagsmätare och nvidia-smi. Räkna om watt till wattimmar per svar och sätt en månadskostnad på ditt eget elpris.
Mät energiposten →
Nyhet · 15 sep 2026LM Studio Bionic 1.1.3 ger röstinmatning på Linux – lokal Voxtral, NVIDIA-GPU enligt changeloggen: prova svenska och mät minnet
Bionic 1.1.3 ger lokal rösttranskription på Linux med Voxtral. Changeloggen anger NVIDIA-GPU, dokumentationen saknar minnesbehov och språklista. Kontrollera GPU:n, mät minnet före och efter röstmodellen och kör ett dikteringsprov på svenska.
Mät röstmodellen →
Nyhet · 14 sep 2026llama.cpp 0.4.1 tar bort --mmap, --mlock och --direct-io – byt till --load-mode innan servern vägrar starta
Tre utfasade laddningsflaggor är borta ur argumenttolken och startskript som bär dem stoppar med invalid argument. Översätt till --load-mode enligt PR-diffen och mät laddtid och minne före och efter.
Byt till --load-mode →
Nyhet · 10 sep 2026LM Studio 0.4.24 håller bild och text i samma meddelande – kontrollera det multimodala API:t
Skicka en syntetisk bild och instruktion i samma input-lista och spara version, modell, begäran och svar som ett reproducerbart prov.
Kontrollera API-anropet →
Nyhet · 9 sep 2026LM Studio Bionic finns nu för Linux på x64 och ARM64 – gör hårdvarukontrollen före installationen
Changelogposten ger appen två arkitekturer. Ta reda på om burken är x64 eller ARM64, läs vad kravsidan faktiskt säger om Linux och räkna minnesbudgeten före nedladdningen.
Gör hårdvarukontrollen →
Artikel · 8 sep 2026Sök i dina egna dokument lokalt: bygg ett facit med tio frågor innan du litar på svaret
Bygg sökningen på Ollamas /api/embed, lägg tio frågor med känt facit bredvid och räkna om träff@1 efter varje ändring av stycken, prefix eller dimension.
Bygg facitet →
Nyhet · 7 sep 2026Ollama 0.34.0-rc1 kopplar ChatGPT Desktop till din lokala modell – mät gränsen innan du litar på den
Utgåvan är en release candidate och dokumentationen säger ingenting om vad som skickas vart. Fyll ett mätprotokoll per fråga i stället för att anta.
Fyll mätprotokollet →
Artikel · 5 sep 2026Två frågor samtidigt i Ollama: skilj kötid från långsam generering
Kör ett kontrollerat Ollama-prov med en och två samtidiga frågor. Jämför klienttid, generering och minne och välj parallellitet, kögräns och återförsök.
Fyll kapacitetsprotokollet →
Nyhet · 4 sep 2026
Ollama 0.33.3 ger Gemma 4 bild och ljud i MLX – kör ett lokalt modalitetsprov
Dokumentera version och modellartefakt, kontrollera annonserade kapabiliteter och kör separata facitprov för text, PNG och WAV-ljud.
Skilj stöd från svarskvalitet →
Nyhet · 3 sep 2026
Ollama 0.33.3 visar cachade prompttoken – mät återanvändningen utan att lura hastigheten
Kör två identiska anrop och håll isär promptens logiska total, cacheträffen och den del som faktiskt bearbetades innan du jämför token per sekund.
Mät logiskt, cachat och bearbetat →
Nyhet · 2 sep 2026
Ollama 0.33.3-rc0 läser GGUF-förval – lås parametrarna före test
Bevara version, kontrollsumma, Modelfile och råsvar. Ett fyrfältsprov skiljer nytt parameterarv från andra motorändringar i samma release.
Kör före- och efterprovet →
Artikel · 1 sep 2026
Längre kontext kostar minne – hitta Ollamas gräns på din dator
Kör samma modell och prompt med flera num_ctx-värden. Kontrollera processorplacering, RAM, VRAM och tider innan du väljer den största praktiska kontexten.
Kör kontextprovet →
Nyhet · 31 aug 2026
Ollama sätter inte längre repeat_penalty åt dig – mät om modellen börjar upprepa sig
Sedan 0.32.10 får modeller utan eget värde 1.0, alltså avstängt straff. Kontrollera din modell, kör samma frysta prompt med och utan straff och poängsätt upprepningen.
Kör provet på din modell → Nyhet · 30 aug 2026LM Studio 0.4.22 får DFlash, DSpark och MTP – mät vinsten själv
Frys målmodell, prompt och laddningsval. Kör sedan grundläge plus tre assistant drafters och jämför hastighet, första token, minne och svarskrav.
Bygg fyrkörningsprovet →
Nyhet · 28 aug 2026
LM Studio förklarar vad Auto Review släpper igenom – och vad den uttryckligen inte fångar
Två grindar i följd avgör vilka shell-kommandon som körs utan bekräftelse. De tre antagandena bakom dem står i inlägget, och det första gäller din egen maskin.
Läs antagandena →
Nyhet · 27 aug 2026
Ollama 0.33.1: MLX-runnern får strukturerad utdata – och slutar timeouta på långsam disk
Patchutgåvan efter 0.33.0 rör Apple Silicon: så avgör du vilken runner modellen körs under, och så kör du om schemaprovet på MLX-vägen.
Kontrollera din runner →
Nyhet · 26 aug 2026
Ollama 0.33 kopplar Claude Desktop till din lokala modell – men bara på macOS
Kravlistan i dokumentationen, de tre stegen för att slå på integrationen och gränsen mellan det som körs på din maskin och det som lämnar den.
Läs kravlistan →
Artikel · 25 aug 2026
Tvinga fram giltig JSON från en lokal modell – och mät hur ofta den håller
Schema på Ollamas format-parameter, GBNF i llama.cpp och ett protokoll med tio körningar som visar hur ofta formen håller.
Lås formatet →
Artikel · 24 aug 2026
Kör en modell som inte finns i Ollamas bibliotek: importera en GGUF med Modelfile
Fyra instruktioner i en Modelfile, ett bygge med ollama create och ett prov som visar att systemprompt och parametrar följde med in.
Gör importen →
Artikel · 23 aug 2026
Ollama håller kvar modellen i minnet: mät och styr keep-alive
Se vad som är laddat, frigör minnet direkt och mät vad urlastningen kostar vid nästa anrop.
Gör minnesprovet →
Artikel · 22 augusti 2026
Är modellen bra på svenska? Fem fasta prov
Jämför lokala modeller med samma svenska prompter, låsta inställningar och ett protokoll med tio möjliga poäng.
Kör proven →
Nyhet · 21 augusti 2026
Ollama 0.32.15: snabbare första token — mellan anrop
Metadatacachen gäller upprepade anrop, inte kallstarten. Så läser du utgåvans siffra och kör om rätt mätpunkt.
Läs nyheten →
Artikel · 20 augusti 2026
Flytta Ollama-modeller till en annan disk
Kopiera modellkatalogen, växla säkert med OLLAMA_MODELS och prova både start och återställning innan originalet tas bort.
Flytta modellerna →
Artikel · 19 augusti 2026
Vilken kvantisering ska du välja?
Vad Q4, Q5 och Q8 kostar i minne och kvalitet — med räknesätt och ett prov för din egen maskin.
Läs artikeln →
Nyhet · 18 augusti 2026
Ollama stöder Nemotron 3.5 Lightning (30B)
Kör NVIDIAs agent-optimerade modell lokalt, men verifiera dina hårdvarukrav först.
Läs artikeln →
Nyhet · 17 augusti 2026
LM Studio lägger till stöd för Qwen 3.8 (27B) – gör minneskontrollen
Kontrollera filstorlek, ledigt RAM och VRAM innan du laddar ner och kör den nya Qwen-modellen på din lokala maskin.
Gör kontrollen →
Nyhet · 16 augusti 2026
LM Studio lanserar Muse Glimmer 30B – gör minneskontrollen före nedladdning
Tre minnesuppgifter beskriver olika saker. Så kontrollerar du variant, filstorlek, RAM, VRAM och kontext innan du hämtar modellen.
Gör kontrollen →
Artikel · 15 augusti 2026
Kallstart eller långsam modell? Mät laddning, prompt och generering var för sig
Kör samma Ollama-anrop kallt och varmt. API-fälten visar om väntan ligger i modelladdning, promptbearbetning eller tokengenerering.
Gör testet →
Nyhet · 14 augusti 2026
Kritisk sårbarhet i llama-server: kontrollera ditt bygge och flaggan
CVE-2026-43631 pekar ut byggena b7492 till b9060 när --sleep-idle-seconds är aktiverad. Inget rättat bygge är namngivet — så läser du ut byggnumret och kontrollerar startkommandot.
Jämförelse · 13 augusti 2026
Ollama eller LM Studio? Välj efter arbetsflödet
Båda kan köra lokalt och erbjuda API. Så provar du gränssnitt, reproducerbarhet, nätverksgräns och offlinebeteende innan du väljer.
Läs artikeln →Publiceringsprincip
Vad som blir en artikel här
En artikel ska hjälpa läsaren fatta ett konkret beslut som kräver mer aktualitets- eller källarbete än en tidlös guide.
Samma prov, samma villkor
Verktyg eller modeller jämförs med redovisad version, konfiguration och uppgift.
Vad behöver läsaren göra?
En ny version blir artikel först när förändringen får en praktisk konsekvens.
Ett problem, en avgränsning
Drift, säkerhet och prestanda behandlas med testbara kontrollpunkter.