Här dokumenteras väsentliga förändringar som påverkar sajtens uppdrag, navigering eller publicerade vägledning.
26 sep 2026
Ny guide: Open WebUI med Ollama: installera ett lokalt chattfönster. Guiden installerar Open WebUI från noll mot en Ollama som redan kör, med Docker eller Python 3.11/3.12, och citerar snabbstartens Docker-kommando ordagrant som det stod 26 september 2026. Den föreslagna varianten publicerar porten bara på 127.0.0.1 och stänger av de tre utgående anrop som snabbstarten själv listar. Guiden förklarar host.docker.internal, OLLAMA_BASE_URL och avvägningen när Ollama måste lyssna på 0.0.0.0, varför WEBUI_SECRET_KEY ska vara fast, att första kontot blir administratör och att registreringen är stängd tills admin öppnar den. Läsaren får tre prov med facit: modellen syns och svarar lokalt, ingen andra person kan registrera sig och chattsvaret kommer med nätet avslaget. Ingen egen installation eller trafikmätning har gjorts. Nyheten om 0.11.4 äger uppdatering och val av image, artikeln om Ollamas förstagångsinloggning molnavstängningen och integritetsguiden dataflödeskartan.
25 sep 2026
Ny nyhet: Ollama 0.34.4 ger JSON-schema från tänkande modeller i ett pass – mät formen med tänkandet på. Releasen v0.34.4, publicerad 23 september 2026 och kontrollerad 25 september 2026, säger att strukturerad utdata på tänkande modeller nu tillämpas i ett pass. Artikeln förklarar vad det betyder utifrån commit-texterna och koden i jämförelsen mot v0.34.3: tidigare två genereringar i chatten och JSON tvingad in i tänkandet på generate, nu en generering där bara svaret efter tänkandet följer schemat. Undantagen för raw, verktygsanrop och svar som tar slut under tänkandet redovisas. Läsaren får ett förslag till tioanropsprov med tänkandet på och av som räknar giltig JSON, svarstid och läckage in i message.content; inga egna mätvärden publiceras. Grundartikeln om JSON äger metoden, tänknivåartikeln valet av think-värde och MLX-artikeln runnerkontrollen.
24 sep 2026
Ny nyhet: Open WebUI 0.11.4 täpper säkerhetsluckor – pröva vad slim-imagen tappar innan du byter. Releasen v0.11.4, publicerad 21 september 2026 och kontrollerad 24 september 2026, har en Security Advisory som rekommenderar att produktionsinstallationer uppdateras snarast och säger att alla säkerhetsfixar inte nödvändigtvis är uppräknade. Artikeln återger sju listade fixar i sak, från token i loggar vid inloggning via identitetsleverantör till revokeringslistans fallback när Redis inte nås, och anger inga CVE-nummer eller allvarlighetsgrader eftersom inga fanns publicerade för versionen vid kontrollen. Slim-imagen på cirka 175 MB beskrivs med releasens och dokumentationens avgränsning: databas och fillagring stoppar uppstarten, medan kunskapssökning utan pgvector, PDF och Word utan extern extraktor, tal utan extern motor, DDGS-webbsök, git+https://-krav och kodtolkarens paket från cdn.jsdelivr.net fallerar först vid användning. Imagetaggarna är kontrollerade mot Open WebUI:s dokumentation. Läsaren får en förprovslista med tio rader. Facit med tio frågor äger bedömningen av svarskvalitet, backningsartikeln vägen tillbaka och driftguiden driftkortet.
23 sep 2026
Ny nyhet: Splash kör Qwen lokalt på Apple Silicon — kontrollera M3, macOS 26.4 och 36 GB före installationen. LM Studios inlägg 18 september 2026, kontrollerat 23 september 2026, släpper Inco AI:s Splash som experimentell backend under Settings, Runtime i Bionic 1.1.5 och nyare. Kraven återges som en kombination — M3 eller nyare, macOS 26.4 eller senare och minst 36 GB unified memory, med 48 GB som leverantörens rekommendation — och artikeln påstår ingenting om vad som händer när de inte uppfylls, eftersom källan inte säger det. Modellistan återges fullständig med de två modeller källan namnger, Qwen3.8-27B och Qwen3.6-35B-A3B. Hastighetstalen 74 och 54 token per sekund samt 170 token per sekund vid fyra samtidiga förfrågningar redovisas som Incos egna, mätta på en 48 GB M5 Pro på Qwen3.8-27B, utan namngiven jämförelsemotor och utan uppgift om kvantisering eller antal körningar. Inga egna mätvärden publiceras; läsaren får ett protokoll med tomma celler. Draft-motormätningen behåller sin mätuppställning, Qwen3.8 på AMD Ryzen står kvar som PC-spåret, hårdvarusidan äger minnesräkningen och driftguiden driftkortet.
22 sep 2026
Ny nyhet: llama-server läser nu temperatur och top-p ur miljövariabler – sätt förvalen i tjänstefilen i stället för kommandoraden. Bygget b11078 (21 september 2026 18:47 UTC) bär commit-titeln ”args: add env vars for temperature, top-p, min-p and penalties (#27380)” och låter --temp, --top-p, --min-p, --repeat-penalty, --presence-penalty och --frequency-penalty sättas via LLAMA_ARG_*. Ingen sida på sajten nämnde LLAMA_ARG, miljövariabler eller EnvironmentFile. Artikeln återger variabelnamnen och förvalen som de står i serverns README på master, avläst 22 september 2026 vid commit e0dff58, och citerar regeln att kommandoradsargumentet går före miljövariabeln. Att README tiger om vad som gäller när ett anrop skickar egna samplingfält sägs uttryckligen; i stället läser läsaren av default_generation_settings i /props och generation_settings i svaret. LLAMA_ARG_TOP_K anges som befintlig i tabellen utan att påstås vara ny i utgåvan, och --seed och --samplers redovisas som utan env-namn vid kontrolldatumet. Vilka värden som ska stå i tjänstefilen avgörs av provet i Samma fråga tio gånger. Ollama och LM Studio omfattas inte. Inga egna mätvärden publiceras.
21 sep 2026
Ny artikel: Samma fråga tio gånger: mät hur mycket den lokala modellen varierar innan du sätter temperatur och seed. Ingen sida på sajten visade hur variationen mellan svar mäts eller vad temperature, top_p, top_k och seed styr. Artikeln återger förvalen som de står i Ollamas Modelfile-referens, llama.cpp-serverns README och LM Studios dokumentation, kontrollerade 21 september 2026, och säger var de skiljer sig: top_p 0.9 mot 0.95, min_p 0.0 mot 0.05, seed 0 mot -1, och inga numeriska förval alls hos LM Studio. Vad seed låser återges som utgivarnas egna formuleringar, med llama.cpp-serverns cache_prompt-varning som enda uttryckliga förbehåll. Läsaren kör samma prompt tio gånger vid tre inställningar, räknar unika svar mekaniskt och svar som skiljer sig i sak för hand, och får en regel för när svaren ska låsas. Inga egna mätvärden publiceras.
19 sep 2026
Nyheten Ollama 0.34.3-rc1 visar modellens tänknivåer i /api/show – mät innan du låser nivån publiceringsförbereddes mot Ollamas officiella Pre-release och Thinking- samt API-dokumentationen, kontrollerade 19 september 2026. Releasens /api/show-uppgift avgränsas till förhandsversionen och dess exempel för den namngivna molnmodellen; ingen nivålista görs allmängiltig. Läsaren får ett prov med fryst modell, version, prompt och options där endast think ändras, och redovisar tid till första svarstoken, serverns total tid, totalt antal genererade token och thinking-fältets teckenlängd. Inga egna benchmarkvärden publiceras och eval_count påstås inte omfatta eller utesluta tänktoken. Kallstartsartikeln behåller tidsmetoden, versionsartikeln återställningsvägen och driftguiden driftkortet.
18 sep 2026
Ny nyhet: Ollama 0.34.2 frågar om inloggning första gången du kör den – så fortsätter du lokalt och stänger av molnet. Utgåvan v0.34.2 (15 september 2026) lägger till en förstagångsinställning när ollama körs, med valen att logga in eller fortsätta lokalt; slutförandet delas med skrivbordsappen på macOS och Windows. Artikeln återger PR #18495 (mergad 17 september 2026) om att dialogen bara visas när ollama körs utan underkommando, att install-skriptet, ollama launch, namngivna app-starter och icke-interaktiva sessioner inte visar den, och att valet på Linux sparas i ~/.ollama/config.json. Molnet stängs av med disable_ollama_cloud i server.json eller OLLAMA_NO_CLOUD=1 enligt FAQ:n, med loggraden Ollama cloud disabled: true som kvitto. Dialogtexten citeras inte och ingen flagga för att hoppa över dialogen påstås, eftersom ingen är dokumenterad vid kontrollen 18 september 2026.
17 sep 2026
Ny artikel: Uppdateringen bröt något? Backa Ollama och llama.cpp till förra versionen – och lås den tills du provat. Driftguidens driftkort kräver en dokumenterad väg att backa, men ingen sida visade utförandet. Artikeln läser av versionen med ollama -v och GET /api/version respektive --version och /props i llama.cpp, citerar Linux-dokumentationens OLLAMA_VERSION-kommando ordagrant, anger den fristående ollama-windows-amd64.zip och Windows-katalogerna som dokumentationen skriver dem, visar hur ett pinnat bNNNNN-bygge av llama.cpp hämtas utan att rekommendera ett nummer, återanvänder kallstartsprovet som före/efter-jämförelse och lämnar ett ifyllt versionskort med tom mall. Att appen på macOS och Windows laddar ned uppdateringar automatiskt utan dokumenterad avstängning redovisas som en gräns med kontrolldatum 17 september 2026.
16 sep 2026
Ny artikel: Vad drar den lokala modellen i el? Mät watt per svar och räkna om till kronor. Guiden Kom igång kräver att energi är prissatt innan piloten släpps på fler användare, men ingen sida visade hur posten mäts. Artikeln delar upp förbrukningen i grundtomgång, laddad tomgång och generering, mäter med eluttagsmätare och nvidia-smi --query-gpu=power.draw, räknar om till wattimmar per svar via eval_duration och sätter en månadskostnad på läsarens eget elpris. Ollamas dokumenterade standardvärde på fem minuter i minnet gör tomgångssvansen till den tyngsta posten i egna mätningar på en maskin. Elpriset i räkneexemplet är ett uttalat antagande, inte en uppgift om marknaden.
15 sep 2026
Ny nyhet: LM Studio Bionic 1.1.3 ger röstinmatning på Linux – lokal Voxtral, NVIDIA-GPU enligt changeloggen: prova svenska och mät minnet. Changelogposten för Bionic 1.1.3 den 15 september 2026 innehåller raderna »Voice transcription for Linux« och »Voice transcription on Linux systems with NVIDIA GPUs«; dokumentationen för röstinmatning anger lokal transkription med Voxtral från Mistral AI och inställningen Auto load voice model. Artikeln återger NVIDIA-formuleringen som changeloggen anger den, konstaterar att minnesbehov, språklista och kortkommandon saknas i källorna, och ger ett protokoll med GPU-kontroll via nvidia-smi, tre minnesavläsningar före och efter röstmodellen och ett dikteringsprov med tio svenska meningar. Inga egna mätvärden anges.
14 sep 2026
Ny nyhet: llama.cpp 0.4.1 tar bort --mmap, --mlock och --direct-io – byt till --load-mode innan servern vägrar starta. Releasen v0.4.1 (14 september 2026) tar bort de utfasade laddningsflaggorna ur den gemensamma argumenttolken enligt PR #28334, mergad 9 september 2026. Artikeln återger översättningen till --load-mode exakt som de borttagna handlarna satte den (--mlock till mlock, --no-mmap och --no-direct-io till none), citerar hjälptextens sex värden och miljövariabeln LLAMA_ARG_LOAD_MODE, och ger ett mätprov för laddtid till /health och residentminne före och efter bytet. Inga egna mätvärden anges; Ollama och LM Studio berörs inte.
10 sep 2026
Rättelse: Ollama stöder Nemotron 3.5 Lightning (30B) angav fel kommando (nemotron-lightning), fel filstorlek (18 GB) och att 24 GB VRAM rymmer hela modellen. Enligt Ollamas modellsida heter modellen nemotron-3.5-lightning, standardfilen är 25 GB och det är en MoE-modell med omkring 3B aktiva parametrar.
Rättelse: LM Studio lägger till stöd för Qwen 3.8 (27B) påstod NPU-acceleration och särskilda AMD-optimeringar i LM Studio utan stöd i källorna. Texten bygger nu på LM Studios modellsida och AMD:s beskrivning av körning på Ryzen AI Max+ och Radeon.
Ny nyhet: LM Studio 0.4.24 håller bild och text i samma meddelande – kontrollera det multimodala API:t. Ett syntetiskt bildprov skickar bild och instruktion som två objekt i samma input-lista till /api/v1/chat. Version, modellidentifierare, bildens SHA-256, rå begäran och rått svar sparas; ett separat textprov skiljer serverfel från bildfel. Texten påstår inga egna körresultat och avgränsas till LM Studios native v1-API.
9 sep 2026
Ny nyhet: LM Studio Bionic finns nu för Linux på x64 och ARM64 – gör hårdvarukontrollen före installationen. Changelogposten för Bionic 1.1.2 den 8 september 2026 innehåller punkten »Bionic for Linux (x64 and ARM64)«, och genomgången bakåt genom 1.1.1, 1.1.0 och 1.0.9 visar ingen tidigare Linuxpost. Texten skiljer plattformsfrågan från minnesfrågan: läsaren tar fram arkitekturen med uname -m, läser vad kravsidans Linuxavsnitt faktiskt innehåller — AppImage, Ubuntu 20.04 eller nyare och AVX2-formuleringen — och noterar att rekommendationerna om 16 GB RAM och 4 GB VRAM står under Windows, inte under Linux. Minnesbudgeten räknas med lms load --estimate-only vid den kontextlängd som faktiskt ska användas. Inga egna mätvärden anges, och flaggan --auto beskrivs inte eftersom den saknas i referensen för lms load. Artikeln om Auto Review behåller frågan om vilka skalkommandon agenten släpper igenom och minneskontrollen för Muse Glimmer 30B behåller räkningen för en enskild modell.
8 sep 2026
Ny artikel: Sök i dina egna dokument lokalt: bygg ett facit med tio frågor innan du litar på svaret. Artikeln bygger en minimal lokal dokumentsökning på Ollamas /api/embed, med ett facit på tio frågor där rätt stycke är känt i förväg, och definierar träff@1, träff@3 och MRR före körningen. Fyra egna körningar på ett påhittat testmaterial visar vad uppgiftsprefix, styckestorlek och en sänkt dimension gör med hämtningen. Talen anges som antal av tio frågor på artikelns eget material och är varken procentsatser eller omdömen om någon embeddingmodell. Artikeln om strukturerad utdata behåller mätningen av genereringssidan och GGUF-guiden behåller modellhanteringen.
Nyheten Ollama 0.33.3 ger Gemma 4 bild och ljud i MLX – kör ett lokalt modalitetsprov publiceringsförbereddes mot den stabila releasen v0.33.3, den sammanslagna ändringen #18079 samt Ollamas API-dokumentation för vision, modelldetaljer och installerade modellposter, kontrollerade 4 september 2026. Texten avgränsar ändringen till befintliga Gemma 4-importer från safetensors som serveras av MLX på Apple Silicon och säger uttryckligen att GGUF-vägen är oförändrad. Läsaren får spara Ollama-version, modellpost, digest och källfilernas SHA-256; kontrollera annonserad vision- respektive audio-kapabilitet; köra ett textkontrollprov, en syntetisk röd–blå PNG via /api/chat och en lokalt syntetiserad WAV via /v1/audio/transcriptions; samt klassificera varje utfall som stött, avvisat eller accepterat med undermåligt svar. Ingen egen installation eller provkörning ligger bakom nyheten. MLX-artikeln om strukturerad utdata behåller schemaprovet, GGUF-guiden behåller importflödet och driftguiden behåller den breda återställningsrutinen.
3 september 2026
Nyheten Ollama 0.33.3 visar cachade prompttoken – mät återanvändningen utan att lura hastigheten publiceringsförbereddes mot Ollamas officiella förhandsrelease v0.33.3-rc2, den sammanslagna ändringen #17943 och API-referenserna för Usage och Generate, kontrollerade 3 september 2026. Texten skiljer promptens logiska total i prompt_eval_count från cacheträffen i prompt_eval_cached_count och den icke-cachade bearbetning som prompt_eval_duration avser. Läsaren får en återställningsbar testmiljö, två anrop med samma serialiserade JSON-kropp, en tabell för logiska, cachade och bearbetade token samt en beräkning där cacheträffarna inte får räknas som rå prefill-kapacitet. Ett saknat cachefält behandlas som orapporterat, inte som noll. Ingen egen installation eller benchmark ligger bakom nyheten och lokala tokenräknare översätts inte till molnpris. Kallstartsartikeln behåller den fulla tidsuppdelningen, kontextartikeln behåller ändringar av num_ctx och driftguiden behåller den breda återställningsrutinen.
2 september 2026
Nyheten Ollama 0.33.3-rc0 läser GGUF-förval – lås parametrarna före test publiceringsförbereddes mot Ollamas officiella release, den sammanslagna ändringen #16471 och Modelfile-referensen, kontrollerade 2 september 2026. Texten avgränsar ändringen till fall där en GGUF-fil faktiskt definierar ett relevant standardvärde och där API eller Modelfile inte redan skriver över det. Läsaren får spara version, SHA-256, Modelfile, prompt och råsvar samt jämföra ett ärvt och ett uttryckligen låst läge med tre seeds före och efter förhandsversionen. Eftersom samma release även uppdaterar MLX, MLX-C och llama.cpp tillskrivs inte varje ändrat svar enbart GGUF-arvet. Ingen egen installation eller benchmark ligger bakom nyheten, ingen fullständig parameterlista påstås och väntan på stabil version anges som alternativ när grundläge eller återställningsväg saknas. Importguiden behåller hela GGUF-flödet, repeat_penalty-artikeln behåller det specifika upprepningsprovet och driftguiden behåller den breda versionsrutinen.
1 september 2026
Artikeln Längre kontext kostar minne – hitta Ollamas gräns på din dator publiceringsförbereddes mot Ollamas aktuella dokumentation för kontextlängd samt API-sidorna för användningsmått, modelldetaljer, generering och laddade modeller, kontrollerade 1 september 2026. Texten skiljer modellens redovisade maxlängd från Ollamas faktiskt tilldelade CONTEXT och användarens egna gränser för RAM, VRAM, processorplacering och tid. Läsaren får ett fyrpunktsprov med samma modell, kvantisering, prompt, seed, temperatur och tokenbudget; parade JSON-filer där bara num_ctx ändras; kontroll av SIZE, PROCESSOR och CONTEXT med ollama ps; tre varma mätningar per nivå och ett svarskrav som motsvarar prompten. Inga egna benchmarkvärden publiceras och inget generellt num_ctx utses till bäst. Kallstartsartikeln behåller den fulla tidsuppdelningen och hårdvaruguiden behåller den breda minnesdimensioneringen.
31 augusti 2026
Nyheten Ollama sätter inte längre repeat_penalty åt dig – mät om modellen börjar upprepa sig publiceringsförbereddes mot Ollamas releasenotering för v0.32.10 den 12 augusti 2026, releaselistan fram till v0.33.2 den 27 augusti 2026 samt Modelfile- och API-referensen på docs.ollama.com, kontrollerade 31 augusti 2026. Texten avgränsar ändringen till modeller som inte själva sätter parametern, redovisar att v0.32.10 är märkt som pre-release och att ingen senare notering tar tillbaka förvalet, och håller isär releasenoteringens ordalydelse från dokumentationens parametertabell. Läsaren får ett prov med fryst modell, tagg, kvantisering, kontext, temperatur och tokenbudget; tre bestämda seeds per läge; två anrop som skiljer sig på en rad; ett mekaniskt upprepningsmått och fälten eval_count, eval_duration och done_reason. Inga egna mätvärden publiceras och inget värde utses till bäst. Keep-alive-artikeln behåller minnestiden, importguiden behåller GGUF-flödet och kvantiseringsartikeln behåller filvalet.
30 augusti 2026
Nyheten LM Studio 0.4.22 får DFlash, DSpark och MTP – mät vinsten själv publiceringsförbereddes mot LM Studios versionsnotering och llama.cpp:s aktuella dokumentation, kontrollerade 30 augusti 2026. Texten avgränsar stödet till llama.cpp engine 2.29.1 eller nyare, skiljer modellkopplade DFlash- och DSpark-drafts från MTP-huvuden i målmodellen och lovar ingen generell fartökning. Läsaren får ett fyrkörningsprov med fryst målmodell, kvantisering, prompt, kontext, offload, temperatur och tokenbudget; tre körningar per läge; separata mått för tokens per sekund och tid till första token; samt faktisk RAM/VRAM-topp och kontrollerat svarskrav. Jämförelsen mellan Ollama och LM Studio behåller det breda verktygsvalet, kvantiseringsartikeln behåller filvalet och hårdvaruguiden behåller den generella minnesbudgeten.
28 augusti 2026
Nyheten LM Studio förklarar vad Auto Review släpper igenom – och vad den uttryckligen inte fångar publiceringsförbereddes mot LM Studios inlägg How Auto Review works in Bionic av Ryan Huang, publicerat 27 augusti 2026 och läst i sin helhet 28 augusti 2026: tvåstegskedjan med en deterministisk Shell Judge utan språkmodell följd av granskaragenten Shell Reviewer, de tre stegen AST-parsning, förmågeextraktion och regelmatchning, de fyra stödda skalen mot återfallskedjan där cmd inte ingår bland dem, avvisningen av kommandon som sätter miljövariabler, gränsen på 1 000 spårade värdealternativ, de 11 651 testerna och den anekdotiskt märkta 82-procentssiffran för författarens egen agent. Nyhetens tyngdpunkt ligger på inläggets egna begränsningar: att en icke-fientlig miljö förutsätts och att Shell Judge inte skyddar mot illvilligt konfigurerad programvara, att en sandlåda beskrivs som ortogonal mot problemet, och att fullständigt skydd mot promptinjektion anges vara omöjligt när huvudagenten redan är komprometterad. Texten påstår därför inte att Auto Review gör agenten säker. Jämförelsen mellan Ollama och LM Studio behåller verktygsvalet, artikeln om llama-server-sårbarheten behåller mönstret att kontrollera sitt eget bygge, driftguiden behåller rutinen för att anteckna runtime och konfiguration och integritetsguiden behåller datagränsen som arbetssätt.
27 augusti 2026
Nyheten Ollama 0.33.1: MLX-runnern får strukturerad utdata – och slutar timeouta på långsam disk publiceringsförbereddes mot utgåvedata, utgåvenotering, taggjämförelse, commit-meddelanden, felrapport 17902 och tre källkodsfiler lästa vid taggen v0.33.1, kontrollerade 27 augusti 2026: publiceringstidpunkten 2026-08-26T18:09:57Z utan förhandsversionsmärkning, noteringens fem punkter, jämförelsens femton commits, det gamla beteendet där format togs emot utan att tvingas fram på MLX-vägen, tvånget via xgrammar med logitmaskning, gränserna för schemastorlek, JSON-tokens och nästlingsdjup, den avstängda spekulativa avkodningen samt orsaken till och mätfallen för Metal-timeouten vid laddning från långsam lagring. Nyheten avgränsas till Apple Silicon och MLX-runnern och skiljs uttryckligen från gårdagens nyhet om 0.33.0 och Claude Desktop, som behåller den integrationen. Artikeln om strukturerad utdata behåller metoden att mäta hur ofta formen håller, flyttartikeln behåller flytten av modellkatalogen, kallstartsartikeln behåller tidsmätningens metod och driftguiden behåller rutinen för att versionera modell, runtime och konfiguration.
26 augusti 2026
Nyheten Ollama 0.33 kopplar Claude Desktop till din lokala modell – men bara på macOS publiceringsförbereddes mot utgåvenoteringen för v0.33.0 och Ollamas integrationsdokumentation, kontrollerade 26 augusti 2026: plattformsuppgiften macOS med Windows-stöd angivet som på väg, kravet på en nedladdad lokal modell före uppsättningen, inloggning och i vissa fall betald plan för molnmodeller, de tre uppsättningsstegen under Apps, modellbytet via Settings med omstart av klienten, de fyra dokumenterade funktionerna och bortkopplingen med ollama launch claude-desktop --restore. Nyheten redovisar att molnmodeller avlastas till Ollamas molntjänst och att webbsökningen besvaras av ollama.com, alltså lämnar datorn även när modellen körs lokalt. Genomgången av 0.32.15 behåller mätmetoden för tiden till första token, modellnavet behåller valet av modell och integritetsguiden behåller datagränsen som arbetssätt.
25 augusti 2026
Artikeln Tvinga fram giltig JSON från en lokal modell – och mät hur ofta den håller publiceringsförbereddes mot Ollamas dokumentation för strukturerad utdata och llama.cpp:s GBNF-guide, kontrollerade 25 augusti 2026: format som sträng eller JSON-schema på /api/generate och /api/chat, --grammar-file och --json-schema i llama.cpp samt de dokumenterade begränsningarna i konverteringen från schema till grammatik. Artikeln inför ett mätprotokoll där andelen giltiga svar redovisas som ett spann över minst tio körningar med fryst prompt, temperatur och seed. Modellnavet behåller valet av modell, kallstartsartikeln behåller tidsmätningens metod och valideringen av svarets innehåll i en integration ligger kvar hos Monkeybase.
24 augusti 2026
Artikeln Kör en modell som inte finns i Ollamas bibliotek: importera en GGUF med Modelfile publiceringsförbereddes mot Ollamas aktuella Modelfile-referens och importsida, kontrollerade 24 augusti 2026: FROM mot en lokal GGUF-fil, PARAMETER med dokumenterade standardvärden, SYSTEM med trippelcitattecken, bygge med ollama create och kontroll med ollama show --modelfile. Ett importkort i sajtens låsta mallformat knyter ihop källfil, checksumma, licens och Ollama-version. Modellnavet behåller valet av modell, kvantiseringsartikeln behåller valet av variant och hårdvarusidan behåller minnesbudgeten.
Artikeln Är modellen bra på svenska? Ett testpaket för lokal AI publiceringsförbereddes med fem fasta prov för format, klarspråk, negation, sammanfattning och kunskapsluckor. Samma inställningar, tre körningar per prov och ett 0–2-protokoll gör lokala modeller jämförbara på läsarens arbetslast. Modellsidan behåller urvalskriterierna och kom igång-guiden behåller pilotupplägget.
21 augusti 2026
Nyheten Ollama 0.32.15 halverar tiden till första token — men bara mellan anrop publiceringsförbereddes mot utgåvenoteringen och den sammanslagna pull requesten: vad metadatacachen tar bort, varför kallstarten inte rör sig, och vilken mätpunkt läsaren ska köra om. Mätartikeln behåller metoden och driftguiden behåller uppdateringsrutinen; nyheten länkar dit i stället för att upprepa dem.
Artikeln Vilken kvantisering ska du välja? Vad Q4, Q5 och Q8 kostar i minne och kvalitet publiceringsförbereddes: räknesättet parametrar × bitar per vikt ÷ 8 med llama.cpp:s dokumenterade bitdjup, vad ett steg kostar i gigabyte på 8B respektive 70B, vad det kostar i perplexitet och KL-divergens enligt llama.cpp:s egen resultattavla, och ett upprepningsbart prov med två grannvarianter. Modellguiden behåller sitt stycke om storlek och kvantisering och länkar nu dit för fördjupningen.
Hårdvaruguiden räknar nu minnesbudgeten i stället för att bara efterfråga den: fyra poster med formler för vikter och KV-cache, ett genomräknat exempel och vad fyra samtidiga förfrågningar gör med marginalen.
Guidevägen är färdig: alla fyra guider lämnar nu efter sig en ifyllbar mall — pilotspecifikation, driftformsbeslut, dataflödeskarta och driftkort — och samma exempelfall löper genom alla fyra. Provpaketets storlek är enad till 15–30 exempel med kom igång-guiden som ägare, körvägstabellen som dubblerade verktygsguiden är borttagen, och hårdvaru- och modellguiden har fått en väg tillbaka till guidevägen i stället för att peka på varandra.
Integritetsguiden fick en ifyllbar dataflödeskarta över de sex datapunkterna, med en kontrollkolumn som anger hur var och en bevisas — lyssnande adresser, utgående anslutningar, filer som skapas under körning och offlinetest.
Driftguiden fick ett ifyllbart driftkort: tretton fält med ett märkt exempel som visar detaljnivån och en tom mall att kopiera. Hälsokontrollen beskriver nu vad som anropas, hur ofta och vad som räknas som friskt svar.