Nyhet · Ollama · skrivbordsklienter

Ollama 0.33 kopplar Claude Desktop till din lokala modell – men bara på macOS

Utgåvan för in ett läge där Ollama konfigurerar Claude Desktop åt dig. Kravlistan står inte i utgåvenoteringen utan i dokumentationen, och den avgör både om du kan köra integrationen och hur mycket av arbetet som faktiskt stannar på din maskin.

Av C. Leijon · Publicerad · Senast granskad · 11 min läsning

Två svarta datorenheter är sammankopplade med en kabel i ett öppet mörkt metallchassi.
Den lokala modellen är bara en del av kedjan: en molnmodell eller webbsökning kan fortfarande skicka data ut ur datorn.

Ollama v0.33.0 publicerades den 21 augusti 2026 klockan 22.52 UTC och är inte märkt som förhandsversion. Nyheten i utgåvenoteringen ryms i en mening: utvecklare kan nu enkelt konfigurera Claude Desktop att fungera med Ollama som tredjepartsleverantör. Meningen säger ingenting om plattform, ingenting om vilka modeller som fungerar och ingenting om vad som händer när du använder klientens andra funktioner. Det gör däremot Ollamas integrationssida, och där står den uppgift som avgör om det här överhuvudtaget är en nyhet för dig: integrationen finns för macOS.

Tre villkor innan du börjar

Ollamas dokumentation anger tre förutsättningar. Integrationen beskrivs för macOS, med tillägget att Windows-stöd är på väg. En lokal modell ska vara nedladdad före uppsättningen. En molnmodell kräver att du loggar in på Ollama och slår på molnmodeller, och vissa modeller kräver en betald plan. Kontrollerat 26 augusti 2026.

Kravlistan står inte i utgåvenoteringen

Skillnaden mellan de två källorna är hela poängen. Utgåvenoteringen är en produktnotis på en rad plus en skärmbild. Dokumentationen är kravlistan, och de tre punkterna där är av helt olika slag.

Plattformsuppgiften är ett hinder eller inget hinder alls. Dokumentationens underrubrik anger uttryckligen Claude på macOS, och kravpunkten om Ollama har tillägget att Windows-stöd är på väg. Något datum anges inte. Linux nämns inte på sidan över huvud taget — och tystnad är inte ett besked åt något håll, varken att stödet finns eller att det är avskrivet. Kör du din modell på en Linuxburk i källaren eller på en Windowsdator med ett kraftigt grafikkort är den här utgåvan alltså inte den nyhet rubrikerna antyder. Serverfallet, där modellen körs på en maskin och klienten på en annan, ligger fortfarande utanför det som dokumenteras här; hur de rollerna skiljer sig åt står i guiden till körsätten.

Den andra punkten är ordningsföljd, inte ett hinder: modellen ska vara nedladdad innan du sätter upp integrationen. Det är rimligt — Ollama ska kunna erbjuda dig något att peka klienten mot. Vilken modell som passar din uppgift är en egen fråga, och den ligger kvar hos modellnavet.

Den tredje punkten är den som kostar pengar. Molnmodeller kräver inloggning och påslagna molnmodeller, och Ollamas dokumentation skriver att vissa modeller kräver en betald plan. Vilka modeller det gäller står inte på integrationssidan, och inget belopp anges där. Räkna alltså inte med att kunna välja fritt i modellistan bara för att integrationen är påslagen.

Slå på integrationen i tre steg

Uppsättningen är kort och sker i Ollamas eget gränssnitt, inte i en konfigurationsfil du redigerar för hand.

  1. Öppna Ollama och välj Apps. Det är appmenyn i skrivbordsprogrammet, inte en inställning i terminalen.
  2. Slå på Claude. Ett reglage per klient.
  3. Låt Ollama sköta installationen om Claude saknas. Dokumentationen anger att Ollama erbjuder sig att ladda ned och slutföra installationen av klienten.

Modellbytet görs på ett annat ställe än påslaget, vilket är lätt att missa. Öppna Ollamas inställningar, välj modell under Apps och välj sedan att starta om Claude. Omstarten är en del av bytet enligt dokumentationen, så räkna med att klienten går ner och upp igen när du provar en annan modell. Samma Ollama-modell kan tilldelas fler än ett alternativ. Dokumentationen säger däremot inget om hur flera användningslägen påverkar samtidiga anrop eller minne; mät det på din egen maskin och styr hur länge modellen ligger kvar med keep-alive.

Vad som körs lokalt – och vad som lämnar datorn

Det här är frågan sajten finns för, och svaret är delat. Väljer du en lokal modell körs själva inferensen på din maskin, som vilken annan Ollama-modell som helst. Väljer du en molnmodell gör den inte det: Ollamas dokumentation beskriver molnmodeller som automatiskt avlastade till Ollamas molntjänst, med inloggning som förutsättning. Prompten och den kontext klienten skickar med lämnar då datorn. Vad Ollama loggar eller sparar av det säger integrationssidan ingenting om, så anta inget åt något håll utan läs villkoren.

Webbsökningen är den punkt som oftast missförstås. Den anges som stödd som standard i integrationen och går via Ollamas egen websökning — som är en tjänst hos Ollama, inte en funktion i din maskin. Dokumentationen beskriver den som anrop mot ollama.com/api/web_search och ollama.com/api/web_fetch, med krav på ett Ollama-konto och en API-nyckel. En sökning innebär alltså att din sökfråga går till Ollamas servrar, även när modellen som formulerade frågan kör lokalt.

Praktiskt betyder det att "lokalt" i den här integrationen är en egenskap hos en komponent, inte hos hela arbetsflödet. Ett arbetspass där du kör en lokal modell och låter agenten söka på nätet är delvis lokalt och delvis inte, och det är precis den distinktionen som är svår att förklara i efterhand om någon frågar var ett känsligt textstycke tog vägen. Metoden för att svara på den frågan — inventera nätverk, lagring, loggar och radering i stället för att lita på en etikett — står i integritetsguiden.

De fyra funktionerna dokumentationen räknar upp

Integrationssidan listar fyra stödda funktioner. Listan är källans uppräkning av vad kopplingen stöder, inte en fullständig funktionskarta över klienten:

Två av de fyra är värda en tanke innan du slår på dem mot en lokal modell. Subagenter kan ge fler eller överlappande anrop mot samma modell, vilket flyttar frågan från hastighet till kapacitet: en modell som svarar behagligt på en tråd kan bli tydligt långsammare om flera agenter arbetar parallellt mot samma minne. Auto-läget flyttar beslutet om när du tillfrågas från dig till agenten, vilket är en helt annan riskprofil än en chatt där du godkänner varje steg. Ingen av de effekterna är mätt av Ollama, och den här texten mäter dem inte heller.

Resten av utgåvan är sju punkter för agentklienter

Utöver Claude Desktop-avsnittet innehåller noteringen sju punkter: fyra under cacheförbättringar och tre under övriga ändringar. Cachepunkterna hänger ihop med just den här sortens klient. En hängning när agentklienter avbryter långa prefills är rättad. Avbrutna prefills behåller nu de återställningspunkter de passerat, så att ett omförsök återupptas i stället för att börja om. Återupptagna prefills registrerar inte längre återställningspunkter som inte täcker det de utger sig för att täcka — noteringen anger fallet att en förfrågan som matchade 46k av 47k token tvingades bearbeta om från noll på modeller med rekurrenta lager.

Den fjärde punkten är den mest talande: Claude Codes systemmeddelande med kvarvarande tokenantal är avstängt, eftersom Ollama flyttade det först i prompten och därmed slog sönder KV-cachen vid varje anrop. En räknare som ändras för varje svar, placerad först i prompten, gör varje ny förfrågan unik för cachen. Ser du oväntat långa väntetider med en agentklient kan orsaken alltså ligga i föränderlig klientmetadata och inte bara i modellen. Hur den typen av vinst mäts, och vilken mätpunkt som faktiskt rör sig, hör hemma i genomgången av 0.32.15 och tiden till första token. Ingen av rättningarna kommer med en mätt tidsvinst i noteringen.

De tre övriga punkterna berör en startare för DeepSeek Harness som faller tillbaka på npx, en uppdatering av MLX-beroendet och en rättning av trasiga paketeringsstandarder som orsakades av macOS-specifika antaganden i Linux- och Windowsbyggen. Den sista är värd att notera för symmetrins skull: samma utgåva som ger macOS en ny integration rättar också en bugg som macOS-antaganden orsakade på andra plattformar.

Så kopplar du bort igen

Bortkopplingen är dokumenterad, och det är ett gott tecken. Det finns tre vägar: slå av Claude under Apps i Ollama, kör terminalkommandot ollama launch claude-desktop --restore, eller avsluta Ollama medan Claude är anslutet. Alla tre återställer enligt dokumentationen Claudes tidigare konfiguration, och är klienten öppen frågar Ollama om omstart så att ändringen får effekt.

Prova bortkopplingen samma dag som du slår på integrationen, inte den dag du behöver den. Det är samma princip som gäller för varje annan ändring i en körmiljö: en återställning du har provat en gång är en åtgärd, en återställning du har läst om är ett antagande. Notera också vilken version av Ollama du körde när du slog på kopplingen, så att du kan skilja en förändring i klientens beteende från en förändring i runtimen.

Innan du kallar arbetsflödet lokalt

Fyra kontroller räcker för att veta vad du faktiskt har satt upp:

Rubriken att Claude Desktop nu kan köras mot en lokal modell är korrekt så långt den räcker. Den räcker till macOS, till den modell du själv har laddat ned och till den del av arbetet som inte går ut på nätet. Väljer du i stället en molnmodell eller låter agenten söka på webben använder arbetsflödet fortfarande Ollamas molntjänster, med inloggning och i vissa fall en betald plan — och skillnaden mot att styra ett molnverktyg från en chattklient, som Perestrojka beskriver från andra hållet, är mindre än den ser ut när båda funktionerna är påslagna samtidigt.

Källor

Källorna kontrollerades 26 augusti 2026, då v0.33.0 var den senaste utgåvan. Plattformsuppgiften, kravlistan och funktionslistan är hämtade ur Ollamas dokumentation samma dag och kan ändras utan att versionsnumret ändras. Ingen egen installation och ingen egen mätning ligger bakom texten. Nästa kontroll sker när Ollama publicerar en utgåva efter v0.33.0 eller senast 26 november 2026.

Nästa steg

Skriv ned vilken modell integrationen pekar på och om webbsökningen är påslagen, innan du börjar använda den på riktigt material.

Rita datagränsen