
LM Studios blogginlägg den 18 september 2026 presenterar Splash, en inferensmotor med öppen källkod från Inco AI för att köra språkmodeller lokalt på Apple Silicon. Inlägget innehåller två saker som drar åt olika håll: hastighetstal som är lätta att bli sugen på, och en kravlista som sorterar bort en stor del av alla Mac-datorer i bruk. Läs kravlistan först. Den tar två minuter och avgör om resten av artikeln är relevant för dig.
Källmeningen är en kombination, inte en meny: Splash kräver en Mac med M3 eller nyare, macOS 26.4 eller senare och minst 36 GB unified memory. Inco rekommenderar 48 GB eller mer. Dessutom behöver du LM Studio Bionic 1.1.5 eller nyare. Faller en av raderna är det inte ett frågetecken i marginalen — det är ett av motorns uttalade krav som inte uppfylls.
Kontrollera maskinen, inte känslan av den
Chipgenerationen och minnesmängden läser du av under Apple-menyn och Om den här datorn; macOS-versionen står på samma ställe, och LM Studios version under appens egen om-ruta. Notera alla tre i klartext innan du går vidare, för varje rad i kravlistan är en egen tröskel. En M2 Max med 64 GB uppfyller minneskravet men inte kravet på M3 eller nyare. En M4 med 24 GB uppfyller chipkravet men inte minneskravet. Skillnaden mellan 36 GB som minimum och 48 GB som rekommendation kommer också från leverantören själv, vilket är värt att ta på allvar när en modell i 27-miljardersklassen ska hållas resident.
Det här är samma sorts avstämning som hårdvarusidan beskriver för minnesräkning i allmänhet: kapaciteten avgör vad som över huvud taget går att köra, långt innan modellnamnet blir intressant. Notera att LM Studios inlägg inte säger vad som händer om kraven inte uppfylls. Sidan beskriver ingen felbild, ingen varning och ingen reservbackend. Att gissa att motorn "nog faller tillbaka på Metal ändå" är just en gissning, så hantera kraven som villkor för att alls installera.
Två modeller — hela listan, inte ett urval
Splash är enligt inlägget optimerad särskilt för Qwen3.6-35B-A3B och Qwen3.8-27B, och motorn ger GPU-kärnor och en minnesplan anpassad till varje modell som stöds. Det är hela listan i källan vid kontrollen: två modeller, två nedladdningslänkar. Splash-byggena hämtas som incoai/Qwen3.8-27B-Splash och incoai/Qwen3.6-35B-A3B-Splash. Har du en annan favoritmodell i biblioteket är den inte med i den här omgången.
Varje modell levereras dessutom med en egen DFlash 2-draftmodell för spekulativ avkodning, som enligt inlägget förbättrar genereringshastigheten. Hur stor del av farten som kommer därifrån står inte i källan, så behandla det som en beskrivning av mekanismen och inte som en siffra du kan räkna med. Vill du förstå vad draftmodeller gör med genomströmning i LM Studio i allmänhet beskriver mätningen av draft-motorer uppställningen; den mäter en annan motor, och talen därifrån flyttas inte hit.
Aktivering: en experimentell backend, med det ordet kvar
Vägen i appen är kort. Installera LM Studio Bionic 1.1.5 eller nyare och öppna appen. Gå till Settings och Runtime, och klicka Download bredvid Splash (Metal) under rubriken Experimental backends. Gå sedan till Settings och Explore, klistra in en av Hugging Face-länkarna i sökfältet, välj modellen och klicka Download. När nedladdningen är klar startar du en ny session och väljer modellen i den lokala modellväljaren.
Ordet Experimental står i appens egen rubrik och är en del av uppgiften, inte en formalitet. En experimentell backend är rimlig att prova på en maskin där du kan backa, och mindre rimlig att lägga under något som andra är beroende av. Inlägget nämner ingen nedladdningsstorlek, så räkna med att kontrollera diskutrymmet själv innan du startar hämtningen av en modell i den här storleksklassen.
Siffrorna i inlägget är leverantörens, mätta på leverantörens maskin
Så här lyder talen, med sin avsändare intakt: i Incos egna tester på en 48 GB M5 Pro gav Splash ungefär dubbla avkodningshastigheten mot den näst snabbaste motor de mätte på Qwen3.8-27B — 74 token per sekund på korta prompter och 54 token per sekund vid 32K kontext. Med fyra samtidiga förfrågningar på korta prompter nådde den sammanlagda genomströmningen 170 token per sekund, vilket inlägget anger som 3,9 gånger den näst snabbaste motorn i deras jämförelse.
Fyra detaljer avgör hur du ska läsa detta. Maskinen är en 48 GB M5 Pro, alltså över den rekommenderade nivån och långt över minimikravet. Modellen är den mindre av de två. Talet 170 är en sammanlagd genomströmning över fyra parallella förfrågningar, inte hastigheten du ser i ett enskilt svar. Och jämförelsemotorn namnges inte — källan säger "den näst snabbaste motorn i deras jämförelse" utan att tala om vilken den är, vilken kvantisering som användes eller hur många körningar talen bygger på. Inlägget hänvisar vidare till Incos egen blogg för mer, en sida som den här artikeln inte har läst och inte uttalar sig om.
Mät samma sak på din egen burk
Kör två rader per mått: en med din nuvarande backend och en med Splash, med allt annat fryst. Samma modellbygge i den mån det går, samma prompt, samma kontextlängd, samma antal begärda token och samma samtidighetsgrad. Kolumnerna nedan motsvarar exakt de mått källan anger, så att dina egna tal blir jämförbara i form även när maskinen skiljer sig. Kör varje rad minst tre gånger och redovisa medianen, inte den snabbaste körningen.
| Mått | Nuvarande backend | Splash (Metal) |
|---|---|---|
| Korta prompter, token/s (1 förfrågan) | — | — |
| 32K kontext, token/s (1 förfrågan) | — | — |
| 4 samtidiga korta prompter, sammanlagd token/s | — | — |
| Tid till första token, sekunder | — | — |
Cellerna är tomma med flit: det finns inga egna mätvärden i den här artikeln. Anteckna maskin, chip, minnesmängd, macOS-version, LM Studio-version, modelltagg och kvantisering bredvid tabellen — utan dem är raderna inte jämförbara nästa gång. Kör du på PC i stället för Mac gäller inget av detta; där är Qwen3.8 på AMD Ryzen den mätning som beskriver din uppställning, och Splash berör dig inte alls.
Anteckna valet innan du glömmer varför
Läs sedan av resultatet mot ett krav du skrev före testet: klarar svaren din faktiska uppgift på den tid mätningen visar? En backend som är dubbelt så snabb på papperet är ointressant om kvaliteten faller på den uppgift du faktiskt kör. Skriv in raden på driftkortet i driftguiden: vald backend, dess version, modelltagg, dina mätvärden, datum och en väg tillbaka till den backend du körde innan. Eftersom Splash är märkt som experimentell är återställningsvägen den del du är minst benägen att skriva ned och mest sannolikt kommer att behöva.
Källor
Källan kontrollerades 23 september 2026 och är publicerad 18 september 2026. Uppgifterna om krav, modellstöd, aktiveringsväg och hastighet är hämtade ur LM Studios inlägg. Hastighetstalen är Incos egna, mätta på en 48 GB M5 Pro på Qwen3.8-27B; inlägget anger inte kvantisering, antal körningar eller vilken motor som utgör jämförelsen. Modellistan återges fullständig med de två modeller källan namnger vid kontrollen. Inlägget namnger ingen licens utöver att motorn beskrivs som öppen källkod, och säger inget om vad som sker när kraven inte uppfylls. Inga egna körningar eller mätvärden publiceras; tabellen är ett testprotokoll.