Mindre språkmodeller (SLM): när små modeller slår de stora
Alla har stirrat på parameterantalet. Fler miljarder, bättre modell — så har berättelsen låtit sedan GPT-3. Men de senaste två åren har något annat hänt: modeller på tre, fyra eller åtta miljarder parametrar löser vardag
Innehåll
Alla har stirrat på parameterantalet. Fler miljarder, bättre modell — så har berättelsen låtit sedan GPT-3. Men de senaste två åren har något annat hänt: modeller på tre, fyra eller åtta miljarder parametrar löser vardagsuppgifter så bra att skillnaden mot jättarna knappt syns i praktiken. Och de kör lokalt, på din laptop eller telefon, utan att en enda rad text lämnar enheten.
Vad räknas som en "liten" språkmodell?
Det finns ingen officiell gräns, men i branschen brukar man dra strecket runt 10 miljarder parametrar. Allt under det kallas SLM — small language model. Jämför med de stora frontmodellerna, där parameterantalet sällan publiceras men uppskattas i hundratals miljarder.
Poängen är inte storleken i sig utan vad den möjliggör. En modell på 3–4 miljarder parametrar i kvantiserat format tar ungefär 2–3 GB i minne. Det ryms i en mobiltelefon. Apples egen enhetsmodell i Apple Intelligence ligger på omkring 3 miljarder parametrar, enligt Apples egen tekniska genomgång från 2025.
Siffrorna som fick alla att haja till
Vändpunkten kom i april 2024 när Microsoft släppte Phi-3-mini. I den tekniska rapporten (arXiv:2404.14219) visade forskarna att en modell på 3,8 miljarder parametrar, tränad på 3,3 biljoner noggrant utvalda tokens, presterade i nivå med modeller flera gånger större på standardtester som MMLU. Receptet var inte mer data — det var bättre data.
Sedan följde de andra. Meta lanserade Llama 3.2 med 1B- och 3B-varianter i september 2024, uttalat byggda för mobiler och edge-enheter. Mistral kom med Ministral 3B och 8B i oktober samma år. Google följde upp med Gemma 3 i mars 2025, där den minsta varianten ligger på 1 miljard parametrar.
Därför är AI-agenter små modellers bästa argument
Ett forskarlag på NVIDIA gick längre än så. I artikeln "Small Language Models are the Future of Agentic AI" (arXiv:2506.02153, juni 2025) argumenterade de för att små modeller är tillräckligt kapabla, mer lämpade och betydligt billigare för de flesta uppgifter i agentsystem.
Logiken är enkel. En AI-agent gör sällan något genialt i varje steg — den läser ett mejl, klassificerar det, plockar ut ett datum, anropar ett API. Att skicka varje sådant mikrosteg till en frontmodell är som att ringa en specialistläkare för att få ett plåster. Vill du se hur det ser ut i praktiken har vi gått igenom hur svenska företag bygger sina agentflöden.
Fyra lägen där små modeller faktiskt vinner
Känslig data. Journaler, personuppgifter, avtalsutkast. Kör modellen lokalt så lämnar informationen aldrig huset. Det gör efterlevnadsfrågan dramatiskt enklare.
Höga volymer. Ska du klassificera 50 000 supportärenden i månaden blir kostnaden per anrop det enda som spelar roll. En lokal 3B-modell kostar el, inte API-krediter.
Latens. Ingen nätverksresa betyder svar på tiondelar av en sekund. För röststyrning och autocomplete är det skillnaden mellan användbart och irriterande.
Offline. Fältarbete, fartyg, vård utan täckning. Modellen fungerar ändå.
Där de fortfarande förlorar
Var ärlig med begränsningarna. Små modeller är sämre på flerstegsresonemang, långa kontextfönster och nischad faktakunskap. De hallucinerar oftare när frågan ligger utanför träningsdatan. Och för svenska specifikt är kvaliteten ojämn — de flesta SLM:er är tränade med engelsk tyngdpunkt.
Det finns ett svenskt undantag värt att känna till: GPT-SW3, byggd av AI Sweden tillsammans med RISE och WASP, i storlekar från 126 miljoner upp till 40 miljarder parametrar och tränad på nordiska språk.
Regelverket gör lokala modeller mer attraktiva
EU:s AI-förordning, förordning (EU) 2024/1689, trädde i kraft 1 augusti 2024. Reglerna för modeller med allmänt ändamål (GPAI) började tillämpas 2 augusti 2025, och enligt artikel 113 blir huvuddelen av förordningen tillämplig från 2 augusti 2026.
För dig som bygger något med AI betyder det i praktiken att dataflöden måste kunna redovisas. En modell som kör på egen hårdvara har ett kortare och tydligare svar på den frågan än en molntjänst i tredje land. Vi har jämfört avvägningarna mer i detalj i vår genomgång av open source mot proprietära AI-modeller.
Så testar du själv — på en kvart
Ladda ner Ollama eller LM Studio, båda gratis och finns för Windows, Mac och Linux. Hämta en modell på 3–8 miljarder parametrar. Kör dina tio vanligaste prompter genom den och jämför med det du använder idag.
Har du en Mac med Apple Silicon eller en PC med minst 16 GB RAM går det smärtfritt. Vill du hellre börja i molnet är Mistral Le Chat och DeepSeek två bra ingångar till modellfamiljer som också finns i mindre, nedladdningsbara varianter.
Takeaway
Sluta fråga vilken modell som är bäst. Fråga vilken som är tillräckligt bra för just din uppgift — och räkna sedan på kostnad, latens och var datan hamnar. För en förvånande stor del av vardagsjobbet är svaret en modell du kan köra själv. Spara frontmodellerna till de svåra frågorna.
Vanliga frågor
- En modell på 3–4 miljarder parametrar i kvantiserat format tar ungefär 2–3 GB i minne. Det gör att den ryms i en mobiltelefon. Apples enhetsmodell i Apple Intelligence ligger enligt Apples tekniska genomgång från 2025 på omkring 3 miljarder parametrar.