Google släppte Gemma 4 med fyra storlekar, från en liten E2B-modell till en tät 31-miljarders flaggskeppsmodell. Microsoft svarar med sin Phi-4-familj, som i mars 2026 fick tillskottet Phi-4-reasoning-vision-15B utan att någon Phi-5 dykt upp. Båda är öppna vikter, båda är gratis att ladda ner, och båda konkurrerar om samma nisch: AI som kan köras lokalt, på egen server eller på ett grafikkort som får plats i en vanlig arbetsstation. Frågan svenska utvecklare och IT-avdelningar ställer sig är enkel. Vilken av de två småmodell-familjerna ger mest nytta per gigabyte VRAM, och vilken passar bäst för drift i Sverige och övriga Norden där datalagring och GDPR ofta avgör vilken molntjänst som ens är tillåten?
Den här jämförelsen går igenom specifikationer, officiella benchmarkresultat från både Google DeepMind och Microsoft, licensvillkor, kostnad, verkliga användningsfall och en konkret migrationsguide. Vi drar även in Meta Llama 3.2, Mistral Small 4 och Alibabas Qwen3.5 som en tredje källa för att se hur Gemma 4 och Phi-4 står sig mot resten av fältet av små öppna modeller under 2026.
Vi har hållit oss strikt till siffror som Google och Microsoft själva publicerat i sina officiella modellkort och tekniska rapporter. Där tillverkarna inte redovisat ett mått, till exempel exakt kontextfönster för Gemma 4, säger vi det rakt ut istället för att gissa. Det gör jämförelsen mindre spektakulär på vissa punkter, men desto mer pålitlig för den som faktiskt ska fatta ett inköps- eller arkitekturbeslut baserat på den.
Vad är Gemma 4 och Phi-4, egentligen?
Gemma 4 är Google DeepMinds fjärde generation öppna viktmodeller, byggda på samma forskning som ligger bakom Gemini-familjen men paketerade för nedladdning och lokal körning. Enligt Googles egen lanseringsblogg “Gemma 4: Byte for byte, the most capable open models” kommer familjen i fyra varianter: E2B, E4B, en MoE-modell kallad 26B A4B och en tät 31B-modell. Vikterna går att hämta gratis via Hugging Face, Kaggle och Ollama, och Google positionerar hela familjen mot agentisk AI och kodning snarare än ren chattbotanvändning.
Phi-4 är i sin tur Microsofts svar på samma trend, men med en annan filosofi. Grundmodellen Phi-4 på 14 miljarder parametrar släpptes redan i december 2024, tränad med mycket syntetisk data för att pressa ut mer resonemang per parameter. Sedan dess har Microsoft byggt ut familjen med Phi-4-mini-instruct (3,8 miljarder parametrar, februari 2025) och till sist Phi-4-reasoning-vision-15B i mars 2026, en 15 miljarder parametrar stor multimodal resonemangsmodell. En oberoende genomgång av Phi-familjen konstaterar rakt av att det per juli 2026 inte finns någon allmänt tillgänglig Phi-5, vilket gör Phi-4-generationen till Microsofts nuvarande small-model-flaggskepp.
Skillnaden i strategi är tydlig redan här. Google skalar en och samma arkitektur i fyra storlekar för att täcka allt från telefon till server. Microsoft bygger snarare en samling specialiserade modeller, en liten instruct-modell för enkel drift och en större resonemangsmodell för tyngre uppgifter, alla under MIT-licens.
Anledningen till att småmodeller överhuvudtaget blivit en egen kategori handlar om ekonomi lika mycket som om teknik. Att köra en frontier-modell som Gemini eller GPT-5.x i molnet kostar per token, och för ett företag som skickar miljontals anrop varje månad blir notan snabbt en budgetfråga för ledningsgruppen. En modell som Gemma 4 E4B eller Phi-4-mini-instruct går istället att äga helt, köra på egen hårdvara, och skala utan att kostnaden växer linjärt med användningen. Det är också därför båda tillverkarna lagt så mycket kraft på just agentiska och kodrelaterade uppgifter i sina benchmarks. Det är där småmodellerna faktiskt konkurrerar med de stora, snarare än att bara vara en billigare men sämre kopia.
För nordiska bolag finns en till drivkraft: datasuveränitet. Så många av de senaste AI-nyheterna under 2026 har handlat om just var data faktiskt hamnar, och en modell som kan köras i ett svenskt eller finskt datacenter, eller för den delen på en enskild kontorsserver, tar bort en hel del av den diskussionen på förhand.
Specifikationer i detalj: Gemma 4 mot Phi-4
Gemma 4-familjen
Gemma 4 E2B är den minsta modellen och tänkt för enheter med begränsat minne, som telefoner eller enkla edge-datorer. E4B ligger ett steg upp och passar bärbara datorer eller små servrar. 26B A4B är en Mixture-of-Experts-modell där bara en delmängd av parametrarna aktiveras per token, vilket håller nere beräkningskostnaden trots det höga totalantalet. Toppmodellen 31B är tät (dense), vilket betyder att alla parametrar räknar på varje token, och den är den variant Google jämför direkt mot Gemma 3 27B i sitt eget modellkort.
Phi-4-familjen
Phi-4 på 14 miljarder parametrar är en tät modell byggd för resonemang, matte och kod snarare än bred allmänbildning. Phi-4-mini-instruct på 3,8 miljarder parametrar är den variant Microsoft själva pekar ut som mest lämpad för mobil och edge-drift. Phi-4-reasoning-vision-15B är den senaste och största medlemmen, med stöd för bild plus text i samma resonemangsmodell. Samtliga tre delar MIT-licensen, vilket är en av de mest tillåtande licenserna som finns för öppen programvara.
Namngivningen i Phi-4-familjen skiljer sig alltså från Gemma 4:s rena storleksbeteckningar. Microsoft namnger istället varje modell efter dess huvudsakliga syfte, mini-instruct för enkel instruktionsföljning, reasoning för tyngre logiska kedjor, och reasoning-vision när bildförståelse läggs till. Det gör det något svårare att jämföra rakt av mellan storlekar, men enklare att välja rätt modell utifrån vilken typ av uppgift som faktiskt ska lösas, snarare än att behöva räkna ut vilken storlek som krävs för ett visst prestandamål.
| Egenskap | Gemma 4 | Phi-4 |
|---|---|---|
| Utvecklare | Google DeepMind | Microsoft |
| Släppt (senaste medlem) | 2026 (familjen) | Mars 2026 (Phi-4-reasoning-vision-15B) |
| Minsta storlek | E2B (effektivt ~2B) | Phi-4-mini-instruct, 3,8B |
| Största storlek | 31B (tät) | Phi-4-reasoning-vision-15B, 15B |
| Arkitektur | Tät (E2B, E4B, 31B) och MoE (26B A4B) | Tät i samtliga varianter |
| Licens | Gemma-licensen (Apache 2.0-baserad, egna Google-villkor) | MIT |
| Multimodalt stöd | Ja, i samtliga fyra storlekar | Ja, i Phi-4-reasoning-vision-15B |
| Distributionskanaler | Hugging Face, Kaggle, Ollama | Hugging Face, GitHub, Microsoft Foundry |
| Inriktning enligt tillverkaren | Agentisk AI och kodning | Resonemang, matte och multimodal analys |
| Kostnad för vikterna | Gratis nedladdning | Gratis nedladdning |
| Kommersiell användning | Tillåten under Gemma-licensen | Tillåten under MIT |
En lucka i dokumentationen: Google har inte offentliggjort exakta kontextfönster per storlek i det officiella Gemma 4-modellkortet, så vi undviker att gissa här. Fristående tekniska genomgångar nämner betydligt större kontext för 26B A4B och 31B än för E2B och E4B, men eftersom siffrorna inte bekräftas direkt av Google utelämnar vi dem hellre än att chansa.
Distributionskanalerna spelar också roll för hur snabbt man kommer igång. Gemma 4 finns redan förpackad som färdiga Ollama-avbilder direkt vid lansering, vilket innebär att en utvecklare kan hämta och köra modellen med ett enda kommando utan att själv behöva konvertera vikterna till ett kvantiserat format. Phi-4-familjen distribueras i första hand via Hugging Face och GitHub, och når Ollamas bibliotek först när community eller Microsoft själva paketerat om filerna till GGUF-format, vilket historiskt tagit allt från några dagar till några veckor efter en ny release. Den skillnaden är sällan avgörande, men den är värd att räkna in om ett projekt har en snäv deadline och behöver köra dag ett.
Prestanda: Googles egna siffror för Gemma 4
Google DeepMinds officiella modellkort för Gemma 4 anger resultat på sex olika tester för samtliga fyra storlekar. Här är den fullständiga tabellen, hämtad direkt från tillverkarens egen dokumentation snarare än tredjepartslistor.
| Test | E2B | E4B | 26B A4B | 31B |
|---|---|---|---|---|
| MMLU Pro | 60,0% | 69,4% | 82,6% | 85,2% |
| AIME 2026 (utan verktyg) | 37,5% | 42,5% | 88,3% | 89,2% |
| LiveCodeBench v6 | 44,0% | 52,0% | 77,1% | 80,0% |
| Codeforces ELO | 633 | 940 | 1718 | 2150 |
| GPQA Diamond | 43,4% | 58,6% | 82,3% | 84,3% |
| Tau2 (agentiskt genomsnitt) | 24,5% | 42,2% | 68,2% | 76,9% |
Mönstret är rakt igenom detsamma. Ju större modell, desto brantare kurva uppåt, och språnget mellan E4B och 26B A4B är störst på nästan alla mått. På AIME 2026 hoppar resultatet från 42,5% till 88,3% mellan just dessa två storlekar, ett tecken på att MoE-arkitekturen ger 26B A4B tillgång till betydligt mer kapacitet än vad de aktiva parametrarna ensamma antyder. Codeforces ELO på 2150 för 31B-modellen placerar den i nivå med starka tävlingsprogrammerare, långt över vad man normalt förväntar sig av en modell i den storleksklassen.
Tau2-resultaten förtjänar extra uppmärksamhet eftersom det är just det testet som mäter agentisk förmåga, alltså hur väl modellen kan planera flera steg och anropa externa verktyg i rätt ordning. Att 31B-modellen når 76,9% medan E2B stannar på 24,5% visar hur känsligt agentiskt beteende är för modellstorlek. Det är en viktig lärdom för team som planerar att bygga chattbottar med verktygsanrop: en liten modell kan svara flytande på frågor men ändå misslyckas med att faktiskt utföra flerstegsuppgifter tillförlitligt. GPQA Diamond-resultatet på 84,3% för 31B-modellen är dessutom högre än vad flera betydligt större proprietära modeller redovisat under samma period, vilket understryker hur mycket träningsmetodik betyder jämfört med ren parameterstorlek.
Prestanda: Microsofts siffror för Phi-4
Microsofts tekniska rapport för grundmodellen Phi-4 (14B) jämför den direkt mot både mindre och större konkurrenter, inklusive Googles och Alibabas modeller vid tidpunkten för lanseringen. Siffrorna nedan kommer från Microsofts egen tabell.
| Modell | MMLU | GPQA |
|---|---|---|
| Phi-4 (14B) | 84,8% | 56,1% |
| Qwen2.5-14B-Instruct | 79,9% | 42,9% |
| GPT-4o-mini | 81,8% | 40,9% |
| Llama-3.3-70B-Instruct | 86,3% | 49,1% |
| Qwen2.5-72B-Instruct | 85,3% | 49,0% |
| GPT-4o | 88,1% | 50,6% |
Det slående är GPQA-kolumnen. Phi-4 slår med sina 56,1% samtliga modeller i tabellen på just den frågeställningsbenchmarken, inklusive GPT-4o och Llama-3.3-70B som båda är mångdubbelt större. Microsoft har konsekvent hävdat att Phi-4:s styrka kommer från träningsdata snarare än råstorlek, och GPQA-resultatet stödjer den tesen. HumanEval landar på 82,6% för Phi-4, och på MATH-benchmarken når modellen 80,4%.
För den mindre Phi-4-mini-instruct (3,8B) publicerar Microsoft istället en Arena Hard-tabell, ett mått som bygger på huvud-mot-huvud-jämförelser i LMSYS Chatbot Arena-stil. Här ställs Phi-4-mini-instruct mot flera jämnstora och dubbelt så stora modeller.
| Modell | Parametrar | Arena Hard |
|---|---|---|
| Llama-3.2-3B-Instruct | 3B | 17,0 |
| Mistral-3B | 3B | 26,9 |
| Qwen-2.5-3B-Instruct | 3B | 32,0 |
| Phi-4-mini-instruct | 3,8B | 32,8 |
| Phi-3.5-mini-instruct | 3,8B | 34,4 |
| Mistral-8B-2410 | 8B | 37,3 |
| Llama-3.1-8B-Instruct | 8B | 25,7 |
| Llama-3.1-Tulu-3-8B | 8B | 42,7 |
| Gemma-2-9B-Instruct | 9B | 43,7 |
| Qwen-2.5-7B-Instruct | 7B | 55,5 |
| GPT-4o-mini-2024-07-18 | okänt (proprietär) | 53,7 |
Phi-4-mini-instruct slår alla 3B-modeller i tabellen, inklusive Qwen-2.5-3B-Instruct och Llama-3.2-3B-Instruct, men hamnar bakom både Qwen-2.5-7B-Instruct och Googles egen Gemma-2-9B-Instruct som är nästan dubbelt så stor. Det ger en tydlig fingervisning om var brytpunkten går: under 4 miljarder parametrar är Phi-4-mini-instruct stark, men så fort konkurrenterna växer förbi 7 miljarder tar de över.
Läser man Microsofts fullständiga modellkort för Phi-4 på Hugging Face framgår det också att bolaget lagt stor vikt vid säker och förutsägbar output, ett krav som ofta kommer från just de myndighets- och sjukvårdskunder som Phi-4-mini-instruct riktas mot. Det förklarar varför Phi-4-familjen presterar jämnare över olika typer av frågor snarare än att toppa enstaka benchmarks, en profil som passar organisationer som hellre vill ha en pålitlig baslinje än en modell som briljerar på vissa uppgifter och missar på andra.
Tredje källan: hur klarar de sig mot Llama, Mistral och Qwen?
För att inte bara luta oss mot Googles och Microsofts egna siffror har vi jämfört mot en tredje uppsättning tillverkardokumentation, från Meta, Mistral AI och Alibaba. Metas Llama 3.2-familj lanserades redan i september 2024 med två renodlade edge-modeller på 1 och 3 miljarder parametrar, licensierade under Metas egen Llama-licens som tillåter kommersiell användning så länge man följer Metas villkor för acceptabel användning.
Mistral AI gick en annan väg med Mistral Small 4, som släpptes i mars 2026. Det är en Mixture-of-Experts-modell med 119 miljarder parametrar totalt, men bara omkring 6 miljarder aktiva per token enligt lanseringsbloggen (dokumentationen anger 6,5 miljarder, en mindre avvikelse mellan Mistrals egna källor). Föregångaren Mistral Small 3, en tät 24B-modell under Apache 2.0-licens, publicerade ett eget jämförelsetest där den nådde 66,3% på MMLU Pro och 45,3% på GPQA, klart under Gemma 4:s 31B-resultat men i linje med Phi-4:s nivå på mindre krävande uppgifter. Mistral Small 3 redovisade dessutom 87,3% på Arena Hard och 82,9% på IFEval, vilket sätter den nära Gemma-2-9B-Instructs nivå i Microsofts tabell ovan.
Alibabas Qwen3.5-familj, som rullades ut i februari och mars 2026, sträcker sig från en flaggskeppsmodell på 397 miljarder parametrar (varav 17 miljarder aktiva) ner till en liten variant på bara 0,8 miljarder parametrar, samtliga under Apache 2.0-licens. Den lilla Qwen3.5-varianten konkurrerar direkt med Gemma 4 E2B och Phi-4-mini-instruct om samma nisch: modeller som får plats i en mobiltelefon eller en Raspberry Pi. Vi har tidigare gått igenom hur Qwens större modeller mäter sig mot DeepSeek på flaggskeppsnivå, och samma tillverkare visar alltså upp en betydligt bredare produktportfölj än vad många väntat sig, från 0,8 miljarder ända upp till 397 miljarder parametrar inom en och samma modellgeneration.
Slutsatsen från den tredje källan är att varken Google eller Microsoft är ensamma om att satsa på småmodeller under 2026. Konkurrensen är hårdast i intervallet 3-9 miljarder parametrar, där Qwen, Mistral, Llama, Gemma och Phi alla har egna kandidater, medan riktigt stora tät-modeller som Gemma 4 31B har färre direkta konkurrenter i just öppen-vikt-klassen. Vår genomgång av öppna AI-modeller och hur de rankas globalt visar samma trend: gapet mellan öppna och stängda modeller krymper snabbast just i de mindre storleksklasserna, inte bland flaggskeppen.
Licens och användningsrätt för svenska och nordiska bolag
Phi-4-familjens MIT-licens är förmodligen den enklaste att navigera juridiskt. MIT ställer i praktiken bara krav på att ursprunglig upphovsrättstext följer med, och lägger inga begränsningar på kommersiell användning, ombyggnad eller vidaredistribution. För en svensk startup eller ett konsultbolag som vill bygga en produkt ovanpå Phi-4 innebär det minimal juridisk friktion.
Gemma-licensen är mer specifik. Den är baserad på Apache 2.0 men Google har lagt till egna användningsvillkor ovanpå, vilket gör den till vad branschen brukar kalla en “source available”-licens snarare än en renodlad OSI-godkänd licens. Det betyder inte att kommersiell användning är förbjuden, tvärtom är den tillåten, men ett bolag som vill bygga en produkt på Gemma 4 bör faktiskt läsa igenom Googles fullständiga licenstext innan driftsättning, särskilt om produkten ska säljas vidare till tredje part.
Mistrals Apache 2.0-licens och Qwens Apache 2.0-licens ligger däremot närmare Phi-4:s MIT-licens i praktiken, även om de juridiska detaljerna skiljer sig åt mellan licenserna. Den som redan har en juridisk process för att godkänna Apache 2.0-licensierad mjukvara kan alltså återanvända en stor del av den bedömningen för Mistral Small 4 och Qwen3.5, medan Gemma 4:s egna tilläggsvillkor kräver en separat genomgång som inte täcks av en generell Apache 2.0-policy.
GDPR och datasuveränitet
Den stora fördelen med att köra en öppen småmodell lokalt, oavsett om det är Gemma 4 eller Phi-4, är att ingen indata behöver lämna den egna servern. Det löser i praktiken en stor del av GDPR-diskussionen som svenska myndigheter och sjukvårdsaktörer brottas med när de överväger amerikanska molntjänster. Så länge modellen körs på infrastruktur inom EU eller helt on-premise, och leverantörens licensvillkor tillåter det, blir frågan om personuppgiftsöverföring till tredje land irrelevant. Det gäller lika för Gemma 4 som för Phi-4, Llama 3.2, Mistral Small 4 och Qwen3.5.
EU:s AI-förordning tillför ytterligare ett lager att ta hänsyn till, eftersom öppna modeller under vissa villkor omfattas av lättare krav än stängda system med hög risk. Både Gemma 4 och Phi-4 publicerar modellkort med information om träningsdata och begränsningar, vilket underlättar den dokumentation svenska bolag ändå behöver ta fram för egna riskbedömningar. Ett företag som redan har en process för att dokumentera AI-system enligt EU-regelverket kan återanvända stora delar av den processen oavsett vilken av de två modellfamiljerna som väljs, så länge modellkortet sparas som en del av den interna dokumentationen.
Kostnad och infrastruktur: vad kostar det egentligen?
Både Gemma 4 och Phi-4 är gratis att ladda ner. Den verkliga kostnaden ligger i hårdvaran som krävs för att köra dem, och där skiljer sig de olika storlekarna kraftigt åt. Som tumregel inom branschen brukar man räkna med ungefär 2 gigabyte VRAM per miljard parametrar vid halv precision (FP16), och ungefär hälften av det vid kvantiserad 4-bitarskörning, vilket är den vanligaste driftsformen för lokala modeller via verktyg som Ollama eller llama.cpp.
| Modell | Parametrar | Ungefärlig VRAM (4-bit) | Typisk hårdvara | Licenskostnad |
|---|---|---|---|---|
| Gemma 4 E2B | ~2B | 1-2 GB | Telefon, Raspberry Pi | 0 kr |
| Phi-4-mini-instruct | 3,8B | 2-3 GB | Bärbar dator, mini-PC | 0 kr |
| Gemma 4 E4B | ~4B | 3-4 GB | Bärbar dator med dedikerat GPU | 0 kr |
| Gemma 4 26B A4B | 26B (MoE) | 13-15 GB | Konsument-GPU, t.ex. RTX-serien | 0 kr |
| Phi-4 | 14B | 8-10 GB | Konsument-GPU eller kraftfull server-CPU | 0 kr |
| Phi-4-reasoning-vision-15B | 15B | 9-11 GB | Konsument-GPU med minst 12 GB VRAM | 0 kr |
| Gemma 4 31B | 31B | 17-20 GB | Enterprise-GPU eller molnserver | 0 kr |
Siffrorna ovan är tumregelsuppskattningar snarare än officiella specifikationer, eftersom varken Google eller Microsoft publicerar exakta minneskrav per kvantiseringsnivå. Vill man istället köra modellerna via en molnleverantör som Ollama Cloud, Azure AI Foundry eller Google Vertex AI tillkommer löpande drifts- och API-kostnader som varierar mellan leverantörer och som ändras löpande, så vi rekommenderar att kolla aktuella priser direkt hos respektive leverantör innan man budgeterar ett projekt.
Ett vanligt misstag är att bara räkna på inköpspriset för grafikkortet och glömma driftskostnaden. En server med en 24 GB-GPU som kör dygnet runt drar märkbar el över ett år, och för organisationer med egna datacenter i Sverige, där elpriserna varierar kraftigt mellan årstider, kan den löpande elkostnaden på sikt bli en lika stor post som själva hårdvaruinköpet. Det är ytterligare ett skäl att fundera på om en mindre modell som Phi-4-mini-instruct eller Gemma 4 E4B faktiskt räcker för uppgiften, istället för att per automatik välja den största och mest kapabla varianten.
Kontextfönster och arkitektur i praktiken
Arkitekturvalet mellan tät modell och Mixture-of-Experts påverkar mer än bara benchmarksiffror. En tät modell som Phi-4 eller Gemma 4 31B använder alla sina parametrar på varje enskild token, vilket ger jämn och förutsägbar svarstid men kräver att hela modellen ligger i minnet samtidigt. Gemma 4 26B A4B är istället en MoE-modell, där bara en bråkdel av de 26 miljarder parametrarna aktiveras per token. Det ger snabbare inferens i förhållande till modellens totala kapacitet, men kräver mer minne för att lagra samtliga experter även om bara några få används åt gången.
Mistral Small 4 tar MoE-strategin ännu längre, med hela 119 miljarder parametrar totalt men bara 6 miljarder aktiva per token. Det gör den till en modell som kräver mycket lagringsutrymme men relativt lite beräkningskraft för själva genereringen, ett kompromissval som passar bäst för aktörer med gott om diskutrymme men begränsad GPU-kapacitet.
Ur ett rent driftsperspektiv innebär det att den som väljer en MoE-modell som Gemma 4 26B A4B eller Mistral Small 4 behöver planera för två olika flaskhalsar samtidigt: lagringsplats för samtliga experter och beräkningskraft för de experter som faktiskt aktiveras. En tät modell som Phi-4 har bara en flaskhals att ta hänsyn till, vilket gör kapacitetsplaneringen enklare även om den totala modellstorleken är mindre imponerande på pappret. För en IT-avdelning som redan har erfarenhet av att dimensionera servrar för databaser eller andra minneskrävande system är MoE-modellernas beteende ändå relativt bekant, snarare än en helt ny typ av utmaning.
Verkliga användningsfall för Gemma 4 och Phi-4
- Offline-assistent i mobilapp: En svensk bank eller e-handlare som vill erbjuda en AI-assistent utan att skicka kunddata till molnet kan bädda in Gemma 4 E2B direkt i appen, vilket håller svarstiderna låga även utan uppkoppling.
- Kodkomplettering i IDE: Ett utvecklarteam som bygger interna verktyg kan köra Phi-4 lokalt på en delad utvecklingsserver för att få kodförslag utan att källkoden lämnar det interna nätverket, vilket är särskilt relevant för myndigheter och försvarsnära bolag.
- Dokumenthantering inom vården: En region som vill sammanfatta journalanteckningar utan att bryta mot patientdatalagen kan köra Gemma 4 26B A4B on-premise, där MoE-arkitekturen håller nere hårdvarukostnaden jämfört med en lika kapabel tät modell.
- Kundtjänst-agent med verktygsanrop: Ett nordiskt SaaS-bolag som bygger en agent som ska boka möten och slå upp fakturor kan dra nytta av Gemma 4:s starka Tau2-resultat, eftersom just det testet mäter förmågan att använda externa verktyg korrekt. Samma bolag slipper dessutom bygga separat infrastruktur för varje kund, eftersom modellen kan köras per tenant på delad maskinvara utan att data blandas mellan olika kunders miljöer.
- Edge-enhet i industrin: En tillverkare som vill köra bildanalys och textgenerering direkt på en fabriksgolvsdator utan molnanslutning kan välja Phi-4-reasoning-vision-15B för dess inbyggda multimodala stöd, förutsatt att enheten har minst 12 GB VRAM.
- Juridisk dokumentgranskning: En advokatbyrå som hanterar sekretessbelagt material kan använda Gemma 4 31B för att söka igenom stora avtalsmängder på egen server, där det höga GPQA-resultatet gör modellen bättre rustad för nyanserade juridiska frågeställningar än mindre varianter.
Gemensamt för samtliga sex exempel är att beslutet sällan handlar om vilken modell som är “bäst” i absoluta tal, utan om vilken kombination av prestanda, hårdvarukostnad och juridiskt regelverk som passar den specifika verksamheten. En kommun med gamla servrar och en stor mängd känsliga persondata väger in helt andra faktorer än en spelstudio som bygger NPC-dialog för ett konsolspel. Det gäller även storleken inom respektive familj: en organisation behöver sällan hoppa direkt till den största modellen bara för att den finns tillgänglig, utan bör testa sig fram från en mindre variant och bara skala upp om kvaliteten faktiskt kräver det.
Så testar och finjusterar du modellerna själv
Ingen benchmarktabell ersätter ett test mot er egen data. Både Gemma 4 och Phi-4 går att ladda ner och köra lokalt via Ollama på under en timme, vilket gör det möjligt att sätta upp ett enkelt A/B-test innan man bestämmer sig. Ett vanligt upplägg är att samla femtio till hundra representativa frågor från den egna verksamheten, köra dem genom båda modellfamiljerna, och låta en mindre grupp anställda betygsätta svaren blint utan att veta vilken modell som svarat vad. Det är samma metodik som ligger bakom Arena Hard-testet Microsoft använder för Phi-4-mini-instruct, fast i mindre skala.
Den som vill gå längre kan finjustera modellerna mot sin egen data. Vi har tidigare gått igenom hur finjustering med Hugging Face fungerar i praktiken, och samma process går att applicera på både Gemma 4 och Phi-4 eftersom båda distribueras i format som stödjer LoRA och QLoRA, tekniker som gör det möjligt att anpassa en modell utan att träna om alla miljarder parametrar från grunden. Det sänker både tidsåtgången och hårdvarukraven avsevärt jämfört med en fullständig omträning.
Valet av körningsmotor spelar också in på faktisk prestanda i produktion. Vi har separat jämfört hur Ollama och vLLM presterar för lokal inferens, och samma slutsatser gäller för både Gemma 4 och Phi-4: Ollama är enklast att komma igång med för enskilda utvecklare, medan vLLM ger bättre genomströmning när flera användare anropar modellen samtidigt i en produktionsmiljö. Den som redan kör andra öppna modeller lokalt via Ollama kan lägga till både Gemma 4 och Phi-4 i samma infrastruktur utan att bygga något nytt från grunden.
Migrationsguide: så byter du mellan Gemma 4 och Phi-4
Att byta småmodell är sällan lika komplicerat som att byta molnleverantör, men det finns fällor att undvika. Till skillnad från ett byte mellan stora molnbaserade API:er, där man ofta bara byter en URL och en API-nyckel, påverkar ett modellbyte hela prompt-designen eftersom varje modellfamilj har sina egna vanor kring formatering, tonläge och hur den tolkar instruktioner. Här är stegen vi rekommenderar för ett team som redan kör en av modellerna och överväger att byta till den andra.
- Kartlägg vilka prompter och systeminstruktioner som är hårt knutna till den nuvarande modellens beteende, eftersom både Gemma- och Phi-familjerna reagerar olika på samma instruktioner.
- Ladda ner den nya modellen via Hugging Face eller Ollama och kör den parallellt med den gamla i en testmiljö innan produktionsbyte.
- Jämför minneskraven i tabellen ovan mot din befintliga hårdvara. Ett byte från Phi-4-mini-instruct (3,8B) till Gemma 4 26B A4B kräver till exempel en betydligt kraftigare GPU.
- Kör om era interna utvärderingstester, gärna med samma frågor som ni testade den ursprungliga modellen mot, för att fånga skillnader i tonläge och faktakvalitet.
- Uppdatera eventuella verktygsanrops-scheman. Gemma 4:s starka Tau2-resultat bygger på ett specifikt format för funktionsanrop som skiljer sig från hur Phi-4 förväntar sig att verktyg beskrivs.
- Dubbelkolla licensvillkoren på nytt. Ett byte från MIT-licensierade Phi-4 till Gemma-licensierade Gemma 4 kan kräva en ny genomgång hos juridikavdelningen, särskilt om produkten säljs vidare till kund.
- Rulla ut gradvis, till exempel genom att låta den nya modellen hantera en mindre andel av trafiken innan full övergång, så att eventuella regressioner upptäcks tidigt.
# Exempel: hämta båda modellfamiljerna lokalt via Ollama
ollama pull gemma4:4b
ollama pull phi4:14b
# Kör ett snabbt jämförelsetest med samma prompt
ollama run gemma4:4b "Sammanfatta texten nedan på svenska"
ollama run phi4:14b "Sammanfatta texten nedan på svenska"
Kommandona ovan är avsiktligt enkla, men de fångar det viktigaste med hela migrationsprocessen: att ha båda modellerna körbara sida vid sida innan något produktionsbeslut fattas. Ett team som hoppar över det steget och byter direkt i produktion riskerar att upptäcka formateringsskillnader, ändrat tonläge eller sämre svar på specifika frågetyper först när kunder eller kollegor redan reagerat, vilket är betydligt dyrare att åtgärda i efterhand än att fånga i en kontrollerad testmiljö. Räkna med minst en till två veckors parallelldrift för ett medelstort projekt innan man vågar stänga av den gamla modellen helt.
Fördelar och nackdelar
Ingen av modellfamiljerna är objektivt bättre rakt igenom, vilket den här sammanställningen visar tydligt. Vilken sida som väger tyngst beror på om organisationen prioriterar bredd i storleksval, juridisk enkelhet, eller renodlad prestanda per krona spenderad på hårdvara.
| Fördelar | Nackdelar | |
|---|---|---|
| Gemma 4 | Fyra storlekar täcker allt från telefon till server, stark på agentiska uppgifter (Tau2), toppresultat på Codeforces och AIME för de större varianterna | Licensen kräver egen juridisk genomgång, kontextfönster ej officiellt specificerat, kräver mer VRAM i toppen av familjen |
| Phi-4 | MIT-licens utan komplikationer, stark GPQA-prestanda i förhållande till storlek, bra balans mellan resonemang och resurskrav | Färre storlekar att välja mellan, mindre variant (mini-instruct) tappar mot 7B-9B-konkurrenter, ingen lika bred agent-benchmark som Tau2 publicerad |
Vilken modell passar dig? Fem rekommendationer
Baserat på specifikationerna, benchmarkresultaten och licensvillkoren ovan har vi samlat fem konkreta rekommendationer beroende på vad ni faktiskt ska bygga. Se dem som utgångspunkter snarare än absoluta regler, eftersom rätt val alltid också beror på vilken hårdvara som redan finns på plats och vilka juridiska ramar er organisation arbetar inom.
- Välj Gemma 4 E2B eller E4B om du bygger för mobil eller andra minneskänsliga enheter och kan acceptera Google-licensen.
- Välj Phi-4-mini-instruct om enkel juridisk hantering väger tyngre än sista procenten prestanda, tack vare MIT-licensen.
- Välj Gemma 4 26B A4B om du bygger agenter som ska anropa externa verktyg och API:er, givet det starka Tau2-resultatet.
- Välj Phi-4 (14B) om arbetsbelastningen är tung på matematik och vetenskapliga resonemang men hårdvaran är begränsad till en enda konsument-GPU.
- Välj Gemma 4 31B eller Phi-4-reasoning-vision-15B om du har tillgång till enterprise-hårdvara och behöver högsta möjliga kvalitet inom öppna vikter, och låt då multimodalt behov avgöra vilken av de två som passar bäst.
Slutsats: vår rekommendation
Det finns ingen självklar vinnare rakt igenom, men mönstret i sifforna är tydligt. Gemma 4 vinner på ren skalbarhet och agentisk förmåga, med fyra storlekar och ett Tau2-resultat på 76,9% för toppmodellen som ingen av konkurrenterna i den här jämförelsen matchar. Phi-4 vinner på licensenkelhet och effektivitet per parameter, där grundmodellen slår betydligt större modeller på GPQA trots att den bara har 14 miljarder parametrar.
För de flesta svenska och nordiska team utan starka skäl att undvika Googles licensvillkor blir Gemma 4 den bredare och mer flexibla familjen, tack vare spannet mellan E2B och 31B. Team som prioriterar juridisk enkelhet, särskilt konsultbolag som vidareutvecklar och säljer lösningar till kund, bör istället luta sig mot Phi-4 och dess MIT-licens. Oavsett val är slutsatsen att båda familjerna 2026 gör det fullt realistiskt att köra kompetent AI lokalt, utan att skicka en enda rad känslig data till en amerikansk molnserver.
Den bredare trenden är minst lika intressant som själva modellvalet. För bara ett par år sedan krävdes en modell på över 70 miljarder parametrar för att komma i närheten av de resultat som Gemma 4 31B och Phi-4 nu visar upp på 14 till 31 miljarder parametrar. Den utvecklingen ser inte ut att plana ut. Håll koll på både Googles och Microsofts modellsidor under resten av 2026, och räkna med att nästa generation småmodeller pressar samma prestanda ner i ännu färre parametrar och därmed ännu billigare hårdvara.
Vanliga frågor
Är Gemma 4 och Phi-4 helt gratis att använda kommersiellt?
Ja, båda familjernas vikter går att ladda ner gratis och båda licenserna tillåter kommersiell användning. Gemma-licensen har fler egna villkor från Google jämfört med Phi-4:s MIT-licens, så läs igenom villkoren innan ni bygger en betalprodukt ovanpå någon av dem.
Vilken modell kräver minst hårdvara?
Gemma 4 E2B är den minsta modellen i den här jämförelsen och går att köra på enheter med så lite som 1-2 GB VRAM vid 4-bitarskvantisering, tätt följd av Phi-4-mini-instruct på 3,8 miljarder parametrar.
Finns det en Phi-5 eller Gemma 5 att vänta på?
Nej, inte per september 2026. Microsofts senaste bekräftade Phi-familj är fortfarande Phi-4, med Phi-4-reasoning-vision-15B som senaste tillskott i mars 2026. Google har inte offentliggjort någon efterträdare till Gemma 4.
Kan jag köra dessa modeller helt utan internetuppkoppling?
Ja. Så fort vikterna är nedladdade via Hugging Face, Ollama eller motsvarande går båda modellfamiljerna att köra helt offline, vilket är en stor anledning till att de används i GDPR-känsliga miljöer inom vård och offentlig sektor.
Är Mistral Small 4 eller Qwen3.5 bättre alternativ än Gemma 4 och Phi-4?
Det beror på behovet. Mistral Small 4 med sina 119 miljarder totala parametrar (varav ungefär 6 miljarder aktiva) passar bäst där lagringsutrymme finns men GPU-kraften är begränsad. Qwen3.5:s minsta variant på 0,8 miljarder parametrar är ett alternativ för extremt resursbegränsade enheter, men saknar Gemma 4:s och Phi-4:s dokumenterade styrka på resonemangstester.
Stödjer båda modellerna svenska språket?
Båda familjerna är flerspråkigt tränade och hanterar svenska, men ingen av tillverkarna har publicerat separata benchmarkresultat specifikt för svenska i sina officiella modellkort, så kvaliteten bör testas mot er egen data innan produktion.
Hur uppdaterar jag till en nyare version när den släpps?
Följ modellernas sidor på Hugging Face och Ollamas modellbibliotek. Eftersom vikterna är öppna kan ni testa en ny version parallellt med den gamla innan ni byter, precis som beskrivs i migrationsguiden ovan.
Kan Gemma 4 och Phi-4 köras på Apple Silicon eller behöver de Nvidia-hårdvara?
Båda familjerna går att köra på Apple Silicon-datorer via Ollama eller llama.cpp, som stödjer Metal-acceleration. Nvidia-GPU:er ger fortfarande generellt högre genomströmning för de större varianterna som Gemma 4 31B, men de mindre modellerna, som E2B och Phi-4-mini-instruct, fungerar bra även på en vanlig Mac med tillräckligt mycket delat minne.
Vilken modell är mest lämpad för svenska myndigheter och offentlig sektor?
Ingen av tillverkarna riktar sig specifikt mot offentlig sektor, men MIT-licensens enkelhet gör att Phi-4 ofta blir det snabbare valet i upphandlingar där juridikavdelningen behöver godkänna licensvillkoren innan ett pilotprojekt kan starta. Gemma 4 kan dock vara motiverat om projektet kräver agentiska funktioner, exempelvis automatiserad ärendehantering med verktygsanrop, där Tau2-resultaten talar för Google-familjen.




