Två öppna kodmodeller har seglat upp som de mest realistiska alternativen till molnbaserade kodassistenter för nordiska utvecklingsteam: Mistral AI:s Devstral 2 och OpenAI:s GPT-OSS-120B. Båda går att ladda ner gratis, köra på egen hårdvara och anpassa efter behov, vilket gör dem intressanta för svenska och nordiska bolag som brottas med GDPR-krav kring var kod och data faktiskt processas. Men de skiljer sig markant åt i arkitektur, prestanda och hur enkelt de går att sätta i drift. Devstral 2 landar på 72,2 procent på SWE-bench Verified, medan GPT-OSS-120B stannar på 62,4 procent, en skillnad som spelar roll när modellerna ska lösa riktiga buggar i produktionskod. I den här jämförelsen går vi igenom arkitektur, benchmarks, licensvillkor, hårdvarukrav, prissättning och konkreta användningsfall, så att du kan välja rätt modell för ditt team.
Vad är Devstral 2 och GPT-OSS?
Devstral 2 är Mistral AI:s andra generation av öppna kodmodeller, byggd specifikt för agentiska kodningsuppgifter som att navigera i stora kodbaser, hitta buggar och skriva om filer över flera steg. Det franska bolaget släppte modellen den 9 december 2025 i två storlekar: flaggskeppet Devstral 2 på 123 miljarder parametrar och den mindre varianten Devstral Small 2 på 24 miljarder parametrar, enligt en oberoende genomgång av Devstral 2. Båda är öppna vikter under Apache 2.0-licens, vilket innebär att vem som helst kan ladda ner, köra och bygga vidare på modellerna utan royalty.
GPT-OSS-120B och lillasyskonet GPT-OSS-20B är OpenAI:s första öppna modeller sedan GPT-2 år 2019. De släpptes den 5 augusti 2025 och markerade ett tydligt policyskifte hos ett bolag som annars hållit sina modellvikter stängda. Precis som Devstral bygger GPT-OSS på en Mixture-of-Experts-arkitektur och är licensierade under Apache 2.0. Skillnaden är att OpenAI:s modeller är generella resonemangsmodeller som presterar starkt även utanför kodning, medan Devstral är specialbyggd och tränad mot just mjukvaruutveckling.
Namnen speglar också hur de två bolagen positionerar produkterna. “Devstral” är en sammanslagning av “developer” och Mistrals modellnamnsserie, en tydlig signal om att modellen är byggd för en enda uppgift. “GPT-OSS” (open source software) lånar i stället tyngden från OpenAI:s GPT-varumärke rakt av, vilket signalerar att det handlar om en nedskalad, öppen variant av samma familj som driver ChatGPT snarare än en fristående produktlinje.
Det är just den specialiseringen som gör jämförelsen relevant. För ett nordiskt team som redan kör en generell assistent i molnet, som GPT-5.6 eller Claude Opus 5, handlar valet mellan Devstral 2 och GPT-OSS inte om vilken modell som är “smartast” i stort, utan vilken som löser flest riktiga kodningsuppgifter per krona och per gigabyte VRAM.
Bakgrunden till båda lanseringarna säger också något om varför öppna modeller plötsligt blivit ett affärsmässigt rimligt val 2026. Mistral AI har byggt sin marknadsposition kring att vara det europeiska alternativet till amerikanska molnjättar, med tydlig marknadsföring mot bolag som måste visa att kod och data stannar inom EU. OpenAI:s motiv med GPT-OSS var delvis ett annat: att möta trycket från kinesiska öppna modeller som DeepSeek och Qwen, som redan tagit stora marknadsandelar bland utvecklare som vill självhosta. Resultatet är två konkurrerande filosofier som råkar landa på ungefär samma tidpunkt i modellcykeln, vilket gör hösten 2026 till ett ovanligt bra tillfälle att faktiskt jämföra dem mot varandra.
Teknisk arkitektur: MoE, aktiva parametrar och kontext
Devstral 2 på 123 miljarder parametrar beskrivs av Mistral AI som en öppen, agentisk kodmodell, men bolaget har inte publicerat exakt hur många parametrar som aktiveras per token. Devstral Small 2 (24B) saknar också en offentliggjord uppdelning mellan totala och aktiva parametrar. Det gör Devstral svårare att jämföra rakt av på arkitekturnivå, men i praktiken spelar det mindre roll för slutanvändaren än vad modellen faktiskt levererar i kod.
GPT-OSS är desto mer transparent. GPT-OSS-120B har 117 miljarder parametrar totalt men bara 5,1 miljarder aktiva per token, fördelat på 36 lager och 128 experter där fyra aktiveras åt gången, enligt OpenAI:s modellkort publicerat på arXiv. GPT-OSS-20B är en nedskalad variant med 21 miljarder totala parametrar och 3,6 miljarder aktiva, 24 lager och 32 experter. Den låga andelen aktiva parametrar är anledningen till att GPT-OSS-120B kan köras på ett enda 80 GB-grafikkort, trots att den totala modellstorleken är jämförbar med Devstral 2.
Kontextfönstret skiljer sig också. Devstral 2 och Devstral Small 2 stödjer båda 256 000 tokens, dubbelt så mycket som GPT-OSS-120B och GPT-OSS-20B, som är begränsade till 128 000 tokens enligt OpenAI:s officiella modellkort. För kodningsuppgifter där hela repon eller stora sammanhängande filer behöver rymmas i minnet ger det Devstral ett praktiskt övertag, särskilt vid refaktorering av äldre kodbaser med många beroenden.
Specifikationer sida vid sida
Tabellen nedan ställer samman de fyra modellvarianterna som är relevanta i den här jämförelsen: Devstral 2, Devstral Small 2, GPT-OSS-120B och GPT-OSS-20B. Alla siffror kommer från respektive tillverkares egen dokumentation eller modellkort. Rader markerade “ej publicerat” betyder att varken Mistral AI eller OpenAI har delat den specifika uppgiften offentligt, snarare än att siffran är noll eller obefintlig.
| Specifikation | Devstral 2 | Devstral Small 2 | GPT-OSS-120B | GPT-OSS-20B |
|---|---|---|---|---|
| Utvecklare | Mistral AI | Mistral AI | OpenAI | OpenAI |
| Totala parametrar | 123 miljarder | 24 miljarder | 117 miljarder | 21 miljarder |
| Aktiva parametrar/token | Ej publicerat | Ej publicerat | 5,1 miljarder | 3,6 miljarder |
| Arkitektur | Agentisk kodmodell | Agentisk kodmodell | Mixture-of-Experts | Mixture-of-Experts |
| Kontextfönster | 256 000 token | 256 000 token | 128 000 token | 128 000 token |
| Licens | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
| SWE-bench Verified | 72,2 % | 68,0 % | 62,4 % | 60,7 % |
| MMLU | Ej publicerat | Ej publicerat | 90,0 % | 85,3 % |
| Släppdatum | 9 december 2025 | 10 december 2025 | 5 augusti 2025 | 5 augusti 2025 |
| Min. VRAM (kvantiserad) | Flera GPU:er | ~14 GB | ~80 GB | ~16 GB |
| Passar på | Multi-GPU-server | RTX 4090 / 32 GB Mac | Ett 80 GB-kort | Bärbar dator |
Mönstret som sticker ut är att Mistral AI prioriterat rå kodningsprestanda och kontextlängd, medan OpenAI prioriterat effektivitet, brett resonemang utanför kodning och att modellerna ska gå att köra på så lite hårdvara som möjligt. Ingen av strategierna är fel, de passar bara olika team. En utvecklare som ska välja mellan de fyra bör i praktiken börja med två frågor: hur stor är kodbasen som ska hanteras i en och samma session, och hur mycket GPU-kapacitet finns redan tillgänglig internt. Svaren på de frågorna pekar oftast tydligare mot rätt modell än att bara jämföra enskilda benchmarksiffror i tabellen.
SWE-bench Verified: kodningsprestanda i detalj
SWE-bench Verified är i dag standardmåttet för hur bra en modell faktiskt löser mjukvaruproblem. Testet består av 500 verkliga, mänskligt granskade ärenden hämtade från öppna GitHub-repon, där modellen ska hitta och fixa en bugg utan mänsklig inblandning, enligt SWE-bench-projektets egen dokumentation. Det gör benchmarket svårare att fuska sig igenom än traditionella kodningstester som bara ber modellen skriva en isolerad funktion.
Devstral 2 (123B) toppar med 72,2 procent, medan Devstral Small 2 (24B) landar på 68,0 procent, siffror som Mistral AI publicerat i sin egen modelldokumentation. Det är anmärkningsvärt högt för öppna vikter, och Devstral Small 2 slår faktiskt GPT-OSS-120B trots att den är fem gånger mindre i parameterantal. GPT-OSS-120B själv når 62,4 procent i sitt högsta resonemangsläge, och GPT-OSS-20B landar på 60,7 procent, enligt OpenAI:s modellkort publicerat på arXiv i augusti 2025.
Värt att notera: GPT-OSS-poängen varierar kraftigt beroende på hur mycket resonemangstid modellen får. Med lägre resonemangsinställning faller GPT-OSS-20B till så lågt som 37,4 procent, och GPT-OSS-120B till 47,9 procent, enligt samma modellkort. Det betyder att den faktiska prestandan du får ut av GPT-OSS i produktion beror mycket på hur du konfigurerar inferensen, medan Mistral inte har publicerat motsvarande spridning för Devstral. En äldre Devstral 24B-version (inte att förväxla med Devstral Small 2) landade för övrigt på bara 46,8 procent, vilket visar hur mycket Mistral AI förbättrat modellen på ett halvår.
| Modell | SWE-bench Verified | Källa |
|---|---|---|
| Devstral 2 (123B) | 72,2 % | Mistral AI / LocalAIMaster |
| Devstral Small 2 (24B) | 68,0 % | Mistral AI |
| GPT-OSS-120B (hög resonemang) | 62,4 % | OpenAI modellkort, arXiv |
| GPT-OSS-20B (hög resonemang) | 60,7 % | OpenAI modellkort, arXiv |
| GPT-OSS-120B (låg resonemang) | 47,9 % | OpenAI modellkort, arXiv |
| GPT-OSS-20B (låg resonemang) | 37,4 % | OpenAI modellkort, arXiv |
| Äldre Devstral 24B (dec. 2024-gen) | 46,8 % | Spheron Network |
Slutsatsen för team som väger in ren kodningsstyrka: Devstral 2 vinner tydligt, och även den mindre Devstral Small 2 slår GPT-OSS-120B med sex procentenheter trots att den kräver en bråkdel av hårdvaran. Det som gör siffrorna extra intressanta är hur snabbt fältet rör sig. För bara ett år sedan låg de bästa öppna kodmodellerna långt under 50 procent på SWE-bench Verified, och stängda toppmodeller som GPT-5.6 och Claude Opus 5 ansågs vara i en helt annan klass. Att en öppen 24-miljardersmodell nu slår en 120-miljardersmodell från en annan tillverkare visar att gapet mellan öppen och stängd kod-AI, som vi tidigare skrivit om i vår genomgång av öppna AI-modeller som kapar avståndet till de stängda, fortsätter krympa även inom den specifika kodningsnischen.
Andra benchmarks: MMLU, Codeforces och GPQA
SWE-bench mäter bara ett av flera relevanta mått. På allmän kunskap (MMLU) presterar GPT-OSS-120B starkt med 90,0 procent, och GPT-OSS-20B når 85,3 procent, enligt OpenAI:s modellkort. Mistral AI har inte publicerat motsvarande MMLU-siffror för Devstral 2 eller Devstral Small 2, vilket gör en direkt jämförelse omöjlig på den punkten. Det är rimligt att anta att Devstral, som är hårt specialiserad mot kodning, presterar sämre på bred allmänkunskap, men utan en officiell siffra kan vi inte kvantifiera skillnaden.
På tävlingsprogrammering (Codeforces, med verktygsstöd) rapporterar OpenAI att GPT-OSS-120B når en Elo-poäng på 2622 och GPT-OSS-20B 2516, siffror hämtade direkt ur arXiv-publiceringen av modellkortet. Det placerar båda modellerna i den övre delen av tävlingsprogrammerarskiktet, även om de inte når upp till de allra starkaste stängda modellerna på samma test. Mistral har inte publicerat en jämförbar Codeforces-siffra för Devstral, vilket åter illustrerar skillnaden i hur öppna de två bolagen är med sina interna testresultat: OpenAI publicerade ett fullständigt akademiskt modellkort med dussintals benchmarks vid lanseringen, medan Mistral AI hittills koncentrerat sin offentliga rapportering kring de mått som är mest relevanta för just kodningsanvändning.
Mistral AI:s bredare flaggskepp Mistral Large 3, som släpptes samma vecka som Devstral 2 i december 2025, ger en fingervisning om bolagets allmänna nivå: 92 procent på HumanEval och 43,9 procent på GPQA Diamond, enligt Mistral AI:s egen produktsida. Large 3 är dock en 675 miljarder parameter stor modell (41 miljarder aktiva, Mixture-of-Experts) och inte direkt jämförbar med de mindre, kodningsspecialiserade Devstral-modellerna, men den visar att Mistral AI:s modellfamilj som helhet håller hög klass på flera mått samtidigt.
Det är också värt att komma ihåg att benchmarks som HumanEval mäter något annat än SWE-bench. HumanEval ber modellen skriva en fristående funktion utifrån en beskrivning, ett relativt kontrollerat test som stängda toppmodeller ofta klarar med över 90 procents träffsäkerhet. SWE-bench Verified är betydligt svårare eftersom modellen måste förstå ett helt existerande kodbibliotek, avgöra vilka filer som ska ändras och undvika att introducera nya buggar i processen. Att Devstral presterar starkt just på SWE-bench, snarare än bara på HumanEval, är en starkare signal för team som faktiskt ska använda modellen mot verklig produktionskod och inte bara isolerade kodningsövningar.
Licensvillkor: Apache 2.0 i praktiken
Här finns ingen skillnad på pappret. Både Devstral 2, Devstral Small 2, GPT-OSS-120B och GPT-OSS-20B distribueras under Apache 2.0-licensen, bekräftat i respektive tillverkares dokumentation och på GitHub. Apache 2.0 är en av de mest tillåtande licenserna som finns: den tillåter kommersiell användning, modifiering, vidaredistribution och till och med att bygga stängda produkter ovanpå modellerna, utan royalty och utan krav på att dela tillbaka ändringar (så kallad copyleft).
Skillnaden ligger i det finstilta runt användning. OpenAI har lagt till en separat “usage policy” ovanpå Apache-licensen för GPT-OSS, som reglerar vissa användningsområden, enligt bolagets egen supportdokumentation. Mistral AI har inte publicerat motsvarande tilläggspolicy för Devstral, vilket i praktiken gör Devstral något enklare att integrera i interna verktygskedjor utan att behöva granska ett extra policydokument. För de flesta nordiska utvecklingsteam som bara vill köra modellen internt för kodgranskning eller autocomplete spelar skillnaden liten roll i praktiken, men juridikavdelningen bör ändå läsa båda dokumenten innan produktionssättning.
En sak att ha koll på är att Apache 2.0 gäller för själva modellvikterna, inte automatiskt för allt kringmaterial som utvärderingsskript, systempromptar eller finjusteringsdata som respektive tillverkare publicerar tillsammans med modellen. I praktiken är det sällan ett problem för team som bara vill köra modellen för att generera eller granska kod, men det är värt att veta om man planerar att paketera om delar av leverantörens egen tooling i en kommersiell produkt.
Det viktiga är att båda bolagen har valt bort mer restriktiva alternativ, som Metas Llama-licens med sina användargränser för stora bolag. Det gör Devstral och GPT-OSS till några av de mest fritt användbara kodmodellerna på marknaden i skrivande stund, en poäng som lyfts fram i flera oberoende genomgångar av öppna modeller under 2026.
Ekosystem och verktygsstöd
En modell är bara så användbar som verktygskedjan runt den. Här har GPT-OSS ett rejält försprång eftersom OpenAI publicerade modellerna med bred lanseringspartner-support från start: Hugging Face, Ollama, LM Studio, vLLM och samtliga stora molninferensleverantörer stödde GPT-OSS-120B och GPT-OSS-20B redan vid lanseringsdagen i augusti 2025. Det gör det enkelt att koppla modellen till populära kodredigerare som VS Code och JetBrains via öppna plugin-projekt som Continue och Cline, som båda pratar det OpenAI-kompatibla API-formatet.
Devstral har byggt upp motsvarande stöd snabbare än de flesta öppna modeller brukar göra, delvis för att Mistral AI redan hade etablerade integrationer från den första Devstral-generationen som lanserades tidigare. Devstral finns tillgänglig via Ollama, Hugging Face och LM Studio, och stöds av samma OpenAI-kompatibla API-lager som gör att verktyg byggda för GPT-OSS ofta fungerar med minimala ändringar. Skillnaden märks mest i mängden tredjepartsintegrationer och skrivna guider: eftersom GPT-OSS legat ute längre finns fler community-verktyg, finjusteringsscript och benchmarkjämförelser publicerade för just den modellfamiljen.
För team som redan har investerat i en lokal AI-stack, till exempel för att köra DeepSeek eller Llama 4 lokalt, blir tröskeln att lägga till ytterligare en modell låg oavsett vilken av de två man väljer. Infrastrukturen, från GPU-drivrutiner till API-gateway, återanvänds rakt av.
Hårdvarukrav för att självhosta
Det här är där de två modellfamiljerna skiljer sig mest åt i praktisk användning. GPT-OSS-20B är byggd för att köras lokalt på vanlig utvecklarhårdvara: OpenAI uppger att den fungerar med cirka 16 GB minne, vilket gör att den ryms på en modern bärbar dator med ett dedikerat grafikkort eller en Mac med tillräckligt enhetsminne. GPT-OSS-120B kräver mer men fortfarande måttligt: ett enda 80 GB-grafikkort, till exempel ett Nvidia H100, räcker enligt OpenAI:s egen lanseringsartikel.
Devstral Small 2 är, trots att den bara har 24 miljarder parametrar, något tyngre att köra effektivt: vid Q4_K_M-kvantisering behöver den ungefär 14 GB VRAM, vilket ryms på ett RTX 4090-kort eller en Mac med 32 GB minne, enligt en oberoende granskning från Tech For Dev. Devstral 2 på 123 miljarder parametrar är den tyngsta modellen i jämförelsen och kräver flera grafikkort samtidigt, en konfiguration som Mistral AI själva beskriver som “hög VRAM, multi-GPU” utan att ange en exakt siffra.
- GPT-OSS-20B: ~16 GB, körs på en enda bärbar dator eller Mac
- Devstral Small 2: ~14 GB vid Q4_K_M, RTX 4090 eller 32 GB Mac
- GPT-OSS-120B: ~80 GB, ett enda datacenter-GPU (H100-klass)
- Devstral 2 (123B): flera GPU:er, ingen exakt VRAM-siffra publicerad
Kostnadskalkylen mellan att köpa egen hårdvara och att hyra GPU-kapacitet i molnet beror mycket på hur konstant belastningen är. Ett team som bara kör modellen sporadiskt under kontorstid gör oftast bättre i att hyra tid hos en molnleverantör, medan ett team som kör kontinuerlig batch-bearbetning dygnet runt kan tjäna in kostnaden för ett eget GPU-kort inom några månader. Spheron Networks exempel på 0,72 dollar i timmen för ett L40S-kort ger en fingervisning: vid dygnet-runt-drift landar det på drygt 500 dollar i månaden, vilket är jämförbart med vad många team redan lägger på API-avgifter för en molnbaserad kodassistent.
För ett team som vill testa lokalt innan produktionssättning går det snabbast att köra GPT-OSS-20B eller Devstral Small 2 via Ollama, som stödjer båda modellfamiljerna direkt från kommandoraden.
# Hämta och kör GPT-OSS-20B lokalt
ollama pull gpt-oss:20b
ollama run gpt-oss:20b
# Hämta och kör Devstral Small 2 lokalt
ollama pull devstral:24b
ollama run devstral:24b
Den som redan kör lokala modeller via Ollama och undrar hur det ställer sig mot ett dedikerat inferensverktyg som vLLM för produktionsdrift kan läsa mer i vår jämförelse av Ollama mot vLLM, som går igenom genomströmning i tokens per sekund för olika hårdvarukonfigurationer.
Prissättning i molnet: vad kostar det per miljon token?
GPT-OSS har ett betydligt mer utbyggt ekosystem av molnleverantörer som hostar modellen åt dig, vilket gör prisjämförelsen enklare. Together AI, Groq och Fireworks tar samtliga 0,15 dollar per miljon indata-token och 0,60 dollar per miljon utdata-token för GPT-OSS-120B, enligt respektive leverantörs officiella prissida. OpenRouter, som aggregerar flera leverantörer, listar priser mellan 0,03 och 0,18 dollar per miljon indata-token beroende på vilken bakomliggande leverantör som väljs, med toppris runt 0,80 dollar per miljon utdata-token.
| Leverantör | Modell | Pris in (per 1M token) | Pris ut (per 1M token) |
|---|---|---|---|
| Together AI | GPT-OSS-120B | 0,15 USD | 0,60 USD |
| Groq | GPT-OSS-120B | 0,15 USD | 0,60 USD |
| Fireworks AI | GPT-OSS-120B | 0,15 USD | 0,60 USD |
| OpenRouter (lägst) | GPT-OSS-120B | 0,03 USD | 0,17 USD |
| Mistral La Plateforme | Mistral Large 3 (referens) | 0,50 USD | 1,50 USD |
Devstral har ett annat kostnadsmönster. Mistral AI har inte publicerat officiell per-token-prissättning för Devstral 2 eller Devstral Small 2 på La Plateforme i de källor vi hittat, utan modellerna marknadsförs primärt för självhosting. Ett exempel från GPU-molnleverantören Spheron Network visar att den äldre Devstral 24B-modellen kan köras för ungefär 0,72 dollar i timmen på ett L40S-grafikkort, en kostnadsmodell som passar team som redan har egen GPU-kapacitet eller föredrar att betala per drifttimme snarare än per token. Mistral Large 3, bolagets flaggskepp, prissätts som synes ovan högre än GPT-OSS-120B via molnleverantörer, vilket är rimligt eftersom Large 3 är en betydligt större modell med 675 miljarder totala parametrar.
För ett team som kör hundratals miljoner token i månaden genom kodgranskning och autocomplete blir prisskillnaden snabbt betydande. Ett team som byter från en GPT-5.6-baserad lösning till självhostad GPT-OSS-120B eller Devstral kan i praktiken sänka sin token-kostnad med över 90 procent, även om det initiala infrastrukturarbetet tar tid.
Det finns en viktig nyans här som ofta missas i snabba kostnadsjämförelser: självhosting byter ut en rörlig kostnad per token mot en fast kostnad för hårdvara och drift. En GPU-server med ett 80 GB-kort kostar betydligt mer i månaden än vad de flesta små team drar in i token-avgifter, så brytpunkten där självhosting faktiskt blir billigare ligger typiskt vid några hundra miljoner token per månad, beroende på molnpris för GPU-tid i den egna regionen. Team med lägre volym gör ofta klokast i att fortsätta använda en hanterad API-tjänst, oavsett om det är Mistral AI:s La Plateforme eller en GPT-OSS-hostande leverantör som Groq, och spara självhostingen för när volymen faktiskt motiverar den.
GDPR och datasuveränitet för nordiska företag
Det här är ofta den faktiska anledningen till att svenska och nordiska bolag tittar på öppna modeller över huvud taget. Mistral AI marknadsför uttryckligen EU-baserade endpoints för sin La Plateforme-tjänst, och bolaget har investerat kraftigt i egen datacenterkapacitet i Sverige, något vi skrivit om tidigare i vår genomgång av Mistrals satsning på AI-center i Sverige. Det gör det enklare att argumentera för att data stannar inom EU även när man använder Mistral AI:s molntjänst i stället för att självhosta.
OpenAI har i de källor vi granskat inte publicerat någon motsvarande, tydligt dokumenterad EU-residens-garanti specifikt för GPT-OSS. Eftersom modellen är öppen med vikter du kan ladda ner själv spelar det dock mindre roll: du kan köra GPT-OSS-120B eller GPT-OSS-20B helt on-premise eller i en svensk molnregion hos valfri leverantör, utan att någon data någonsin lämnar din egen infrastruktur. Samma sak gäller för Devstral, som Mistral AI också gör tillgänglig som nedladdningsbara vikter snarare än enbart en API-tjänst.
Med andra ord: när det gäller ren datasuveränitet är självhosting av antingen Devstral eller GPT-OSS ett likvärdigt starkt val, eftersom båda ger dig full kontroll över var beräkningarna sker. Skillnaden uppstår först om du väljer att använda en hanterad molntjänst i stället för att drifta modellen själv, och där har Mistral AI ett tydligare uttalat EU-fokus än OpenAI.
För bolag som redan omfattas av NIS2-regelverket eller andra sektorsspecifika säkerhetskrav tillkommer ytterligare ett skäl att föredra självhosting: en modell som körs internt kan integreras direkt i det befintliga loggnings- och övervakningsflödet, vilket gör det enklare att uppfylla krav på spårbarhet och incidenthantering än när kodningsdata skickas till en extern API-leverantör. Det är samma logik som styr varför många säkerhetsteam redan föredrar att köra känsliga arbetsflöden lokalt snarare än via tredjepartstjänster, oavsett vilken AI-modell som används.
Verkliga användningsfall
Fem konkreta scenarion visar var de två modellfamiljerna passar bäst i praktiken.
- Kodgranskning i CI/CD-pipeline: Ett team som vill köra automatiserad kodgranskning på varje pull request innan merge gynnas av Devstral Small 2:s högre SWE-bench-poäng och 256K-kontext, som ryms om hela diff:en plus relaterade filer i ett enda anrop.
- Bärbar utvecklarassistent utan nätverk: Konsulter som arbetar hos kunder med strikta nätverksregler kan köra GPT-OSS-20B lokalt på en bärbar dator med 16 GB minne, helt utan uppkoppling till internet under själva kodningsarbetet.
- Storskalig batch-refaktorering: Ett bolag som ska migrera en stor monolit till mikrotjänster kan köra Devstral 2 (123B) på en multi-GPU-server över natten för att bearbeta hundratals filer, där den högre kodningsprecisionen minskar antalet manuella rättningar dagen efter.
- Kundtjänst-chattbot med kodkunskap: Ett SaaS-bolag som behöver en supportbot som både kan resonera allmänt och hjälpa utvecklarkunder med API-integrationer drar nytta av GPT-OSS-120B:s bredare MMLU-prestanda på 90,0 procent, jämfört med en renodlad kodmodell.
- Offentlig sektor med datalagringskrav: En myndighet eller kommun som måste hålla all databehandling inom svensk mark kan självhosta antingen modellfamilj på egen infrastruktur, men Mistral AI:s uttalade EU-fokus och lokala datacenterinvesteringar gör Devstral till det enklare valet att motivera internt.
Gemensamt för alla fem exemplen är att valet sällan handlar om “bästa modellen” i absolut mening, utan om vilken kombination av prestanda, hårdvarukrav och juridisk trygghet som passar den specifika arbetsuppgiften. Ett sjätte mönster värt att nämna är hybridupplägget: flera team vi följer inom nordisk mjukvaruutveckling kör i praktiken både Devstral och GPT-OSS parallellt, där den ena hanterar snabb autocomplete i editorn och den andra körs som en tyngre bakgrundsprocess för nattliga kodgranskningar. Eftersom båda modellerna pratar samma OpenAI-kompatibla API-format är kostnaden för att underhålla två parallella modeller i praktiken låg, vilket gör hybridvalet mer rimligt än det låter vid första anblick.
Migrationsguide: byta från molnbaserad assistent till självhostad modell
För team som i dag kör en molnbaserad kodassistent och vill testa Devstral 2 eller GPT-OSS internt finns en tydlig väg framåt.
- Kartlägg dagens användning: hur många token per dag går genom kodassistenten, och vilka typer av uppgifter (autocomplete, granskning, refaktorering) dominerar.
- Välj testmodell utifrån hårdvara: har teamet en enda GPU med 16-24 GB, börja med GPT-OSS-20B eller Devstral Small 2. Finns en multi-GPU-server, testa Devstral 2 eller GPT-OSS-120B.
- Installera Ollama eller vLLM på en testserver och hämta modellvikterna lokalt med kommandona i föregående avsnitt.
- Kör samma uppsättning verkliga kodningsuppgifter (helst hämtade ur den egna kodbasen) genom både den befintliga molnmodellen och den nya lokala modellen, och jämför träffsäkerhet manuellt.
- Mät svarstid och genomströmning under realistisk belastning, inte bara enstaka anrop, eftersom självhostad inferens ofta beter sig annorlunda vid samtidiga användare.
- Sätt upp autentisering och nätverksisolering så att den självhostade modellen inte exponeras utanför företagets interna nätverk.
- Rulla ut till en mindre pilotgrupp i två till fyra veckor innan hela teamet flyttas över, och samla in feedback om upplevd kodkvalitet.
- Behåll molnmodellen som fallback för uppgifter där den lokala modellen underpresterar, snarare än att göra en total avstängning på dag ett.
Team som redan kör lokala modeller för andra ändamål, till exempel via DeepSeek eller Llama 4 lokalt genom Ollama, har ofta redan mycket av grundinfrastrukturen på plats och kan gå igenom stegen ovan på någon vecka snarare än en månad.
Ett vanligt misstag är att hoppa direkt till steg åtta utan att faktiskt genomföra steg fyra ordentligt. Det räcker inte att köra modellerna på ett par exempeluppgifter från internet, eftersom skillnaderna mellan Devstral och GPT-OSS ofta bara syns tydligt när modellen möter den egna kodbasens specifika mönster, ramverk och namnkonventioner. Avsätt minst en vecka till att samla ihop tjugo till trettio verkliga ärenden ur den egna issue-trackern innan utvärderingen påbörjas, annars riskerar teamet att fatta beslut baserat på generiska benchmarksiffror som inte nödvändigtvis speglar den egna verkligheten.
Fördelar och nackdelar
Sammanfattat i punktform blir styrkorna och svagheterna hos respektive modellfamilj tydligare, särskilt för den som ska presentera beslutsunderlaget för resten av teamet eller för ledningen.
Devstral 2 och Devstral Small 2
- Högre SWE-bench Verified-poäng i båda storleksklasserna (72,2 % och 68,0 %)
- Dubbelt så stort kontextfönster: 256 000 token mot 128 000
- Mistral AI:s uttalade EU-fokus och lokal datacenterinvestering i Sverige
- Devstral Small 2 kräver mindre VRAM (~14 GB) än GPT-OSS-120B (~80 GB) för jämförbar kodningsprestanda
- Ingen officiell MMLU-siffra publicerad, svårt att bedöma allmän resonemangsförmåga
- Ingen officiell per-token API-prissättning hos Mistral AI för Devstral, färre molnleverantörer att välja mellan
- Devstral 2 (123B) saknar publicerad exakt VRAM-siffra, kräver testning i förväg
GPT-OSS-120B och GPT-OSS-20B
- Brett stöd hos molnleverantörer (Together AI, Groq, Fireworks, OpenRouter) med transparent prissättning
- Stark allmän prestanda utanför kodning (MMLU 90,0 % för 120B-varianten)
- GPT-OSS-20B körs på vanlig utvecklarhårdvara med bara ~16 GB minne
- Fullt transparent arkitektur med publicerade aktiva parametrar per lager
- Lägre SWE-bench-poäng än motsvarande Devstral-storlek
- Prestanda varierar kraftigt med resonemangsinställning, från 37,4 % till 62,4 % för 20B-modellen
- Halva kontextfönstret jämfört med Devstral, 128 000 mot 256 000 token
Slutsats: vem ska välja vad
Om ren kodningsprestanda är det som avgör, vinner Devstral 2 tydligt med sina 72,2 procent på SWE-bench Verified, tio procentenheter över GPT-OSS-120B:s 62,4 procent. Devstral Small 2 slår till och med GPT-OSS-120B trots att den är fem gånger mindre och kräver en bråkdel av VRAM-mängden, vilket gör den till det mest kostnadseffektiva valet för team med begränsad GPU-budget som ändå vill ha hög kodningsprecision.
GPT-OSS vinner däremot på ekosystem och flexibilitet. Fler molnleverantörer hostar modellen till transparenta och låga priser, den presterar starkare på allmän kunskap, och GPT-OSS-20B är den enklaste av alla fyra modellerna att köra på vanlig utvecklarhårdvara. För team som redan lever i OpenAI:s verktygskedja, eller som behöver en modell som klarar mer än bara kodning, är GPT-OSS det säkrare valet.
| Scenario | Rekommenderad modell |
|---|---|
| Högsta möjliga SWE-bench-poäng, gott om GPU-kapacitet | Devstral 2 (123B) |
| Bäst kodningsprestanda per GB VRAM | Devstral Small 2 (24B) |
| Enklast att hosta i molnet till lågt pris | GPT-OSS-120B |
| Kör på bärbar dator utan uppkoppling | GPT-OSS-20B |
| Störst krav på EU-datasuveränitet | Devstral (Mistral AI, Sverige-fokus) |
För de flesta nordiska team som redan brottas med GDPR-frågor och vill komma bort från beroendet av amerikanska molnjättar landar valet ofta på Devstral, tack vare Mistral AI:s europeiska förankring. Men GPT-OSS är inget dåligt val, det är helt enkelt optimerat för ett annat behov: bred användbarhet, låg hårdvarutröskel och ett mognare kommersiellt ekosystem runt hosting.
Den bredare trenden är kanske viktigare än något enskilt jämförelsetal. Att en fransk startup och en amerikansk AI-jätte båda släppte konkurrenskraftiga öppna kodmodeller inom fyra månader av varandra visar att öppna vikter inte längre är ett nödlösning för budgetstyrda team, utan ett strategiskt val även för de bolag som har råd att betala för de dyraste stängda alternativen. För nordiska utvecklingsorganisationer betyder det fler verktyg att välja mellan, lägre kostnad per token och, kanske viktigast av allt, ett sätt att bygga kodningsverktyg som inte är beroende av ett enda företags molntjänst för att fungera.
Vanliga frågor
Är Devstral 2 gratis att använda kommersiellt?
Ja. Både Devstral 2 och Devstral Small 2 distribueras under Apache 2.0-licensen, vilket tillåter kommersiell användning, modifiering och vidaredistribution utan royalty. Det enda du betalar för är den hårdvara eller molntjänst du väljer att köra modellen på.
Kan GPT-OSS-20B köras på en vanlig bärbar dator?
Ja, OpenAI uppger att GPT-OSS-20B kräver ungefär 16 GB minne, vilket gör att den ryms på många moderna bärbara datorer och Mac-modeller med tillräckligt enhetsminne. Det gör den till ett av de mer tillgängliga alternativen för utvecklare som vill testa en agentisk kodmodell utan att investera i särskild GPU-hårdvara.
Vilken modell är bäst för att hitta buggar i produktionskod?
Baserat på SWE-bench Verified, som mäter förmågan att lösa verkliga GitHub-ärenden, presterar Devstral 2 bäst med 72,2 procent, följt av Devstral Small 2 med 68,0 procent och GPT-OSS-120B med 62,4 procent. Skillnaden är särskilt tydlig vid uppgifter som kräver att modellen förstår sammanhanget i flera filer samtidigt, där Devstrals dubbelt så stora kontextfönster ger ett praktiskt övertag.
Går det att köra Devstral eller GPT-OSS helt utan internetuppkoppling?
Ja, båda modellfamiljerna kan laddas ner och köras helt offline via verktyg som Ollama eller vLLM, så länge hårdvaran uppfyller VRAM-kraven för vald modellstorlek. Det gör dem lämpliga för konsulter, myndigheter och andra som arbetar i nätverksisolerade miljöer.
Är Mistral AI:s modeller mer GDPR-vänliga än OpenAI:s?
Mistral AI marknadsför uttryckligen EU-baserade endpoints och har investerat i egen datacenterkapacitet i Sverige, medan OpenAI i de källor vi granskat inte publicerat en motsvarande dokumenterad EU-residens-garanti specifikt för GPT-OSS. Vid självhosting av öppna vikter blir dock skillnaden mindre relevant, eftersom du själv styr var beräkningarna sker och kan placera servrarna var du vill.
Vad kostar det att köra GPT-OSS-120B i molnet?
Leverantörer som Together AI, Groq och Fireworks AI tar samtliga 0,15 dollar per miljon indata-token och 0,60 dollar per miljon utdata-token för GPT-OSS-120B, med lägre priser tillgängliga via aggregatorer som OpenRouter, som listat priser ner mot 0,03 dollar per miljon indata-token hos vissa bakomliggande leverantörer.
Har Mistral AI publicerat officiell API-prissättning för Devstral?
Nej, i de källor vi granskat marknadsför Mistral AI primärt Devstral för självhosting snarare än som en hanterad API-tjänst med publicerad per-token-prissättning. Team som vill ha en hanterad tjänst med tydlig token-prissättning från Mistral AI hänvisas i praktiken till det bredare Mistral Large 3, som kostar 0,50 dollar per miljon indata-token och 1,50 dollar per miljon utdata-token på La Plateforme.
Kan jag byta mellan Devstral och GPT-OSS utan att skriva om min kodbas?
Ja, båda modellfamiljerna går ofta att nå via samma OpenAI-kompatibla API-gränssnitt genom verktyg som Ollama eller vLLM, vilket gör att applikationskoden i de flesta fall kan lämnas oförändrad vid ett modellbyte. Det enda som normalt behöver justeras är modellnamnet i konfigurationen och eventuella prompt-anpassningar för att få ut bästa möjliga resultat av respektive modell.
Finns det en nyare version av GPT-OSS eller Devstral på gång?
I de källor vi granskat i augusti 2026 finns inga bekräftade uppgifter om en ny basmodell i någon av familjerna mellan juni och augusti 2026. OpenAI har däremot släppt säkerhetsinriktade varianter, gpt-oss-safeguard-120b och gpt-oss-safeguard-20b, som är finjusterade versioner av de befintliga gpt-oss-modellerna för klassificeringsuppgifter snarare än en ny generation för kodning.




