Sjutton månader har gått sedan Meta lanserade Llama 4 Scout och Llama 4 Maverick den 5 april 2025, tillsammans med löftet om en tredje, mycket större modell vid namn Behemoth. Den har fortfarande inte kommit. Samtidigt har Meta börjat gå åt ett annat håll: i april 2026 skeppade bolaget sin första riktiga toppmodell med stängda vikter, Muse Spark, och rörde sig därmed bort från sin egen linje om att öppen AI skulle bli branschens ledande teknik. För utvecklare, IT-chefer och myndigheter i Sverige och övriga Norden som funderar på om Llama 4 fortfarande är ett vettigt val i september 2026 finns det gott om siffror att luta sig mot, och en berättelse om ett företag som byter strategi mitt i loppet.

Den här artikeln går igenom vad som faktiskt hänt med Llama 4-familjen, varför den utlovade jättemodellen aldrig kom, hur Scout och Maverick står sig mot kinesiska konkurrenter som DeepSeek och Qwen, samt vad skiftet betyder för europeiska företag som bygger AI-infrastruktur under EU:s regelverk.

Vad hände med Llama 4 Behemoth?

När Meta presenterade Llama 4 i april 2025 var Scout och Maverick bara förspelet. Bolaget beskrev samtidigt en tredje modell, Behemoth, som en lärarmodell med runt 2 biljoner parametrar totalt och 288 miljarder aktiva parametrar per token, byggd för att destillera kunskap ner till de mindre modellerna. Enligt Metas egen lanseringstext var Scout och Maverick redan “våra bästa hittills tack vare destillation från Llama 4 Behemoth, en modell med 288 miljarder aktiva parametrar och 16 experter som är vår mest kraftfulla hittills och bland världens smartaste språkmodeller”, enligt Metas officiella lanseringsblogg.

Det löftet har inte infriats. Behemoth saknar fortfarande öppna vikter, ett publikt API och tillgång via de stora molnleverantörerna. Meta har aldrig formellt lagt ner projektet, men har heller inte gett något nytt lanseringsdatum sedan förseningarna inleddes redan under våren 2025. Resultatet är en modell som existerar på papper men aldrig blivit tillgänglig för vare sig utvecklare eller företag, mer än sjutton månader efter att den först visades upp.

Familjen Llama 4: Scout, Maverick och jätten som aldrig kom

Det som faktiskt går att ladda ner är Scout och Maverick, båda byggda som multimodala Mixture-of-Experts-modeller (MoE) som kombinerar text- och bildförståelse i samma nätverk. Arkitekturen gör att bara en bråkdel av parametrarna aktiveras för varje token, vilket sänker beräkningskostnaden jämfört med en tät modell av samma storlek. Scout riktar sig mot utvecklare som vill köra en kraftfull modell på begränsad hårdvara, medan Maverick är tänkt för produktionsmiljöer med tillgång till flera GPU:er.

ModellTotala parametrarAktiva parametrarAntal experterKontextfönsterStatus september 2026
Llama 4 Scout109 miljarder17 miljarder1610 miljoner tokenÖppna vikter, tillgänglig
Llama 4 Maverick400 miljarder17 miljarder1281 miljon tokenÖppna vikter, tillgänglig
Llama 4 Behemothcirka 2 biljoner288 miljarder16Ej offentliggjortAldrig lanserad, ej nedlagd

Scouts kontextfönster på 10 miljoner token stack ut redan vid lanseringen och gör fortfarande modellen ovanlig i sin klass. Mark Zuckerberg beskrev Scout som en modell som “är extremt snabb, naturligt multimodal och har en branschledande, nästan oändlig kontextlängd på 10 miljoner token, och den är designad för att köras på ett enda GPU”, enligt Engadgets rapportering från lanseringen. Maverick byter ut delar av kontextlängden mot fler experter och högre kapacitet per fråga, vilket gör den till den modell Meta själv positionerat som konkurrent till större slutna system.

Så presterar Llama 4 på benchmarks

Meta har aldrig publicerat en fullständig, officiell benchmarktabell för Maverick och Scout mot dagens modeller. De siffror som cirkulerar kommer i stället från oberoende testning som tredjepartsanalytiker gjort efter lanseringen, och de bör läsas med den reservationen. Enligt sådana oberoende sammanställningar landar Maverick på 80,5 procent på MMLU-Pro och 69,8 procent på GPQA Diamond, medan Scout når 74,3 procent respektive 57,2 procent på samma mått. På det enklare MMLU-testet redovisas Maverick till 85,5 procent och Scout till 79,6 procent.

Ställt mot DeepSeek V4-Pro, som i samma typ av oberoende jämförelser redovisas med 81,2 procent på MMLU-Pro och 68,4 procent på GPQA Diamond, ligger Maverick ungefär i nivå på det ena måttet och något före på det andra. Skillnaden är för liten för att kalla någon modell en tydlig vinnare, men den bekräftar en trend: Llama 4 är inte längre den självklara ledaren bland öppna modeller som den var vid lanseringen 2025, utan ett av flera starka alternativ.

ModellMMLU-ProGPQA DiamondÖppna vikter
Llama 4 Maverick80,5%69,8%Ja
Llama 4 Scout74,3%57,2%Ja
DeepSeek V4-Pro81,2%68,4%Ja

Siffrorna för DeepSeek V4-Pro och Llama 4 kommer från olika oberoende testkörningar och inte från en och samma standardiserade körning, vilket betyder att marginalerna bör tolkas med försiktighet snarare än som exakta rangordningar.

Meta byter riktning: Muse Spark och slutet på öppna toppmodeller

Den verkligt stora nyheten är inte att Behemoth är sen, utan vad Meta gjorde i stället. I april 2026 lanserade bolaget Muse Spark, sin första riktiga frontier-modell med stängda vikter. Enligt the-decoders analys markerar Muse Spark ett tydligt brott med den strategi Meta drivit sedan Llama 2: att konkurrera med OpenAI och Google genom att göra sina bästa modeller fritt nedladdningsbara.

Ingen källa bekräftar att Muse Spark direkt ersatte Behemoth som projekt, men tidslinjen är svår att ignorera. Medan Behemoth blev kvar på ritbordet byggde Meta parallellt en toppmodell som aldrig var tänkt att delas med omvärlden. Det pekar mot en bredare omprioritering inom bolaget, där de mest resurskrävande modellerna hålls stängda medan öppna vikter reserveras för modeller i Scout- och Maverick-klass.

Mark Zuckerberg sa vid lanseringen av Llama 4 att han länge trott att öppen AI skulle bli de ledande modellerna, och att det med Llama 4 började hända. Ett år senare ser verkligheten mer splittrad ut. Meta har fortfarande de mest nedladdade öppna modellerna i sin viktklass, men bolagets egen resursfördelning tyder på att den absoluta frontlinjen flyttas bakom stängda dörrar igen.

Konkurrenterna fyller tomrummet

Kinesiska labb tar täten inom öppna modeller

Medan Behemoth stått still har DeepSeek, Alibabas Qwen-team och Z.ai:s GLM-serie fortsatt släppa nya öppna generationer i högt tempo. DeepSeek V4-Pro, Qwen3.8 och GLM-5.3-Flash konkurrerar i dag om samma utvecklare som tidigare defaultade till Llama. Skillnaden mot 2025 är utgivningstakten: kinesiska labb har normaliserat kvartalsvisa eller till och med snabbare uppdateringscykler, medan Metas öppna linje stått still sedan april 2025 förutom mindre dokumentationsuppdateringar.

Mistral håller den europeiska flaggan högt

På den europeiska sidan fortsätter franska Mistral att vara det tydligaste alternativet till både amerikanska och kinesiska modeller, med satsningar som sträcker sig in i svensk datacenterkapacitet. Det ger EU-baserade företag ett alternativ som är öppet, konkurrenskraftigt och byggt inom unionens eget regelverk, vilket blir alltmer relevant i takt med att AI-akten ställer krav på transparens och dokumentation för AI-system som används kommersiellt.

Historisk tillbakablick: från Llama 2 till Llama 4

Meta har byggt sin AI-strategi på öppna vikter sedan Llama 2 släpptes sommaren 2023 med en licens som för första gången tillät kommersiell användning i stor skala. Det utlöste en våg av finjusterade varianter och startade den öppna LLM-scen som i dag inkluderar allt från Mistral till DeepSeek. Llama 3, som kom våren 2024 i storlekar upp till 405 miljarder parametrar, cementerade Metas position som den mest använda öppna modellfamiljen och pressade priserna nedåt även för slutna alternativ.

Llama 4 skulle bli nästa steg: multimodal från grunden, byggd på MoE-arkitektur och med Behemoth som kronjuvel. Att den tredje och största modellen uteblivit gör Llama 4 till det första kapitlet i serien där Meta inte levererat hela sitt eget löfte, vilket skiljer sig tydligt från hur Llama 2 och Llama 3 togs emot vid sina respektive lanseringar.

Så kör du Llama 4 lokalt: hårdvarukraven

För organisationer som överväger att självhosta Llama 4, kanske av datasuveränitetsskäl, skiljer sig kraven kraftigt mellan Scout och Maverick. Scout är byggd för att rymmas på en enda GPU i kvantiserad form, medan Maverick kräver en riktig kluster­miljö.

Modell4-bitars kvantisering (Q4)8-bitars (Q8)FP16/BF16Rekommenderad hårdvara
Llama 4 Scout~55 GBEj dokumenteratEj dokumenterat1× H100 80GB
Llama 4 Maverick~257–270 GB~452 GB~800–900 GB4–8× H100/H200 GPU:er

Scout passar därmed team som redan har tillgång till en enstaka kraftfull GPU och vill undvika molnberoende, medan Maverick i praktiken kräver samma typ av infrastruktur som större slutna modeller. Nedan ett minimalt exempel på hur Scout kan laddas lokalt med Hugging Face Transformers för den som vill testa modellen innan ett fullskaligt produktionsbeslut.

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "meta-llama/Llama-4-Scout-17B-16E-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    device_map="auto",
    torch_dtype="auto",
    load_in_4bit=True,
)

prompt = "Sammanfatta skillnaden mellan Llama 4 Scout och Maverick."
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
output = model.generate(**inputs, max_new_tokens=200)
print(tokenizer.decode(output[0], skip_special_tokens=True))

Modellkortet på Hugging Face ger fullständig dokumentation om konfiguration, kvantiseringsalternativ och kända begränsningar, och bör läsas innan modellen sätts i produktion.

Licensvillkoren: vad “öppna vikter” faktiskt innebär

Scout och Maverick släpps under Metas community-licens, som tillåter kommersiell användning och finjustering. Det gör dem tekniskt sett fria att bygga produkter på, till skillnad från rent forskningslicensierade modeller. Samtidigt är “öppna vikter” inte samma sak som öppen källkod i traditionell mening: Meta publicerar modellparametrarna men inte fullständig träningsdata eller den kompletta pipelinen bakom modellen, vilket begränsar hur väl externa aktörer kan granska eller reproducera träningsprocessen. För företag som behöver kunna dokumentera hela sin AI-kedja inför tillsyn är den skillnaden värd att ha klar för sig innan modellen väljs.

Marknadspåverkan: vad betyder det för utvecklare och företag

För utvecklare som redan byggt runt Llama-ekosystemet förändrar inget av detta att Scout och Maverick fungerar som tidigare. Men det påverkar vilka modeller som får uppmärksamhet i nya projekt. När det mest kraftfulla alternativet i en familj uteblir i över ett år flyttar utvecklarnas uppmärksamhet naturligt till konkurrenter som faktiskt levererar uppdateringar. Det märks i hur ofta nya öppna modeller jämförs mot DeepSeek och Qwen snarare än mot Llama, ett mönster som var mycket mindre vanligt under 2025.

För större företag med krav på leverantörsstabilitet blir Metas kursändring också ett observandum. Ett bolag som skiftar resurser mot stängda modeller kan i förlängningen prioritera ner underhållet av sina öppna linjer, vilket är en risk att väga in vid val av grundmodell för system som ska leva i flera år.

Sjunkande sökintresse speglar branschens skifte

Sökdata ger en konkret bild av hur intresset för Llama 4 utvecklats i Sverige. Enligt sökvolymdata från DataForSEO låg de månatliga sökningarna på “llama 4” i Sverige på 210 i augusti 2025, strax efter lanseringssommaren. Under 2026 har siffran fallit stadigt: 140 sökningar i januari, 110 i mars och bara 40 i juli. Det är en nedgång på över 80 procent på elva månader, vilket sammanfaller nästan exakt med den period då Behemoth uteblivit och konkurrenterna tagit mer plats i samtalet.

Ett sjunkande sökintresse betyder inte att modellerna slutat användas i produktion, men det är ett tydligt tecken på att Llama 4 inte längre driver samma nyhetscykel som konkurrerande lanseringar gör. Konkurrensnivån för sökordet klassas fortsatt som låg, vilket antyder att ämnet lämnat de stora tekniknyheternas radar utan att för den skull försvunnit helt.

Röster från lanseringen: vad Meta och Zuckerberg sa

Det är värt att ställa de ursprungliga uttalandena mot dagens läge. Meta skrev själva vid lanseringen att Behemoth skulle bli “bland världens smartaste språkmodeller”, en formulering som återfinns i bolagets officiella blogginlägg från april 2025. Mark Zuckerberg har vid flera tillfällen, bland annat i samband med lanseringen, uttryckt en övertygelse om att öppen AI på sikt skulle bli de ledande modellerna på marknaden. Det uttalandet har fått ny innebörd i takt med att Meta själv byggt sin senaste toppmodell, Muse Spark, med stängda vikter.

Ingen av dessa källor uttalar sig specifikt om varför Behemoth aldrig kom, och Meta har inte gått ut med någon offentlig förklaring till förseningen. Det gör att frågan om huruvida modellen kommer släppas i någon form förblir öppen snarare än avfärdad.

Sverige, Norden och den öppna AI-vågen

Ingen dokumentation pekar på att svenska myndigheter eller företag uttalat sig specifikt om Llama 4 eller Behemoth. Det som däremot pågår parallellt i regionen är en bredare satsning på AI-suveränitet, där svenska aktörer bygger egen kapacitet snarare än att luta sig mot en enskild amerikansk eller kinesisk leverantör. Den utvecklingen är oberoende av vad som händer med Metas öppna modeller, men den förstärker samma logik: företag och myndigheter vill ha alternativ som inte är beroende av ett enskilt bolags strategiska humör.

För nordiska IT-avdelningar som redan använder Scout eller Maverick i produktion ändrar inget akut. Men den som planerar ny infrastruktur bör räkna med att den öppna modellmarknaden i dag är betydligt mer fragmenterad än den var vid Llama 4:s lansering, med fler seriösa alternativ än tidigare.

Prognoser: vad händer härnäst

  • Behemoth kommer sannolikt inte släppas i sin ursprungliga form. Om en version över huvud taget skeppas är det mer troligt att den blir nedskalad eller riktad mot ett smalare företagssegment än den fullskaliga lärarmodell som tecknades upp 2025.
  • Meta kommer med stor sannolikhet fortsätta investera mer i stängda modeller som Muse Spark, medan öppna vikter reserveras för modeller i Scout- och Maverick-klass snarare än för nästa frontier-generation.
  • Kinesiska labb som DeepSeek, Alibaba och Z.ai kommer fortsätta sätta tempot för öppna modellsläpp under resten av 2026, vilket pressar Meta att antingen accelerera eller acceptera en mindre framträdande roll i det öppna landskapet.
  • Europeiska satsningar på lokal AI-kapacitet, inklusive svenska initiativ, fortsätter oberoende av Metas vägval, driven mer av regulatoriska och suveränitetsskäl än av vilken modell som toppar en enskild benchmark.
  • Företag som redan byggt system på Scout och Maverick bör förvänta sig långsammare uppdateringstakt än under 2025, vilket gör det klokt att bygga arkitektur som inte är hårt knuten till en enskild modellfamilj.

Vanliga frågor

Vad är skillnaden mellan Llama 4 Scout och Maverick?

Scout har 109 miljarder totala parametrar men bara 17 miljarder aktiva per token, med ett kontextfönster på upp till 10 miljoner token, och är byggd för att köras på en enda GPU. Maverick har 400 miljarder totala parametrar, samma 17 miljarder aktiva, men fler experter (128 mot 16) och ett kontextfönster på 1 miljon token, vilket kräver flera GPU:er i produktion.

Har Llama 4 Behemoth släppts?

Nej. Behemoth presenterades i april 2025 men har fortfarande, i september 2026, varken öppna vikter, ett publikt API eller ett nytt lanseringsdatum. Meta har inte formellt lagt ner projektet.

Vilken hårdvara krävs för att köra Llama 4 Maverick?

Vid 4-bitars kvantisering behöver Maverick uppskattningsvis 257–270 GB VRAM, vilket i praktiken kräver minst fyra GPU:er med 80 GB minne vardera. Full precision (FP16/BF16) kräver runt 800–900 GB och en kluster­miljö med åtta GPU:er.

Är Llama 4 gratis att använda kommersiellt?

Ja, Scout och Maverick släpps under en community-licens som tillåter kommersiell användning och finjustering. Villkoren skiljer sig från traditionell öppen källkod eftersom Meta inte publicerar full träningsdata eller pipeline, endast modellvikterna.

Hur skiljer sig Llama 4 från DeepSeek V4 och Qwen3.8?

På benchmarks som MMLU-Pro och GPQA Diamond ligger Llama 4 Maverick och DeepSeek V4-Pro i samma härad enligt oberoende testresultat, utan någon tydlig vinnare. Den största praktiska skillnaden är utgivningstakt: DeepSeek och Qwen har fortsatt släppa nya versioner regelbundet under 2026, medan Llama 4-familjen stått still sedan lanseringen 2025.

Varför lanserade Meta Muse Spark med stängda vikter?

Meta har inte gett någon offentlig motivering. Branschbevakare tolkar det som ett tecken på att bolaget omprioriterar resurser mot stängda toppmodeller, medan öppna vikter reserveras för modeller i Scout- och Maverick-klass.

Kan jag köra Llama 4 Scout på en vanlig gaming-GPU?

Nej, inte i praktiken. Även med 4-bitars kvantisering kräver Scout uppskattningsvis 55 GB VRAM, vilket motsvarar ett datacenterkort som en H100. Konsumentkort med 12–24 GB räcker inte för modellen i dess fulla form.

Vad händer med öppen källkods-AI framöver?

Fältet blir mer fragmenterat snarare än dominerat av en enskild aktör. Kinesiska labb driver just nu utgivningstakten, medan europeiska satsningar som Mistral och nationella initiativ bygger alternativ som inte är beroende av ett enskilt bolags strategival.