Google og Nvidia kæmper om det samme mål: at levere den billigste regnekraft til de AI-modeller, der i 2026 driver alt fra chatbots til billeddiagnostik. Med lanceringen af TPU v7 “Ironwood” har Google for første gang en chip, der på papiret matcher Nvidias Blackwell-generation på både hukommelse og gennemstrømning. Spørgsmålet for danske og nordiske virksomheder, der lejer AI-regnekraft i skyen, er enkelt: giver det mening at flytte arbejdsbelastninger til Googles TPU-stak, eller er Nvidias CUDA-økosystem stadig den sikre vej? Denne sammenligning gennemgår specifikationer, benchmarks, priser og reelle brugsmønstre for at give et konkret svar.

Baggrunden er en stigende erkendelse i både Palo Alto og Mountain View af, at inferens, altså det at køre en færdigtrænet model mod millioner af daglige forespørgsler, i 2026 udgør en langt større del af de samlede AI-driftsomkostninger end selve træningen. Der hvor Nvidia i årevis har haft et de facto-monopol på træningsklynger, er inferenslaget mere åbent for konkurrence, fordi kravene til rå fleksibilitet er lavere, og kravene til pris per forespørgsel er højere. Det er præcis dette marked, Google forsøger at erobre med Ironwood, mens Nvidia svarer med en Blackwell-generation, der er hurtigere, men også langt dyrere og mere strømkrævende end sine forgængere. For danske virksomheder, der typisk lejer kapacitet frem for at eje hardwaren selv, betyder det, at valget mellem TPU og GPU i stigende grad handler om kontraktvilkår og skalerbarhed, ikke kun om rå ydeevne på et regneark.

Hvad er Google TPU v7 Ironwood?

Google TPU v7, internt kaldet Ironwood, blev annonceret på Google Cloud Next 2026 og blev generelt tilgængeligt for Google Cloud-kunder fra 22. april 2026. Chippen er bygget på TSMC’s N3-proces (3 nanometer) og er designet primært til inferens i stor skala, altså til at køre allerede trænede modeller effektivt, snarere end til at træne dem fra bunden. Den afløser ikke TPU v6 “Trillium” til træning, men lægger sig ved siden af den som en specialiseret inferensmotor.

Hver Ironwood-chip har en dual-chiplet-arkitektur med to TensorCores og fire SparseCores i samme pakke. Den er udstyret med 192 GB HBM3E-hukommelse med en båndbredde på cirka 7,37 til 7,40 terabyte i sekundet, hvilket er markant mere end forgængeren TPU v6e. På FP8 opgives ydeevnen typisk til omkring 4.614 TFLOPS per chip i de fleste tekniske gennemgange, mens enkelte specifikationstabeller angiver 9.228 TFLOPS, formentlig fordi de tæller begge chiplets i pakken samlet. Termisk designeffekt ligger mellem 600 og 1.000 watt afhængigt af konfiguration, hvilket kræver væskekøling i de fleste datacentre.

Det, der adskiller Ironwood fra tidligere TPU-generationer, er skaleringen. En fuld Ironwood-superpod kæder 9.216 chips sammen via et 3D-torus-interconnect med cirka 1,77 petabyte samlet HBM-hukommelse og en teoretisk ydeevne på omkring 42,5 exaflops FP8. Google oplyser desuden, at Ironwood leverer cirka dobbelt så god ydeevne per watt som Trillium og omkring fire gange bedre ydeevne per chip end TPU v6e. Interconnect-hastigheden mellem naboer i en pod ligger på 1,2 terabyte i sekundet bidirektionelt per link, hvilket samlet giver 9,6 terabit i sekundet naboenbåndbredde.

Navnet Ironwood er ikke tilfældigt. Google har traditionelt opkaldt sine TPU-generationer efter trætyper, og valget signalerer, at chippen skal ses som en solid, driftssikker arbejdshest snarere end et eksperimentelt springbræt. I praksis betyder det, at Google positionerer Ironwood som den chip, der skal bære den forventede vækst i inferenstrafik gennem resten af 2026 og ind i 2027, mens TPU v8 formentlig først dukker op senere. Google har endnu ikke offentliggjort en samlet årsplan for, hvor mange Ironwood-pods der bliver rullet ud globalt, men flere analyser peger på, at USA og Asien får kapaciteten først, mens europæiske datacentre, herunder i Norden, forventes at følge i løbet af anden halvdel af 2026.

SparseCores, en detalje flere analyser fremhæver som central for Ironwoods design, er specialiserede kredsløb bygget til at håndtere de meget store, tynde datastrukturer, som anbefalingssystemer og annonceplatforme typisk arbejder med. Det er ikke tilfældigt, at Google har prioriteret denne funktion, eftersom Google Ads og Google Search i årevis har været nogle af selskabets mest krævende interne arbejdsbelastninger målt på antal forespørgsler. Ved at bygge SparseCores direkte ind i Ironwood signalerer Google, at chippen ikke kun er tænkt til generative sprogmodeller, men også til de mere traditionelle, men stadig enormt datatunge, anbefalings- og rangeringssystemer, der driver størstedelen af selskabets reklameindtægter.

Hvad er Nvidia B200 og GB200 Blackwell?

Nvidias svar på Ironwood hedder B200, en GPU bygget på Blackwell-arkitekturen. Kortet bruger en dual-die SXM-modulopbygning med 5. generations Tensor Cores, der for første gang understøtter native FP4-beregninger. Hver B200 har 192 GB HBM3E-hukommelse med en båndbredde på op til cirka 8 terabyte i sekundet, altså marginalt over Ironwoods niveau. Effektforbruget ligger omkring 1.000 watt, og ligesom Ironwood kræver kortet i praksis væskekøling for at holde temperaturerne nede ved fuld belastning.

Den store nyhed i Blackwell-generationen er 5. generations NVLink, der giver 1,8 terabyte i sekundet per GPU fordelt på omkring 18 porte af 100 gigabyte hver. Det gør det muligt at koble mange B200-kort sammen med markant lavere latenstid end tidligere generationer. Nvidia sælger også B200 som del af GB200-superchippen, hvor én Grace-CPU parres med to B200-GPU’er. En GB200-enhed opgives til omkring 40 petaflops sparse FP4-ydeevne, hvilket Nvidia fremhæver som særligt velegnet til de allerstørste sprogmodeller.

Prisen på Blackwell-hardware er ikke officielt offentliggjort af Nvidia, men brancheanalyser fra 2026 estimerer, at et enkelt B200 SXM-modul koster mellem 30.000 og 40.000 dollar i listepris, mens en komplet GB200-superchip ligger i omegnen af 60.000 til 70.000 dollar før de rabatter, som store cloud-udbydere typisk forhandler sig til. Nvidias eget materiale fra august 2026 angiver, at Blackwell kan nå ned mod cirka 0,02 dollar per million tokens ved LLM-inferens, når man bruger virksomhedens TensorRT-LLM-software.

Ud over selve B200-kortet og GB200-superchippen sælger Nvidia også hele racks under navnet GB200 NVL72, hvor 72 GPU’er og 36 Grace-CPU’er kobles sammen i én fysisk enhed med fælles køling og strømforsyning. Det er den konfiguration, de fleste hyperscalere, herunder Microsoft, Amazon og Google selv i rollen som GPU-udbyder, bygger deres Blackwell-kapacitet omkring, fordi det forenkler både installation og drift sammenlignet med at sætte enkeltkort sammen manuelt. Et fuldt NVL72-rack vejer flere ton og kræver dedikeret væskekøling i hele rækken, hvilket er en af grundene til, at udrulningen af Blackwell-kapacitet i 2026 har været langsommere end mange kunder håbede på, simpelthen fordi datacentrene selv skal opgraderes til at understøtte den nye generation af køling og strømtræk.

Nvidia H200: Arbejdshesten i skyen lige nu

Selvom Blackwell får overskrifterne, er det stadig H200, der driver størstedelen af den betalte AI-inferens hos cloud-udbyderne i 2026. H200 er en opdatering af Hopper-arkitekturen fra H100, primært drevet af mere og hurtigere hukommelse: 141 GB HBM3e med omkring 4,8 terabyte i sekundet i båndbredde, cirka 1,4 gange mere end H100. Det lyder måske som en mindre opdatering, men i praksis er hukommelsesbåndbredde ofte den faktor, der begrænser inferenshastigheden for store sprogmodeller.

I MLPerf Inference v5.0 demonstrerede et system fra Lambda med otte H200-SXM-kort med 141 GB hukommelse hver en samlet gennemstrømning på mellem cirka 33.045 og 35.385 tokens i sekundet på GPT-lignende arbejdsbelastninger. Sammenlignet med de bedste H100-resultater fra MLPerf v4.1, hvor et tilsvarende system nåede omkring 24.525 tokens i sekundet, svarer det til en forbedring på cirka 40 til 43 procent i tokens per sekund for Llama 2 70B-arbejdsbelastninger. H200 sælges i dag typisk i samme prisleje som sen-cyklus H100, med gadepriser i størrelsesordenen 30.000 til 40.000 dollar per SXM-modul, afhængigt af leverandør og volumen.

Det, der gør H200 særligt relevant for danske virksomheder lige nu, er tilgængeligheden. Mens Blackwell-kapacitet stadig er ved at blive rullet ud hos de fleste cloud-udbydere, er H200 for længst moden nok til, at man kan booke kapacitet uden lange ventelister de fleste steder. Det gør chippen til det pragmatiske valg for teams, der skal i produktion nu, frem for at vente på næste generation. Samtidig er der et modent sekundmarked for brugt H100- og H200-hardware, hvilket presser prisen nedad for virksomheder, der ikke nødvendigvis behøver den absolut nyeste chip, men blot vil have pålidelig, veldokumenteret regnekraft til en forudsigelig pris.

Specifikationer sammenlignet: TPU v7 mod B200 mod H200

Tabellen nedenfor stiller de tre chips op mod hinanden på de tekniske parametre, der betyder mest for AI-arbejdsbelastninger: hukommelse, båndbredde, regnekraft og effektforbrug.

ParameterGoogle TPU v7 IronwoodNvidia H200Nvidia B200
LanceringApril 2026 (GA)2025-refresh af H100Blackwell, GA fra midt-2026
ProcesnodeTSMC N3 (3 nm)TSMC 4NPTSMC 4NP (dual-die)
HukommelsestypeHBM3EHBM3eHBM3E
Hukommelsesmængde192 GB141 GB192 GB
Hukommelsesbåndbredde~7,37-7,40 TB/s~4,8 TB/sOp til ~8 TB/s
FP8-ydeevne (per chip)~4.614 TFLOPSIkke primær metrikNative FP4-support
TDP600-1.000 W~700 W~1.000 W
InterconnectICI, 1,2 TB/s per linkNVLink 4NVLink 5, 1,8 TB/s per GPU
KølingVæskekølingLuft/væskeVæskekøling (primært)
Klyngeskala9.216 chips per superpodTypisk 8-GPU-noder72-GPU NVL72-racks
Est. hardwareprisIkke offentliggjort~30.000-40.000 USD~30.000-40.000 USD (SXM)
Primær use caseInferens i stor skalaInferens og finetuningTræning og inferens

Tallene viser, at Ironwood og B200 er tættere på hinanden i rå specifikation end mange havde forventet, mens H200 fortsat er den mest udbredte og bedst dokumenterede chip i produktion. Den store forskel ligger ikke i regnekraft per chip, men i hvordan de tre platforme skalerer op, og hvor godt softwarelagene understøtter dem i praksis.

Ydeevne og benchmarks: Hvad siger MLPerf?

MLPerf Training v6.0

I MLPerf Training v6.0, offentliggjort 16. juni 2026, indgik blandt andet en 64-GPU B200-klynge (otte noder med otte B200 hver), der trænede en GPT-OSS-20B-model. Resultatet blev brugt som eksempel på, hvor godt Blackwell-generationen skalerer på tværs af noder, med lavere energiforbrug per token end tilsvarende Hopper-baserede opsætninger. Google har til gengæld ikke indsendt formelle Ironwood-resultater til MLPerf Training endnu. De fleste TPU-indsendelser i 2026 stammer fra TPU v4, v5 og v6 “Trillium”, mens Ironwood primært optræder i uafhængige analyser og leverandørblogs, ikke i de officielle benchmarktabeller.

MLPerf Inference v5.0

På inferens-siden er billedet bedre dokumenteret for Nvidia. MLCommons’ officielle tabeller for MLPerf Inference v5.0 viser flere H200-systemer, heriblandt Lambdas otte-korts opsætning nævnt ovenfor. Flere 2026-analyser peger på, at Ironwoods rå FP8-gennemstrømning og hukommelsesbåndbredde er konkurrencedygtig med eller marginalt over B200 på papiret, men at Nvidias modne software-stak, med CUDA, TensorRT-LLM og bred PyTorch-understøttelse, stadig giver et forspring i reel gennemstrømning på standardiserede arbejdsbelastninger, særligt til træning. Ironwoods styrke ligger i stedet i, hvor mange chips Google kan koble sammen i én sammenhængende pod, og hvor tæt integreret chippen er med Googles interne infrastruktur til Gemini, Search og Ads.

En vigtig detalje for læsere, der selv skal vælge platform, er, at MLPerf-resultater sjældent er direkte sammenlignelige på tværs af producenter, fordi hver deltager selv vælger, hvilken model, batch-størrelse og softwareversion der testes med. Et B200-system optimeret specifikt til benchmarket vil ofte se bedre ud på papiret, end det gør i en almindelig produktionsopsætning med blandet trafik. Det samme gælder de analyser, der sammenligner Ironwood med Blackwell ud fra rå specifikationer frem for faktiske, uafhængigt målte resultater. Indtil Google offentliggør formelle MLPerf-indsendelser for Ironwood, bør enhver påstand om, at TPU’en er “hurtigere” end B200, læses som et estimat baseret på databladstal, ikke som et verificeret benchmarkresultat.

Cloud-priser: Google Cloud, AWS og Azure

Her adskiller de to platforme sig markant. Nvidia-chips kan lejes hos stort set alle store cloud-udbydere, mens TPU’er kun findes hos Google Cloud. Det giver Nvidia en fleksibilitetsfordel, men betyder også, at TPU-priser i højere grad er forhandlet individuelt frem for offentliggjort som listepris.

UdbyderChipEstimeret prisKilde/status
Google CloudTPU v7 Ironwood~1,60 USD/time (forhandlet)SemiAnalysis-estimat for Anthropics aftale
Google CloudTPU v7 Ironwood~8,00 USD/time (markedsestimat)Ikke officiel GCP-listepris
Google CloudH100/H200~3-4 USD/time per GPUOffentlig GCP-prisliste, udvalgte regioner
AWSH100/H200~3-4 USD/time per GPUOn-demand, før Savings Plans/Spot-rabat
AWSB200/GB200Præmie over H200Nye “premium AI”-instanstyper, 2026
AzureH100/H200~3-5 USD/time per GPUOn-demand, varierer efter instanstype
AzureBlackwell-klar GB200Ikke fuldt offentliggjortSKU’er annonceret, priser under udrulning

Det mest interessante datapunkt her er faktisk fraværet af tal: mere end tre måneder efter Ironwoods lancering har Google stadig ikke offentliggjort en officiel listepris per TPU-time. Googles egne udgivelsesnoter for Cloud TPU, dateret 22. april 2026, dokumenterer prisjusteringer for ældre generationer som v4, v5 og v6, men nævner ikke v7 med en fast sats. Det efterlader kunder, der ikke har volumen nok til at forhandle en aftale som Anthropics, i en situation, hvor de reelt ikke kan sammenligne TPU-omkostninger direkte med Nvidias mere gennemsigtige GPU-priser.

For danske virksomheder, der handler i danske kroner og euro, tilføjer valutakurser og europæisk moms endnu et lag af kompleksitet. Amerikanske cloud-udbydere prissætter typisk i dollar, og en forhandlet TPU-aftale som Anthropics er ikke automatisk tilgængelig for et mindre nordisk selskab uden tilsvarende volumen. I praksis betyder det, at de fleste danske og nordiske virksomheder i 2026 stadig betaler tættere på de offentlige listepriser for H100 og H200, mens kun de allerstørste nordiske aktører, typisk telekonglomerater eller store banker med egne AI-afdelinger, har forhandlingsstyrke nok til at nærme sig de rabatter, som globale AI-laboratorier som Anthropic har opnået.

Omkostning per token: Inferens-økonomien

For virksomheder, der driver AI-produkter i produktion, er den vigtigste metrik sjældent TFLOPS, men prisen per genereret token. Her har begge lejre fremlagt tal, som dog ikke er direkte sammenlignelige, fordi de stammer fra forskellige modeller, batch-størrelser og optimeringsniveauer. Nvidia oplyser, at B200 med TensorRT-LLM kan komme ned mod omkring 0,02 dollar per million tokens for GPT-lignende inferens, en klar forbedring i forhold til Hopper-generationen. På TPU-siden er der ingen officiel per-token-pris fra Google, men analysefirmaet SemiAnalysis’ estimat på 1,60 dollar per TPU-time for Anthropics Ironwood-kapacitet giver et fingerpeg om, at Google presser prisen hårdt ned for at vinde store, forudsigelige arbejdsbelastninger.

Konklusionen for nu er, at ingen af parterne har offentliggjort nok gennemsigtige, sammenlignelige tal til, at man kan kåre en entydig vinder på ren token-økonomi. Virksomheder bør i stedet regne på deres eget forbrugsmønster, gerne med et pilotprojekt på begge platforme, før de forpligter sig til en flerårig kapacitetsaftale.

En praktisk tommelfingerregel, flere infrastrukturteams bruger i 2026, er at regne total cost of ownership over minimum tolv måneder, ikke kun timeprisen. Det inkluderer datatransport ind og ud af skyen, lagerkapacitet til modelvægte og cache, samt den tid udviklerne bruger på at optimere kode til den valgte platform. En billigere timepris på TPU kan hurtigt blive opvejet, hvis teamet skal bruge flere uger på at portere kode fra CUDA til JAX, mens en dyrere, men velkendt GPU-platform kan komme hurtigere i produktion og dermed generere indtægt tidligere. Den slags bløde omkostninger fremgår sjældent af de officielle prislister, men bør indgå i enhver seriøs business case.

Arkitektur og økosystem: CUDA mod Googles TPU-stak

Hardware er kun halvdelen af historien. Nvidias største styrke er stadig økosystemet omkring CUDA, som efter næsten to årtier er den de facto-standard, som stort set alle AI-rammeværker, herunder PyTorch og TensorRT-LLM, er bygget til at understøtte først. Det betyder, at et team, der allerede kører på Nvidia-hardware, typisk kan skifte fra H200 til B200 med minimale kodeændringer, fordi driverne og kompileringsværktøjerne håndterer det meste af optimeringen.

Googles TPU-stak, bygget omkring JAX og XLA-kompileren, er derimod mere lukket, men til gengæld dybt optimeret til Googles egne arbejdsbelastninger. Det er samme infrastruktur, der driver Gemini, Google Search og Google Ads internt, hvilket giver Google et unikt indblik i, hvordan chippen opfører sig under massiv, vedvarende belastning, længe før eksterne kunder får adgang. Ulempen for udviklere uden for Google er, at TPU-økosystemet kræver mere tilpasning, og at værktøjer, biblioteker og fejlfindingsressourcer, der tages for givet i CUDA-verdenen, ofte er tyndere eller slet ikke findes til TPU.

Der er dog sket fremskridt på begge sider. PyTorch/XLA gør det i stigende grad muligt at køre standard PyTorch-kode på TPU’er med relativt få ændringer, hvilket sænker adgangsbarrieren for teams, der ikke ønsker at omskrive alt i JAX. Omvendt investerer Nvidia massivt i at gøre CUDA-værktøjerne mere tilgængelige for ikke-eksperter gennem højtniveau-biblioteker som TensorRT-LLM og NeMo, så flere udviklere kan drage nytte af Blackwell-hardwarens ydeevne uden selv at skrive lavniveau-kode. Forskellen mellem de to økosystemer er derfor ved at blive mindre markant end for bare et par år siden, men Nvidia har stadig et forspring i antallet af færdige integrationer, community-eksempler og tredjepartsværktøjer.

Når man taler om AI-infrastruktur i 2026, handler det sjældent om én chip ad gangen, men om hvor mange chips der kan arbejde sammen som én sammenhængende enhed. Her adskiller Ironwood og Blackwell sig arkitektonisk. Ironwood bruger et 3D-torus-interconnect, der binder op til 9.216 chips sammen i én superpod med 1,77 petabyte delt HBM-hukommelse og en teoretisk kapacitet på 42,5 exaflops FP8. Det er designet til at flytte enorme mængder inferenstrafik gennem Googles eget netværk uden at flaske halsen ved chip-til-chip-kommunikation.

Nvidias tilgang med NVLink 5 og GB200 NVL72-rackene fokuserer i stedet på tætpakkede racks med op til 72 GPU’er koblet sammen med 1,8 terabyte i sekundet per GPU. Det giver ekstremt lav latenstid inden for et rack, men skalering ud over det enkelte rack afhænger stadig af det almindelige datacenter-netværk. For arbejdsbelastninger, der kræver massiv parallel inferens på tværs af tusindvis af chips, kan Googles pod-arkitektur derfor have en strukturel fordel, mens Nvidias rack-baserede tilgang typisk giver den bedste ydeevne for tætte, latenskritiske trænings- eller inferensjobs inden for et enkelt rack.

Energiforbrug og datacenterkrav i Norden

Effektforbrug er ikke kun en teknisk detalje, det er en økonomisk faktor, der vejer tungt i Norden, hvor både strømpriser og adgang til grøn energi indgår direkte i beslutningen om, hvor et datacenter skal placeres. Både Ironwood og B200 ligger i den øvre ende af effektforbrug per chip sammenlignet med tidligere generationer, og en fuld superpod eller et fuldt NVL72-rack trækker en effektmængde, der kræver dedikeret højspændingstilslutning og industriel køling. For danske og svenske datacenteroperatører, der historisk har markedsført sig på adgang til billig vindkraft og vandkraft, betyder det, at den næste bølge af AI-infrastruktur i højere grad handler om at sikre stabil, storskala strømforsyning end om at finde billig grund.

Google har ikke offentliggjort konkrete planer om at placere Ironwood-kapacitet i danske eller nordiske datacentre, men koncernen driver allerede større datacentre i Finland og har tidligere udvidet sin nordiske tilstedeværelse i takt med stigende efterspørgsel efter cloud-tjenester. Nvidia-baseret kapacitet er allerede tilgængelig gennem flere cloud-udbydere med europæiske datacentre, herunder muligheden for at holde data inden for EU af hensyn til GDPR og databeskyttelse. For virksomheder, der har krav om, at data og beregning forbliver i EU, er det derfor i praksis lettere at finde compliant Nvidia-kapacitet end TPU-kapacitet lige nu, simpelthen fordi Google endnu ikke har bekræftet en europæisk Ironwood-udrulning med samme detaljeringsgrad som i USA og Asien.

Virkelige eksempler: Hvem bruger hvad i 2026

Teori og specifikationer er én ting. Det, der reelt afgør, hvilken platform der vinder markedsandele, er hvem der rent faktisk kører produktionstrafik på hver chip. Her er fem konkrete eksempler fra 2026:

  • Anthropic har ifølge SemiAnalysis’ analyse forhandlet sig til en TPU-kapacitetsaftale med Google Cloud til en estimeret pris på omkring 1,60 dollar per TPU-time for Ironwood-kapacitet, en af de første store, dokumenterede eksterne kunder på den nye generation.
  • Google selv kører sine største interne arbejdsbelastninger, herunder Gemini, Google Search og Google Ads, på TPU-infrastruktur, hvilket giver virksomheden et internt “referencekundeskab”, som eksterne TPU-kunder ikke har adgang til på samme måde.
  • Lambda stiller otte-korts H200-SXM-systemer til rådighed og har offentliggjort resultater i MLPerf Inference v5.0, hvor systemet opnåede mellem cirka 33.000 og 35.000 tokens i sekundet på GPT-lignende arbejdsbelastninger.
  • AWS tilbyder H100- og H200-instanser bredt til on-demand-leje og har annonceret Blackwell-klasse “premium AI”-instanstyper som forhåndsvisning i 2026, prissat med et tillæg over H200.
  • Microsoft Azure har annonceret “Blackwell-klar” GB200-SKU’er til virksomhedskunder, men holder fortsat de fleste listepriser tilbage, mens H100- og H200-instanser udgør hovedparten af den faktiske betalte kapacitet i 2026.

Det fælles træk ved disse fem eksempler er, at ingen af de store aktører har lagt alle æg i én kurv. Selv Google, der har den mest oplagte interesse i at promovere sin egen TPU-teknologi, driver fortsat betydelig GPU-kapacitet til kunder, der specifikt efterspørger Nvidia-hardware gennem Google Cloud. Det afspejler en bredere tendens i 2026: uanset hvor overbevisende specifikationerne på papiret ser ud, vælger de fleste store AI-brugere en multi-chip-strategi for at undgå at blive afhængige af én enkelt leverandørs prisfastsættelse, leveringstider eller arkitektoniske valg.

Fem brugsscenarier: Hvornår skal du vælge TPU eller GPU

Valget mellem TPU og GPU afhænger i høj grad af arbejdsbelastningens karakter, ikke kun af pris. Her er fem konkrete scenarier og vores anbefaling for hver:

  • Massiv, forudsigelig inferenstrafik (chatbot i produktion med millioner af daglige forespørgsler): Overvej TPU v7 Ironwood, hvis I allerede er på Google Cloud og kan forhandle en volumenaftale, da inferensfokus og podskala passer godt til stabile, høje trafikmængder.
  • Finetuning og eksperimentel modeltræning i mindre team: Vælg Nvidia H200 eller B200, fordi CUDA-økosystemets modenhed og bredere cloud-tilgængelighed gør iteration hurtigere for teams uden dedikerede TPU-specialister.
  • Multi-cloud-strategi, hvor I ikke vil binde jer til én udbyder: Nvidia-chips vinder automatisk, fordi TPU’er udelukkende findes hos Google Cloud, mens H200 og B200 kan lejes hos AWS, Azure, GCP og en række mindre GPU-cloud-udbydere.
  • Træning af store fundamentmodeller fra bunden: Nvidia B200 og GB200 NVL72 har på nuværende tidspunkt den bedste dokumentation i MLPerf Training, og økosystemet omkring distribueret træning er markant mere modent end på TPU-siden.
  • Begrænset budget og behov for gennemsigtig prissætning: Vælg Nvidia-baseret kapacitet hos en cloud-udbyder med offentlig listepris, da TPU v7 stadig mangler en officiel, offentligt tilgængelig timepris mere end tre måneder efter lancering.

Der findes naturligvis gråzoner mellem disse fem scenarier. Mange danske virksomheder vil opdage, at deres arbejdsbelastning i praksis er en blanding: en periode med finetuning efterfulgt af stabil inferens i produktion. I de tilfælde giver det ofte mening at starte på Nvidia-hardware, hvor iterationshastigheden er højest, og først overveje en flytning til TPU, når trafikmønstret er stabilt nok til at retfærdiggøre den ekstra tilpasningsindsats. Det er sjældent den rigtige strategi at vælge platform ud fra, hvad der er mest omtalt i pressen, snarere end hvad der faktisk passer til ens eget trafikmønster og teamets tekniske kompetencer.

Sådan migrerer du mellem TPU- og GPU-infrastruktur

En migration mellem TPU og GPU er sjældent en simpel “løft og flyt”-øvelse, fordi de to platforme bruger forskellige softwarelag. Her er den rækkefølge, vi anbefaler, hvis I overvejer at skifte, uanset retningen:

  1. Kortlæg jeres nuværende arbejdsbelastning: er det primært træning, finetuning eller ren inferens? Det afgør, om Ironwoods inferensfokus overhovedet er relevant.
  2. Test modellens kompatibilitet med JAX/XLA, hvis I flytter til TPU, eller bekræft CUDA-versionsunderstøttelse, hvis I flytter til nyere Nvidia-hardware som B200.
  3. Kør et mindre pilotprojekt med et repræsentativt udsnit af jeres produktionstrafik på den nye platform, før I flytter alt.
  4. Mål faktisk gennemstrømning og latenstid under realistisk belastning, ikke kun syntetiske benchmarks, da forskelle i batch-størrelse kan give store udsving.
  5. Forhandl prisen direkte med udbyderen, særligt ved TPU-kapacitet, hvor listepriser endnu ikke findes, og hvor volumen kan give markant bedre vilkår end standardsatserne.
  6. Byg en exitstrategi ind i aftalen fra start, så I ikke låses fast til én chiptype, hvis priser eller ydeevne ændrer sig i løbet af kontraktperioden.
  7. Overvåg energiforbrug og køleomkostninger separat, da både Ironwood og B200 kræver væskekøling ved fuld belastning, hvilket kan påvirke jeres samlede driftsomkostninger uden for selve chip-lejen.

Uanset hvilken retning migrationen går, anbefaler vi, at teamet afsætter mindst fire til seks uger til selve overgangen, inklusive tid til at genoptræne interne processer for overvågning, fejlfinding og kapacitetsplanlægning. En hyppig fejl er at undervurdere, hvor meget observability-værktøjerne, altså logning, metrikker og alarmering, skal tilpasses, når man skifter platform. CUDA-baserede miljøer har typisk et modent økosystem af overvågningsværktøjer, mens TPU-miljøer ofte kræver mere skræddersyet instrumentering for at opnå samme indsigt i, hvor flaskehalsene reelt opstår.

Fordele og ulemper: TPU v7 mod Nvidia B200/H200

Google TPU v7 Ironwood

Fordele: Markant hukommelsesbåndbredde og -kapacitet per chip, imponerende podskala med op til 9.216 chips i én sammenhængende enhed, tæt integration med Googles egen infrastruktur og dokumenteret vilje til at give store kunder som Anthropic aggressive volumenpriser.

Ulemper: Ingen offentlig listepris mere end tre måneder efter lancering, kun tilgængelig hos Google Cloud, mindre modent software-økosystem uden for Googles egne rammer, og fravær af formelle MLPerf Training-resultater gør det svært at verificere ydeevnepåstande uafhængigt.

Nvidia H200 og B200

Fordele: Bredt tilgængelig hos AWS, Azure, Google Cloud og mange mindre udbydere, modent CUDA/TensorRT-LLM-økosystem, dokumenterede MLPerf-resultater for både træning og inferens, og gennemsigtige, om end høje, hardwarepriser i størrelsesordenen 30.000 til 40.000 dollar per SXM-modul.

Ulemper: Højt effektforbrug og krav om væskekøling ved Blackwell-generationen, fortsat høj efterspørgsel skaber lange leveringstider på ny hardware, og Blackwell-priser i skyen er stadig under udrulning hos flere udbydere, hvilket betyder begrænset prissammenligning på tværs af cloud-platforme lige nu.

Et ekstra punkt, der ofte overses i den slags sammenligninger, er support og servicevinduer. Nvidia har gennem årtiers samarbejde med serverproducenter som Dell, HPE og Supermicro opbygget et bredt netværk af certificerede partnere, der kan levere support på hardwareniveau uden om selve cloud-udbyderen. TPU-hardware findes udelukkende i Googles egne datacentre, hvilket betyder, at al support går gennem Google Cloud som eneste kontaktpunkt. For virksomheder med strenge krav til oppetid og eskaleringsveje kan det i sig selv være en afgørende faktor, uafhængigt af rå ydeevne eller pris.

Konklusionen: Hvem vinder AI-chipkrigen i 2026?

Der findes ikke ét entydigt svar, men tallene peger på en klar arbejdsdeling. Nvidia H200 og B200 vinder stadig på dokumentation, tilgængelighed og økosystemmodenhed. De findes hos alle store cloud-udbydere, har officielle MLPerf-resultater for både træning og inferens, og prisen, selvom den er høj, er i det mindste kendt på forhånd. Det gør Nvidia-hardware til det sikre valg for de fleste virksomheder, der skal træne modeller eller migrere hurtigt uden dybe TPU-specialkompetencer internt.

Google TPU v7 Ironwood er derimod det mere interessante væddemål for virksomheder med massiv, forudsigelig inferenstrafik og en villighed til at forhandle direkte med Google. Kombinationen af 192 GB HBM3E, 42,5 exaflops FP8 per superpod og en dokumenteret pris helt ned til 1,60 dollar per time for storkunder som Anthropic tyder på, at Google er villig til at underbyde Nvidia markant for at vinde markedsandele i inferenslaget. Indtil Google offentliggør en officiel listepris, forbliver det dog et tilbud, der reelt kun er tilgængeligt for kunder med nok forhandlingsstyrke til at få adgang til det.

For danske og nordiske virksomheder er den praktiske anbefaling at holde fast i Nvidia-baseret kapacitet til det meste af 2026, men samtidig følge tæt med på, om Google åbner Ironwood-priser op for mindre kunder. Sker det, kan prispresset sprede sig til hele markedet, også til Nvidias GPU-priser hos konkurrerende cloud-udbydere.

Det er også værd at holde øje med, hvordan konkurrencen udvikler sig videre ud i 2026 og 2027. AMD presser på med sin MI325X- og kommende MI350-serie som et tredje alternativ til både TPU og Nvidia-GPU’er, mens flere specialiserede AI-chipfirmaer forsøger at finde nichemarkeder, hvor hverken Google eller Nvidia dominerer fuldstændigt. Den korte version er, at 2026 ikke bliver året, hvor AI-chipmarkedet konsolideres til én vinder. Det bliver snarere året, hvor forskellen mellem platformene bliver tydeligere defineret: Nvidia som det brede, fleksible standardvalg, og Google TPU v7 som det specialiserede, prisaggressive alternativ for de kunder, der har volumen og tålmodighed nok til at forhandle sig til det.

Ofte stillede spørgsmål

Er Google TPU v7 Ironwood hurtigere end Nvidia B200?
På rå specifikationer som hukommelse og FP8-gennemstrømning ligger de to chips tæt på hinanden, med Ironwood marginalt foran på nogle mål og B200 marginalt foran på andre, som hukommelsesbåndbredde. Der findes endnu ingen direkte, uafhængigt verificeret benchmark, der sammenligner dem hoved mod hoved under identiske forhold.

Kan jeg leje TPU v7 uden for Google Cloud?
Nej. TPU’er er en proprietær Google-teknologi, der udelukkende er tilgængelig gennem Google Cloud. Nvidia-chips som H200 og B200 kan derimod lejes hos flere udbydere, herunder AWS, Azure og en række specialiserede GPU-cloud-selskaber.

Hvor meget koster det at leje TPU v7 Ironwood?
Google har ikke offentliggjort en officiel listepris. Analysefirmaet SemiAnalysis estimerer, at Anthropic betaler omkring 1,60 dollar per TPU-time i en forhandlet aftale, mens andre kilder angiver et generelt markedsestimat på op mod 8 dollar i timen for mindre kunder uden samme forhandlingsstyrke.

Hvad koster en Nvidia B200 eller H200 i praksis?
Som enkeltkøb ligger både B200 SXM-moduler og H200-moduler typisk i intervallet 30.000 til 40.000 dollar per kort ifølge 2026-analyser. En komplet GB200-superchip, der kombinerer to B200-GPU’er med én Grace-CPU, estimeres til omkring 60.000 til 70.000 dollar før eventuelle volumenrabatter.

Er TPU v7 kun til inferens, eller kan den også bruges til træning?
Ironwood er primært designet og markedsført til inferens i stor skala. Google bruger fortsat TPU v6 “Trillium” som sin primære trænings-chip, og der findes endnu ingen formelle MLPerf Training-resultater for Ironwood, hvilket gør det svært at vurdere chippens træningsydeevne uafhængigt.

Hvilken chip bruger flest AI-virksomheder i 2026?
Nvidia H200 er fortsat den mest udbredte chip til betalt AI-inferens på tværs af cloud-udbydere, mens B200 vinder frem hos virksomheder, der træner nye, store modeller. Ironwood har endnu kun et fåtal dokumenterede storkunder, heriblandt Anthropic, men bruges internt i stort omfang af Google selv til Gemini, Search og Ads.

Kræver Ironwood og B200 samme type køling?
Ja, i store træk. Begge chips har et effektforbrug tæt på eller over 1.000 watt i deres kraftigste konfigurationer, hvilket i praksis kræver væskekøling i datacentret for at holde temperaturerne på et sikkert niveau under vedvarende, høj belastning.

Bør en mindre dansk virksomhed vælge TPU eller GPU til sit første AI-projekt?
For de fleste mindre teams er Nvidia-baseret kapacitet hos en etableret cloud-udbyder det mest praktiske valg, fordi dokumentationen, værktøjerne og support-økosystemet omkring CUDA er langt mere modent. TPU giver først reel mening, når arbejdsbelastningen er stor og forudsigelig nok til at retfærdiggøre en direkte forhandling med Google.

Kan jeg køre samme AI-model på både TPU og GPU uden at omskrive den?
Delvist. Værktøjer som PyTorch/XLA og JAX gør det muligt at køre mange modeller på begge platformtyper med relativt begrænsede ændringer, men fuld ydeevneoptimering kræver typisk platformspecifik tilpasning. Jo mere en model er skræddersyet til CUDA-specifikke funktioner, desto mere arbejde kræver en flytning til TPU, og omvendt.

Hvornår kommer TPU v7 Ironwood til europæiske datacentre?
Google har ikke offentliggjort en bekræftet tidsplan for europæisk udrulning af Ironwood. Chippen blev først tilgængelig i USA og udvalgte asiatiske regioner fra april 2026, og virksomheder med krav om, at data forbliver inden for EU, bør holde øje med officielle udmeldinger fra Google Cloud, før de planlægger en TPU-baseret arkitektur til europæisk drift.