AMD sendte ROCm 10 ud af døren den 27. august 2026 med et løfte, der får branchen til at spidse ører: op til 3,3 gange hurtigere AI-inferens og 2,4 gange hurtigere træning sammenlignet med ROCm 7, målt på samme hardware. To uger senere, den 9. september, svarede Nvidia med CUDA Toolkit 13.4 og en opdatering til 13.4.1 samme måned. Kampen om, hvilket softwarelag der driver verdens AI-modeller, er i gang igen, og denne gang handler det ikke kun om rå GPU-kraft. Det handler om hvilken platform udviklere rent faktisk kan bruge uden at omskrive deres kode.
For danske og nordiske virksomheder, der bygger AI-infrastruktur eller lejer GPU-tid i skyen, er valget mellem CUDA og ROCm ikke længere kun et spørgsmål om Nvidias dominans. AMD har hentet et af de største AI-selskaber i verden ind som kunde, hukommelsespriserne er eksploderet, og de to platforme konkurrerer nu på flere fronter end nogensinde. Denne artikel går igennem specifikationer, priser, ydelse og reelle eksempler, så du kan vurdere hvilken platform der passer til dit projekt.
Beslutningen handler sjældent kun om, hvilket kort der er hurtigst i et enkelt benchmark. Den handler om, hvor let dit team kan komme i produktion, hvad det koster at leje eller købe hardware lige nu, og hvor afhængig din virksomhed vil gøre sig af én enkelt leverandør de næste fem år. Vi har samlet officielle spec-ark, offentliggjorte cloud-priser og verificerede udtalelser fra AMD, så du kan danne dig et billede uden at skulle stole på marketingslides fra begge lejre.
Hvad er CUDA? Nvidias lukkede AI-fundament
CUDA (Compute Unified Device Architecture) er Nvidias proprietære softwarelag, der oversætter kode til instruktioner, GPU’en kan udføre. Platformen har eksisteret siden 2007 og er i dag den mest udbredte vej ind i GPU-accelereret beregning. Næsten hver eneste bog, tutorial og produktionspipeline inden for maskinlæring er skrevet med CUDA som udgangspunkt, og det giver Nvidia et forspring, som ikke handler om transistorer, men om vaner.
Den nyeste udgave, CUDA Toolkit 13.4, udkom den 9. september 2026 og tilføjede blandt andet udviklerforhåndsvisning af understøttelse for Nvidias kommende Rubin-arkitektur, support til Windows på Arm og ændringer i Multi-Process Service V3, ifølge Nvidias officielle CUDA-arkiv. Opdateringen 13.4.1 fulgte samme måned, dokumenteret i Nvidias release notes. CUDA er lukket kildekode, men den kører på stort set alt Nvidia-hardware fra bærbare RTX-kort til datacenterets B200-accelerator, hvilket giver en usædvanlig bred og forudsigelig platform at udvikle på.
Hvad er ROCm 10? AMDs åbne svar
ROCm (Radeon Open Compute) er AMDs open source-modstykke til CUDA. Hvor Nvidia holder sin stak lukket, har AMD valgt at lægge det meste af ROCm åbent på GitHub, inklusive compileren HIP, der oversætter CUDA-lignende kode til noget, AMDs GPU’er kan forstå. ROCm Core SDK 10.0.0 blev sendt ud den 27. august 2026, og den nye version udvider understøttelsen til AMDs nyeste Instinct-familie.
AMD har brugt de seneste år på systematisk at lukke de huller, som tidligere fik udviklere til at opgive ROCm midtvejs i et projekt. Det gælder blandt andet mere stabile Linux-kerneversioner, bedre fejlmeddelelser i selve runtime-laget og en klarere adskillelse mellem, hvad der er officielt supporteret, og hvad der stadig er eksperimentelt. Resultatet er en platform, der ikke længere kun er interessant for forskningsprojekter med tid til at fejlfinde drivere, men som nu bliver taget alvorligt af virksomheder, der skal drive produktion i stor skala.
Ifølge AMDs officielle kompatibilitetsmatrix dækker ROCm 10 fire arkitekturgenerationer: CDNA (gfx908, MI100), CDNA 2 (gfx90a, MI210/MI250/MI250X), CDNA 3 (gfx942, MI300X/MI300A/MI325X) og CDNA 4 (gfx950, MI350X/MI350P/MI355X). Det er en markant udvidelse fra tidligere versioner og et tegn på, at AMD forsøger at lukke hullet til Nvidias bredere hardwaredækning. AMD annoncerede desuden en flerårig partnerskabsaftale med Anthropic om levering af op til 2 gigawatt AMD Instinct MI450-GPU’er i Helios-rackløsninger, med det første gigawatt målsat til første halvdel af 2027, ifølge en semiconductor-branchebriefing fra Originbrief.
Specifikationer side om side: CUDA vs ROCm 10
Tabellen herunder stiller de to platforme op mod hinanden på både hardware- og softwareniveau. Tallene er hentet fra officielle spec-ark fra Nvidia og AMD samt de to virksomheders egen dokumentation.
| Egenskab | Nvidia / CUDA | AMD / ROCm 10 |
|---|---|---|
| Seneste softwareversion | CUDA Toolkit 13.4.1 | ROCm Core SDK 10.0.0 |
| Udgivelsesdato | 9. september 2026 | 27. august 2026 |
| Licensmodel | Proprietær, lukket kildekode | Open source (de fleste komponenter) |
| Understøttede GPU-arkitekturgenerationer | Flere generationer via compute capability (sm_*), inkl. udvikler-preview af Rubin | 4 generationer: CDNA, CDNA 2, CDNA 3, CDNA 4 (gfx908 til gfx950) |
| Topmodel: HBM-kapacitet | 180 GB HBM3e (B200 SXM) | 288 GB HBM3E (MI355X OAM) |
| Topmodel: hukommelsesbåndbredde | 8,0 TB/s (B200 SXM) | 8,0 TB/s (MI355X OAM) |
| Topmodel: strømforbrug (TDP) | Op til 1.000 W (B200 SXM) | 1.400 W maks. (MI355X OAM) |
| PyTorch-understøttelse | Fuld, native | Fuld, upstream i hovedgrenen |
| TensorFlow-understøttelse | Fuld, native | Understøttet, opdateres separat |
| JAX-understøttelse | Fuld, native | Understøttet |
| vLLM / SGLang-understøttelse | Fuld, bredest tredjepartsdækning | Understøttet på MI300X, MI325X og MI355X |
| Desktop-GPU-markedsandel, Q2 2026 | Cirka 90 procent | Cirka 8 procent |
Hardware-tallene i tabellen stammer fra Nvidias og AMDs egne produktdatablade for henholdsvis B200 SXM og MI355X OAM, mens PyTorch- og markedsandelstallene er dokumenteret i AMDs kompatibilitetsmatrix og en analyse fra Tech Insider. Læg mærke til, at MI355X faktisk overhaler B200 på hukommelseskapacitet, selvom Nvidia stadig ejer langt størstedelen af markedet.
Compute capability vs gfx-targets: hvorfor sammenligningen ikke er 1:1
Et vigtigt forbehold, når man sammenligner arkitekturunderstøttelse, er at Nvidia og AMD ikke tæller generationer på samme måde. CUDA bruger såkaldte compute capability-numre, skrevet som sm_70, sm_80, sm_90 og så videre, hvor hvert tal repræsenterer en instruktionssæt-generation, der ofte dækker flere forskellige GPU-modeller på tværs af både forbruger- og datacenterserier. ROCm bruger i stedet gfx-targets som gfx942 og gfx950, der er organiseret omkring AMDs CDNA-generationer specifikt til Instinct-serverkort.
Det betyder, at et simpelt “Nvidia understøtter flere generationer end AMD” er en misvisende konklusion. CUDA’s bredde kommer af, at platformen dækker alt fra bærbare RTX-kort til B200, mens ROCm 10’s fire generationer udelukkende er rettet mod Instinct-serien. Sammenligner man kun datacenter-hardware mod datacenter-hardware, indsnævres forskellen betydeligt, men CUDA vinder stadig på at have et sammenhængende økosystem, der spænder fra en studerendes bærbare til et helt hyperscaler-rack uden at skifte software-stack undervejs.
Hukommelse og båndbredde: hvem har mest at give AI-modellerne
Store sprogmodeller er ofte begrænset af, hvor meget der kan ligge i GPU-hukommelsen ad gangen, ikke kun af regnekraften. Her har AMD et reelt argument. Instinct MI300X kommer med 192 GB HBM3 og 5,3 TB/s båndbredde, mens Nvidias H100 SXM byder på 80 GB HBM3 og 3,35 TB/s. Selv Nvidias nyere H200 SXM med 141 GB HBM3e og 4,8 TB/s ligger under MI300X på kapacitet.
Forskellen bliver endnu tydeligere længere oppe i skalaen. MI325X byder på 256 GB HBM3E og 6,0 TB/s ved 1.000 W, mens B200 SXM leverer 180 GB HBM3e og 8,0 TB/s ved samme effektforbrug. AMDs nyeste MI355X presser kapaciteten helt op til 288 GB, samtidig med at båndbredden matcher B200’s 8,0 TB/s. For teams der træner eller kører inferens på modeller med mange milliarder parametre, betyder ekstra hukommelse ofte færre GPU’er per klynge, hvilket kan opveje en eventuel softwareulempe.
Konkret betyder det, at en model, der lige akkurat ikke kan være i hukommelsen på et enkelt H100-kort, måske sagtens kan være det på et enkelt MI300X-kort, uden at man skal ty til model-parallelisme på tværs af flere GPU’er. Færre kort i spil betyder mindre netværkskommunikation mellem kortene, hvilket ofte er en større flaskehals for samlet ydelse end selve regnekraften i det enkelte kort. Det er en af de klareste tekniske grunde til, at store AI-labs som Anthropic er villige til at investere i en platform, der stadig kræver mere opsætningsarbejde end CUDA.
Ydelsen ifølge AMD: hvad de 3,3x faktisk dækker over
AMDs påstand om 3,3 gange hurtigere inferens og 2,4 gange hurtigere træning er en sammenligning af ROCm 10 mod virksomhedens egen forgænger, ROCm 7, kørt på samme hardware. Det er altså ikke et direkte opgør med CUDA, men et mål for hvor meget AMD selv har flyttet sin software på under et år. Tallet er fra AMDs egne lanceringsmaterialer, dokumenteret af Originbrief, og bør læses som en leverandørangivelse, indtil uafhængige laboratorier har kørt deres egne tests.
På Nvidias side annoncerede virksomheden den 26. august 2026 en ny hukommelsesteknologi kaldet NVHBM, som ifølge samme kilde skal give op til 30 procent højere hukommelsesbåndbredde, 15 procent lavere strømforbrug i HBM-laget og op til 25 procent mere plads til compute-dies sammenlignet med almindelig HBM4E. Begge tal er vigtige at holde op mod hinanden, fordi de viser, at hverken Nvidia eller AMD står stille. Ingen af parterne har offentliggjort en uafhængig, tredjeparts benchmark, der sammenligner PyTorch- eller vLLM-ydelse direkte mellem CUDA og ROCm 10 på tilsvarende hardware, så en sammenligning af rå fart bør vente, til den slags data findes.
Det er værd at bemærke forskellen i, hvad de to tal faktisk måler. AMDs 3,3x er en software-forbedring, altså hvor meget mere effektivt ROCm 10 udnytter den samme fysiske hardware sammenlignet med ROCm 7. Nvidias NVHBM-tal er derimod en hardware-forbedring i selve hukommelseslaget, der vil gælde på tværs af alle fremtidige CUDA-versioner, der kører på chips med den nye hukommelsesteknologi. De to virksomheder optimerer altså i to forskellige lag af stakken lige nu, hvilket gør en direkte sammenligning mellem de to procenttal misvisende, selv om begge tal er reelle og verificerbare hver for sig.
Markedsandele: Nvidias 90 procent dominans
Tallene fra det diskrete desktop-GPU-marked fortæller en klar historie. I andet kvartal 2026 sad Nvidia på cirka 90 procent af markedet med omkring 11,25 til 12,5 millioner solgte enheder, mens AMD lå på omkring 8 procent svarende til cirka 1 million enheder, og Intels Arc-kort tog de resterende 2 procent, ifølge en markedsanalyse fra Tech Insider. Det betyder, at langt de fleste udviklere, der eksperimenterer med lokal AI på deres egen maskine, gør det på Nvidia-hardware, og det forstærker CUDA’s forspring endnu mere, fordi flest mennesker lærer og debugger på det, de allerede har stående.
I datacenter-segmentet er billedet mere broget. Nvidias kommende Vera Rubin NVL72-system gik i produktion i september 2026, og CoreWeave har allerede annonceret udrulning, ifølge en oversigt fra AIMultiple. AMDs svar, MI455X i Helios-rackform, er også i produktion med de første leverancer forventet ved udgangen af tredje kvartal 2026. Kapløbet om de store hyperscaler-kontrakter foregår altså sideløbende med kapløbet om udviklernes hjerter, og de to markeder følger ikke nødvendigvis samme mønster.
Det er værd at fremhæve, hvor forskelligt de to markeder opfører sig. På desktop-siden er Nvidias dominans stort set uantastet og har været det i flere år, fordi gaming-kort og AI-eksperimenter i vid udstrækning kører på samme hardware. I datacenter-segmentet er konkurrencen langt tættere, fordi indkøb her handler om kontrakter i milliard- og gigawatt-skala, hvor en enkelt stor kunde som Anthropic kan flytte markedsopfattelsen markant på kort tid. Det betyder, at markedsandelstal fra desktop-segmentet ikke bør bruges som en proxy for, hvem der vinder kampen om de store AI-trænings-klynger.
Prissammenligning: hvad koster GPU-timen i skyen
Cloud-priser skifter ofte, men de officielt udgivne satser giver et solidt øjebliksbillede af, hvad de to økosystemer koster at leje i september 2026. Tabellen herunder viser offentliggjorte timepriser fra to af de mest brugte GPU-cloud-udbydere.
| GPU | Udbyder | Pris per time (USD) | Note |
|---|---|---|---|
| Nvidia H100 PCIe | RunPod | 1,99 $ | Community Cloud |
| Nvidia H100 SXM | RunPod | 3,49 $ | Secure Cloud |
| Nvidia H100 SXM | Lambda | 3,99 $ | Standard instans |
| Nvidia H200 | RunPod | 3,59 til 4,59 $ | Afhænger af Community/Secure Cloud |
| Nvidia B200 | RunPod | 6,79 $ | Secure Cloud |
| Nvidia B200 | Lambda | 6,69 til 6,99 $ | SXM6-konfiguration |
| AMD Instinct MI300X | RunPod / Lambda / TensorWave | Ikke offentliggjort | Ingen af de tre udbydere har en officiel selvbetjent timepris |
| AMD Instinct MI325X | RunPod / Lambda / TensorWave | Ikke offentliggjort | Kun bundlede eller kundetilpassede aftaler fundet |
Priserne for Nvidia-GPU’er er hentet direkte fra RunPods prisside og Lambdas officielle prisliste. Det springende punkt er, at ingen af de store selvbetjente cloud-udbydere i vores research har en synlig, offentlig timepris for AMDs MI300X eller MI325X. Det betyder ikke, at AMD-hardware er utilgængelig, men at adgangen typisk går gennem kundetilpassede aftaler eller specialiserede udbydere som TensorWave, ikke gennem et kreditkort og en “deploy”-knap. Den forskel i tilgængelighed er lige så vigtig som selve GPU-prisen for en udvikler, der bare vil teste noget hurtigt.
Framework-support: PyTorch, TensorFlow, JAX og vLLM
Her er ROCm 10 kommet markant tættere på CUDA, end platformen var for få år siden. PyTorch bygges nu med native ROCm-understøttelse direkte i hovedgrenen, hvilket betyder, at de fleste modeller, der er skrevet til CUDA, kan køre på AMD-hardware uden en fuldstændig omskrivning. TensorFlow og JAX følger med, om end opdateringstempoet ikke altid matcher CUDA-versionerne én til én.
Inferens-motorerne vLLM og SGLang understøttes nu på MI300X, MI325X og MI355X, hvilket lukker et af de huller, der tidligere fik AMD til at halte bagefter, når nye modeller skulle sættes i produktion hurtigt. CUDA har stadig den bredeste dækning, fordi størstedelen af verdens open source AI-værktøjer bliver udviklet og testet på Nvidia-hardware først, men afstanden er ikke, hvad den var for to år siden.
Det praktiske resultat er, at et team, der udelukkende arbejder med de store, etablerede frameworks, i dag kan flytte mellem CUDA og ROCm med relativt lille friktion. Risikoen ligger i randen af økosystemet: nichebiblioteker til for eksempel computer vision, lyd- eller video-modeller, hvor en enkelt vedligeholder ofte kun har testet og optimeret koden mod CUDA, fordi det er der, flertallet af brugerne befinder sig. Før man vælger ROCm til et produktionssystem, bør man derfor tjekke hver eneste afhængighed i kravfilen, ikke kun de store navne som PyTorch og Hugging Face Transformers.
Udviklererfaring: dokumentation, community og drivere
CUDA vinder stadig på ren volumen af dokumentation. Med næsten to årtiers forspring findes der utallige Stack Overflow-tråde, kursusmaterialer og færdige Docker-images bygget specifikt til CUDA. Installation er i de fleste tilfælde et spørgsmål om at installere den rigtige driver og køre en pakkehåndtering, og fejlmeddelelser er ofte allerede besvaret et sted online.
ROCm kræver typisk mere omhu ved opsætning, særligt på forbrugerkort, hvor understøttelsen historisk har været smallere end på Instinct-serverkortene. AMDs egen dokumentation, herunder kompatibilitetsmatricen for ROCm 10, er blevet mere detaljeret, og AMD har investeret tungt i at gøre driverstakken mere forudsigelig på tværs af Linux-distributioner. Fordelen ved en åben stak er, at fejl kan spores og rettes af alle, ikke kun af Nvidias interne teams, men det kræver også, at nogen rent faktisk gør det.
For et udviklerteam, der skal vælge platform i dag, er den praktiske forskel ofte mest mærkbar i den første uge. På CUDA kan en ny medarbejder typisk gå fra en frisk maskine til kørende træningsjob på under en time, fordi driver-installation, containerimages og biblioteksversioner er testet i utallige kombinationer af andre før dem. På ROCm er processen mere forudsigelig end for et par år siden, men kræver stadig, at man følger AMDs kompatibilitetsmatrix nøje og undgår at blande versioner af driver, ROCm-runtime og framework, der ikke officielt er testet sammen. Den forskel udligner sig typisk over tid, men den er reel nok til, at den bør indgå i en tidsplan for et nyt projekt.
Branchestemmer: sådan taler AMD selv om kampen mod CUDA
Anush Elangovan, AMDs VP for AI Software, har beskrevet arbejdet med at lukke gabet til CUDA som en langsom, vedholdende proces. “Det er som at bestige et bjerg, et skridt efter det næste,” siger han ifølge EE Times. Citatet fanger noget centralt ved ROCm’s udvikling. Der er ikke ét stort gennembrud, men en lang række mindre forbedringer, der samlet flytter platformen tættere på konkurrenten.
I et interview med The Cube gik en AMD-softwarechef endnu mere direkte til sagen om frameworks. “ROCm er det eneste andet værktøj, der er upstreamet til de populære frameworks, på den måde folk skriver de fleste modeller i dag,” lød det. Samme kilde tilføjede: “CUDA kan understøtte det, men ROCm er fuldt upstreamet og understøttet til PyTorch, TensorFlow, JAX, de værktøjer.” Det er en påstand, der er værd at teste selv, men den afspejler, hvor AMD har lagt sine kræfter det seneste år, ikke i marketing, men i selve integrationen med de rammer, udviklerne allerede bruger.
AI-infrastrukturselskabet TensorWave beskriver på sin side ROCm kortfattet som “AMDs open source-softwareplatform til GPU-beregning”, ifølge en opsummering fra TensorWaves egen blog. Den enkle formulering understreger, hvordan hele det åbne AI-infrastrukturmiljø omkring TensorWave, CoreWeave-konkurrenter og mindre specialiserede clouds i stigende grad positionerer ROCm som selve fundamentet for en uafhængig, ikke-Nvidia-baseret vej ind i AI-beregning, snarere end som et nichealternativ.
Hukommelseskrisen: HBM4-mangel rammer begge lejre
Uanset hvilken platform man vælger, rammes man af den samme flaskehals lige nu, nemlig hukommelse. Produktionen af high bandwidth-hukommelse er blevet flyttet så massivt over mod HBM4, at server-DRAM-priserne ifølge en analyse fra MicrochipUSA kan stige kumulativt omkring 270 procent i løbet af 2026. Nogle kanalkomponenter er allerede steget 20 til 25 procent, og enkelte spotpriser er nået op på to til tre gange tidligere niveauer.
Samme kilde peger på, at HBM-kontraktpriserne potentielt kan stige yderligere 70 til 140 procent, efterhånden som producenter prioriterer kapacitet til AI- og datacenter-systemer frem for almindelig forbruger-RAM. Det betyder i praksis, at både Nvidias B200 og AMDs MI355X bliver dyrere at producere, hvilket sandsynligvis ender som højere lejepriser i skyen for begge platforme i løbet af de kommende kvartaler. En anden konsekvens er, at Intel ifølge Reuters-kilder citeret af 247wallst har advaret kinesiske kunder om op til seks måneders leveringstid på server-CPU’er, mens AMD har oplyst forsinkelser på 8 til 10 uger for udvalgte produkter.
Strømforbrug og reel driftsomkostning
Effektforbrug er ikke kun en teknisk detalje på et datablad. Det er en direkte omkostningsdriver, når et helt rack fyldes med accelererende hardware. Nvidias B200 SXM og AMDs MI325X samt MI355X ligger alle på op til 1.000 watt per kort, mens H100 SXM og MI300X ligger lavere på henholdsvis 700 og 750 watt. Multiplicer det med otte eller flere kort i et enkelt serverchassis, og strømregningen bliver hurtigt en lige så vigtig linje i budgettet som selve GPU-indkøbet.
Her spiller de to platforme reelt uafgjort på papiret, fordi de nyeste topmodeller fra begge producenter lander på næsten samme effektbudget. Forskellen opstår i stedet i, hvor meget arbejde hvert watt udfører. Hvis AMDs egne tal om 3,3 gange hurtigere inferens holder i praksis, betyder det færre kort til samme arbejdsbyrde og dermed lavere samlet strømforbrug, selv om det enkelte MI355X-kort ikke er mere strømbesparende end et B200-kort. Det er grunden til, at total ejeromkostning altid bør regnes per fuldført opgave, ikke per kort, når man sammenligner de to økosystemer.
Hvad betyder det for danske og nordiske virksomheder
Nordiske virksomheder står i en særlig position i dette opgør. Regionens kolde klima og adgang til vedvarende energi har længe gjort Norden attraktiv for datacenterdrift, og det gælder også AI-tunge klynger med accelererende hardware, der kræver massiv køling. Samtidig betyder GDPR og danske krav til databehandling, at mange virksomheder allerede tænker nøje over, hvor deres GPU-arbejdsbyrder fysisk kører, uanset om det er CUDA- eller ROCm-baseret.
Her giver ROCm’s åbne kildekode et ekstra argument, som ikke handler om ydelse. En åben stak er lettere at revidere og dokumentere over for interne compliance-krav, fordi ingen dele af kritisk infrastruktur er skjult bag en lukket licens. Det gør ikke ROCm til det oplagte valg for alle, men det er en faktor, som offentlige institutioner og regulerede brancher som finans og sundhed bør veje ind, når de vælger platform for deres AI-investeringer. Omregnet til danske kroner med en dollarkurs omkring 7 svarer RunPods laveste H100-pris på 1,99 dollar i timen til cirka 14 kroner, mens B200 på Secure Cloud til 6,79 dollar i timen lander på omkring 48 kroner. Det er tal, der hurtigt løber op i en klynge, der kører døgnet rundt, og det gør den manglende selvbetjente prissætning på AMD-siden endnu mere mærkbar for mindre nordiske teams uden ressourcer til at forhandle kundetilpassede aftaler.
5 eksempler fra den virkelige verden
Teori er godt, men det er lettere at forstå forskellen mellem de to platforme, når man ser, hvordan konkrete organisationer bruger dem lige nu.
Anthropic og AMD
AI-selskabet Anthropic har indgået en flerårig aftale om at anvende op til 2 gigawatt AMD Instinct MI450-GPU’er i Helios-rackløsninger, med det første gigawatt sat i drift i anden halvdel af 2026. Aftalen er et af de tydeligste tegn på, at ROCm nu betragtes som produktionsklar til træning af store sprogmodeller hos en af de førende AI-labs, ikke kun til mindre eksperimenter på siden af hovedinfrastrukturen.
CoreWeave og Nvidia
Cloud-udbyderen CoreWeave har annonceret udrulning af Nvidias kommende Vera Rubin NVL72-system, som gik i produktion i september 2026. Det viser, at CUDA-økosystemet fortsat er førstevalget for de udbydere, der bygger infrastruktur til de allerstørste hyperscaler-kunder, og understreger, at Nvidias forspring i datacenter-segmentet ikke forsvinder, bare fordi AMD vinder markedsandele andre steder.
AMDs eget MI455X/Helios-rack
Selve MI455X-systemet i Helios-rackform er i produktion, med de første leverancer forventet ved udgangen af tredje kvartal 2026. Det sætter en konkret tidsramme for, hvornår ROCm-baseret hardware for alvor begynder at fylde i datacentrene ud over de kunder, der allerede har skrevet under på store, flerårige aftaler.
TensorWave
Den specialiserede AI-infrastrukturudbyder TensorWave har bygget hele sin forretning omkring AMDs Instinct-GPU’er og ROCm. Selskabet er et konkret eksempel på, hvordan mindre, fokuserede cloud-udbydere forsøger at dække det hul, de store generalistudbydere som RunPod og Lambda endnu ikke har fyldt med selvbetjent AMD-kapacitet, ved at bygge hele deres forretningsmodel omkring én platform.
Lokale udviklere og forskere
Med omkring 90 procent af desktop-GPU-markedet på Nvidias hænder, foregår langt størstedelen af den daglige eksperimentering, undervisning og prototyping på CUDA, simpelthen fordi det er den hardware, folk allerede har stående på skrivebordet. Det skaber en selvforstærkende effekt, hvor nye studerende og forskere lærer CUDA først, fordi det er det, deres bærbare eller universitetets maskiner kan køre, hvilket igen holder efterspørgslen efter CUDA-kompetencer oppe på arbejdsmarkedet.
Sådan migrerer du fra CUDA til ROCm: trin for trin
En af de mest udbredte misforståelser er, at et skifte fra CUDA til ROCm kræver, at man omskriver hele kodebasen. I praksis er det ofte langt mindre dramatisk, fordi PyTorch’s ROCm-build beholder det samme torch.cuda-navnerum af hensyn til kompatibilitet.
# Eksempel: samme kode virker på begge platforme
import torch
device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
model = model.to(device)
Selve migrationen følger typisk disse trin:
- Tjek din GPU op mod AMDs kompatibilitetsmatrix for ROCm 10, og bekræft at din Instinct-model (gfx908, gfx90a, gfx942 eller gfx950) er understøttet.
- Installer den rette AMDGPU-driver og ROCm-pakken til dit Linux-distro, typisk via AMDs officielle repository.
- Afinstaller den CUDA-byggede version af PyTorch eller TensorFlow, og installer den tilsvarende ROCm-byggede version fra det officielle indeks.
- Kør din eksisterende kode uændret først, da langt de fleste standard PyTorch-operationer virker uden ændringer takket være
torch.cuda-kompatibiliteten. - Test tredjepartsbiblioteker enkeltvis, da nogle CUDA-specifikke kernels, for eksempel visse Triton- eller egen-skrevne CUDA-kernels, kræver en separat HIP-portering.
- Valider ydelsen på en mindre delmængde af data, før du flytter hele produktionsbelastningen, så du kan sammenligne inferenstid direkte mod din tidligere CUDA-baseline.
- Sæt overvågning op for hukommelsesforbrug, da GPU-hukommelsesstyringen kan opføre sig anderledes mellem de to stakke, selv ved samme modelstørrelse.
Den største praktiske hurdle er sjældent selve koden, men afhængigheder: interne værktøjer, custom CUDA-kernels eller ældre biblioteker, der aldrig er blevet porteret til HIP. Sæt derfor tid af til at teste hele værktøjskæden, ikke kun hovedmodellen.
Almindelige faldgruber ved migrationen
Tre problemer går igen, når teams flytter arbejdsbyrder fra CUDA til ROCm. Det første er quantization-biblioteker, hvor visse kvantiseringsformater oprindeligt kun er skrevet og optimeret til CUDA, hvilket kan give lavere ydelse eller manglende understøttelse, indtil et ROCm-alternativ er testet. Det andet er multi-GPU-kommunikation, hvor NCCL på CUDA-siden har et modstykke i RCCL på ROCm-siden, men de to biblioteker modnes ikke altid i samme tempo, så netværksydelsen mellem kort kan variere. Det tredje er overvågningsværktøjer, hvor mange etablerede observability-platforme historisk har haft dybere native integration med Nvidias driverstack end med AMDs, hvilket betyder, at nogle teams må bygge egne målepunkter i overgangsperioden.
Ingen af disse problemer er blokerende, men de er grunde til, at en fuld migration typisk tager uger, ikke timer, selv når selve modelkoden kører uændret fra dag ét.
Hvem bør vælge hvad: 5 brugsscenarier
Valget mellem CUDA og ROCm afhænger sjældent kun af pris. Her er fem konkrete scenarier og vores anbefaling til hver.
- Startup der skal bygge en inferens-API hurtigt: Vælg CUDA. Den bredeste selvbetjente cloud-tilgængelighed hos RunPod og Lambda, kombineret med den dybeste dokumentation, betyder mindre spildtid før produktion.
- Forskningsgruppe der træner modeller med meget store parametertal: Overvej ROCm og MI300X eller MI325X. Den højere HBM-kapacitet, op til 256 GB på MI325X mod 141 GB på H200, kan betyde færre GPU’er per klynge og dermed lavere netværkskompleksitet.
- Virksomhed med eksisterende PyTorch-pipeline og fokus på langsigtet omkostningskontrol: ROCm’s open source-model giver mere forhandlingsstyrke over for enkeltleverandør-afhængighed, særligt ved kontrakter i gigawatt-skala som Anthropics aftale med AMD.
- Studerende eller hobbyudvikler med et almindeligt gaming-GPU: Vælg CUDA. Med 90 procent af desktop-markedet er sandsynligheden for, at din eksisterende Nvidia-hardware allerede er understøttet, langt højere, og fejlfindingshjælp er lettere at finde.
- Enterprise der bygger multi-cloud-strategi for at undgå leverandørlåsning: Byg til begge platforme fra start, ved at holde sig til frameworks som PyTorch, der understøtter både CUDA og ROCm native, i stedet for at skrive direkte mod det ene lags specifikke API.
Fordele og ulemper: CUDA vs ROCm 10
| CUDA (Nvidia) | ROCm 10 (AMD) | |
|---|---|---|
| Fordele | Bredest dokumentation og community. Bredest tredjepartsværktøj-dækning. Bred selvbetjent cloud-tilgængelighed hos RunPod og Lambda. Understøtter både forbruger- og datacenter-hardware. | Open source og revideerbar. Højere HBM-kapacitet på topmodellerne. Native PyTorch-integration i hovedgrenen. Voksende hyperscaler-opbakning, blandt andet fra Anthropic. |
| Ulemper | Lukket kildekode og leverandørlåsning. Prispres fra 90 procent markedsdominans kan holde priserne oppe. Rammer samme hukommelsesmangel som resten af branchen. | Sværere at leje selvbetjent hos store cloud-udbydere. Mindre community-dokumentation. Kræver typisk mere opsætningsarbejde på forbrugerkort. |
Læg mærke til, at de to lister ikke er spejlbilleder af hinanden. CUDA’s ulemper handler primært om struktur og pris, mens ROCm’s ulemper primært handler om adgang og modenhed i randen af økosystemet. Det betyder, at de to platforme i praksis appellerer til forskellige risikoprofiler. En virksomhed, der prioriterer forudsigelighed og hurtig time-to-market, vil typisk læse tabellen og lande på CUDA. En virksomhed, der har tid til at investere i egen ekspertise og ønsker uafhængighed fra én leverandør på lang sigt, vil læse den samme tabel og se et argument for ROCm.
Konklusion: hvad siger tallene samlet
Der findes ikke ét entydigt svar på, om CUDA eller ROCm 10 er “bedst”, fordi de to platforme optimerer for forskellige ting. CUDA vinder på tilgængelighed: 90 procent af desktop-GPU-markedet, den bredeste dokumentation, og de eneste officielt offentliggjorte selvbetjente cloud-priser vi kunne finde for både H100, H200 og B200. Hvis du skal i gang i dag uden at vente på kundetilpassede aftaler, er CUDA det sikre valg.
ROCm 10 vinder på råstyrke og retning. AMDs egne tal peger på 3,3 gange hurtigere inferens end forgængeren, MI355X matcher B200 på båndbredde og overgår den på kapacitet, og Anthropics 2-gigawatt-aftale beviser, at platformen nu er tillid nok værd til de allerstørste træningsopgaver. Det, ROCm mangler, er ikke længere teknisk kapacitet, men den samme brede, selvbetjente adgang som CUDA har opbygget over to årtier. Indtil den mangel er lukket, forbliver CUDA standardvalget for de fleste, mens ROCm bliver stadig mere attraktivt for dem, der har volumen nok til at forhandle direkte med AMD.
Tag med fra denne sammenligning, at spørgsmålet ikke er, hvilken platform der vinder i det lange løb. Begge lejre investerer massivt lige nu, begge rammes af den samme hukommelseskrise, og begge har landet aftaler med tunge navne i branchen i løbet af september 2026 alene. Det reelle spørgsmål er, hvilken platform der matcher din organisations tidshorisont, tekniske kapacitet og appetit på leverandøruafhængighed. For de fleste danske og nordiske teams, der skal levere noget i år, er svaret stadig CUDA. For dem, der planlægger tre til fem år frem og allerede har eller kan skaffe adgang til AMD Instinct-hardware, er ROCm 10 første gang, platformen reelt fortjener en plads på samme kortliste.
Ofte stillede spørgsmål
Hvad er den grundlæggende forskel på CUDA og ROCm?
CUDA er Nvidias lukkede softwarelag til GPU-beregning, mens ROCm er AMDs stort set open source-modstykke. Begge oversætter kode til instruktioner, GPU’en kan udføre, men de kører kun på hver deres producents hardware.
Kan jeg køre eksisterende PyTorch-kode på ROCm uden ændringer?
I mange tilfælde ja. PyTorch’s ROCm-build bevarer torch.cuda-navnerummet af hensyn til kompatibilitet, så standardoperationer virker som regel uændret. Custom CUDA-kernels og visse tredjepartsbiblioteker kræver dog ofte en separat portering til HIP.
Er ROCm gratis at bruge?
Ja, selve ROCm-softwaren er open source og gratis at installere. Omkostningen ligger i hardwaren, altså AMD Instinct-kortene, samt eventuel cloud-leje, hvor de fleste store udbydere i skrivende stund ikke tilbyder en offentlig selvbetjent timepris for MI300X eller MI325X.
Hvilke GPU’er understøtter ROCm 10?
ROCm 10 dækker fire AMD Instinct-arkitekturgenerationer ifølge AMDs officielle kompatibilitetsmatrix: CDNA (MI100), CDNA 2 (MI210, MI250, MI250X), CDNA 3 (MI300X, MI300A, MI325X) og CDNA 4 (MI350X, MI350P, MI355X).
Er AMD MI325X hurtigere end Nvidia H200?
Det afhænger af målemetoden. Der findes ingen uafhængig, tredjeparts head-to-head-benchmark mellem de to på samme opgave i vores research. På hukommelse har MI325X en fordel med 256 GB mod H200’s 141 GB, og på båndbredde ligger MI325X på 6,0 TB/s mod H200’s 4,8 TB/s, men det afgør ikke alene den samlede applikationsydelse.
Kan jeg leje AMD Instinct-GPU’er i skyen ligesom Nvidia-kort?
Det er sværere. Hverken RunPod, Lambda eller TensorWave havde i vores gennemgang en offentligt annonceret, selvbetjent timepris for MI300X eller MI325X. Adgang sker typisk gennem kundetilpassede aftaler eller specialiserede udbydere, i modsætning til Nvidia-kort, der kan lejes direkte med et kreditkort. Det gør det sværere for et lille dansk team at teste AMD-hardware uden først at gå gennem en salgsdialog, hvilket er en praktisk barriere, selv når prisen i sidste ende kan vise sig konkurrencedygtig.
Skal jeg vælge CUDA eller ROCm til mit næste AI-projekt?
Hvis du skal i produktion hurtigt og bruger standard cloud-udbydere, er CUDA det mest forudsigelige valg. Hvis du allerede har adgang til AMD Instinct-hardware, arbejder med meget hukommelsestunge modeller, eller ønsker at undgå enkeltleverandør-afhængighed på lang sigt, er ROCm 10 nu modent nok til seriøs overvejelse.
Hvornår kommer næste store opdatering til CUDA eller ROCm?
Hverken Nvidia eller AMD havde i september 2026 officielt annonceret en konkret dato for henholdsvis CUDA 14 eller ROCm 11. CUDA 13.4 tilføjede allerede udviklerforhåndsvisning af Rubin-arkitekturen, hvilket antyder, at næste store spring følger Nvidias hardware-roadmap snarere end en fast kalenderplan.




