AWS a mis en service le 3 septembre 2026 ses nouvelles instances EC2 P6-B200 dans la région Asie-Pacifique (Hyderabad), une machine taillée pour l’entraînement et l’inférence de grands modèles d’IA. Chaque instance embarque huit GPU NVIDIA Blackwell B200 et environ 1 440 Go de mémoire HBM3e. Le lancement relance une bataille tarifaire déjà tendue entre AWS, Google Cloud et Microsoft Azure, à un moment où la demande de calcul GPU dépasse largement l’offre disponible chez les trois hyperscalers.
Pour les équipes qui budgétisent un projet d’entraînement de modèle en 2026 ou 2027, le choix du fournisseur GPU n’est plus un détail d’infrastructure. C’est une ligne de coût qui peut représenter plusieurs millions d’euros par an. Cet article décortique les chiffres publiés, compare les trois offres Blackwell du marché et explique ce que ce lancement change concrètement pour les entreprises européennes.
Ce que contient l’annonce AWS EC2 P6-B200
Les instances P6-B200 rejoignent la famille P6 d’Amazon Web Services, dédiée depuis plusieurs générations aux charges de travail d’apprentissage automatique les plus lourdes. La nouveauté ici, ce n’est pas la famille elle-même mais le processeur graphique qu’elle embarque : le NVIDIA B200, la puce phare de l’architecture Blackwell, désormais disponible en configuration cloud complète chez AWS. Chaque instance dispose de huit GPU B200 interconnectés, pour un total d’environ 1 440 Go de mémoire HBM3e dédiée aux calculs matriciels.
Concrètement, cette mémoire massive change la donne pour l’entraînement de modèles de plusieurs centaines de milliards de paramètres. Avec moins de GPU nécessaires pour tenir un modèle en mémoire, les équipes réduisent la complexité du parallélisme et, en théorie, le temps d’ingénierie passé à répartir la charge entre machines. AWS positionne clairement cette instance face à la demande explosive de calcul pour l’entraînement de modèles génératifs et l’inférence à grande échelle, deux usages qui saturent les capacités GPU disponibles depuis le début de l’année 2026.
Le choix de la région Hyderabad pour ce lancement n’est pas anodin. L’Inde s’impose depuis deux ans comme un pôle de croissance majeur pour les hyperscalers, portée par une demande domestique en IA et par des coûts d’exploitation plus compétitifs que dans les régions occidentales. Pour les entreprises européennes qui chercheraient à répliquer leurs charges de travail vers cette région pour des raisons de coût, la latence réseau reste toutefois un facteur à surveiller de près, en particulier pour l’inférence temps réel.
Le prix : 98,84 dollars de l’heure, un chiffre à décortiquer
Le tarif public communiqué pour une instance p6-b200.48xlarge dans la région US East (Ohio) s’établit à 98,84 dollars par heure à la demande. Rapporté aux huit GPU embarqués, cela correspond à environ 12,36 dollars par GPU et par heure. C’est le chiffre qui compte vraiment pour comparer les offres, puisque le prix affiché d’une instance dépend du nombre de puces qu’elle contient, une variable qui change d’un fournisseur à l’autre.
Ce tarif de 12,36 dollars par GPU-heure place AWS en position favorable face à ses deux principaux concurrents sur des configurations Blackwell comparables. Mais attention : il s’agit d’un prix à la demande, sans engagement. Les entreprises qui négocient des contrats pluriannuels ou qui réservent de la capacité à l’avance obtiennent généralement des remises substantielles, parfois supérieures à 40 % selon la durée d’engagement. Le prix affiché est donc un point de départ pour la négociation, pas le coût réel que paiera une entreprise qui consomme plusieurs centaines de milliers d’heures GPU par an.
Il faut aussi noter que ce tarif ne couvre que le calcul. Le stockage associé, la bande passante réseau entre régions, et les frais de sortie de données (l’egress, souvent la ligne la plus opaque d’une facture cloud) s’ajoutent séparément. Pour un projet d’entraînement qui déplace plusieurs pétaoctets de données d’entraînement, ces coûts annexes peuvent représenter une part non négligeable de la facture totale, parfois 15 à 20 % du budget calcul selon les architectures observées sur le marché.
AWS contre Google Cloud contre Azure : le match des GPU Blackwell
Les trois hyperscalers américains proposent désormais chacun leur propre déclinaison de la puce NVIDIA B200, avec des architectures et des tarifs sensiblement différents. Google Cloud a lancé ses instances A4, également équipées de huit GPU B200, à un tarif d’introduction d’environ 110 dollars de l’heure, soit approximativement 13,75 dollars par GPU-heure. Microsoft Azure, de son côté, propose une configuration ND128isr-NDR-GB200-v6 dans la région Australia East, facturée autour de 162,73 dollars de l’heure pour une configuration à huit GPU NVIDIA Blackwell B200, ce qui situe le coût par GPU dans une fourchette large de 20 à 27 dollars selon la méthode de calcul retenue et les options de réseau incluses.
Sur le papier, AWS ressort donc comme l’option la moins chère à l’heure, suivi de Google Cloud, puis d’Azure qui affiche l’écart le plus marqué. Mais cette lecture brute cache des différences d’architecture qui comptent. La configuration Azure ND128isr-NDR-GB200-v6 s’appuie sur l’architecture GB200 NVL72, qui interconnecte un nombre bien plus élevé de GPU dans un même domaine mémoire cohérent via NVLink, un atout pour l’entraînement de modèles qui dépassent la capacité d’un seul nœud à huit GPU. Payer plus cher par GPU-heure chez Azure peut donc, pour certaines charges de travail à très grande échelle, se traduire par un temps d’entraînement total plus court et donc une facture finale compétitive malgré un tarif horaire supérieur.
Google Cloud met pour sa part en avant l’intégration de ses instances A4 avec l’écosystème Vertex AI et ses propres puces TPU, permettant aux équipes de mixer GPU NVIDIA et accélérateurs maison selon les phases du projet. C’est un argument que ni AWS ni Azure ne peuvent égaler directement, puisque les deux autres hyperscalers restent structurellement dépendants de NVIDIA pour leurs accélérateurs de dernière génération.
Tableau comparatif : tarifs des instances GPU Blackwell B200
Voici une synthèse des tarifs publics constatés pour des configurations à huit GPU NVIDIA B200 chez les trois principaux fournisseurs cloud, au 22 septembre 2026 :
| Fournisseur | Instance | Région de référence | Prix horaire (à la demande) | Prix par GPU-heure |
|---|---|---|---|---|
| AWS | p6-b200.48xlarge | US East (Ohio) | 98,84 $ | ~12,36 $ |
| Google Cloud | A4 (8x B200) | Non précisée (tarif d’introduction) | ~110 $ | ~13,75 $ |
| Microsoft Azure | ND128isr-NDR-GB200-v6 | Australia East | 162,73 $ | ~20 à 27 $ |
Ces chiffres sont des prix catalogue à la demande, sans remise contractuelle ni engagement de réservation. Ils varient selon la région, la disponibilité de la capacité et les conditions négociées entre chaque entreprise et son fournisseur cloud. Aucun des trois hyperscalers ne publie de manière transparente le coût réel après remise, ce qui complique toute comparaison définitive pour un acheteur d’entreprise.
Contexte historique : de l’A100 au B200, quatre ans de course aux accélérateurs
Pour mesurer l’ampleur du saut technologique que représente le B200, il faut remonter à 2020, année de lancement du NVIDIA A100, la puce qui a lancé la course cloud à l’IA générative. L’A100 a dominé les catalogues AWS, Azure et Google Cloud pendant près de trois ans, avant l’arrivée du H100 fin 2022, puis du H200 en 2024 avec sa mémoire HBM3e augmentée. Le B200, annoncé par NVIDIA en mars 2024 sous le nom d’architecture Blackwell, n’a atteint une disponibilité cloud large qu’au cours de l’année 2025, avec un déploiement qui s’accélère nettement en 2026.
Ce décalage entre l’annonce d’une puce et sa disponibilité effective en instance cloud à la demande illustre une tension structurelle du marché : la production de GPU haut de gamme reste un goulot d’étranglement, dominé par TSMC pour la gravure et par NVIDIA pour l’allocation des volumes entre hyperscalers, fabricants de serveurs et clients directs. Chaque nouvelle génération met entre 12 et 18 mois à se démocratiser pleinement sur les trois grands clouds publics, un délai qui structure de fait le calendrier d’investissement des entreprises qui dépendent du calcul GPU loué.
La France a suivi une trajectoire parallèle avec Mistral AI, dont le projet Voltaire s’appuie sur environ 50 000 GPU H200, une génération antérieure au B200 mais qui reste largement suffisante pour l’entraînement de modèles de la classe Mistral Large. Ce choix illustre une réalité que peu d’acteurs européens du cloud osent formuler publiquement : la génération de puce la plus récente n’est pas toujours celle qui offre le meilleur rapport coût-performance pour un projet donné, surtout quand la génération précédente reste disponible avec des remises de capacité importantes.
Quatre générations de GPU cloud en un coup d’œil
Le tableau ci-dessous résume les quatre dernières générations d’accélérateurs NVIDIA qui se sont succédé dans les catalogues des trois hyperscalers depuis 2020. Il permet de situer le B200 dans cette chronologie et de comprendre pourquoi chaque saut de génération redistribue les cartes tarifaires :
| Puce NVIDIA | Architecture | Année de lancement | Mémoire par GPU | Généralisation cloud |
|---|---|---|---|---|
| A100 | Ampere | 2020 | 40 ou 80 Go HBM2e | 2020-2022 |
| H100 | Hopper | 2022 | 80 Go HBM3 | 2022-2024 |
| H200 | Hopper (mémoire augmentée) | 2024 | 141 Go HBM3e | 2024-2025 |
| B200 | Blackwell | 2024 (annonce), 2025-2026 (disponibilité cloud) | ~180 Go HBM3e | 2025-2026 |
Ce cycle de renouvellement, qui s’étale sur douze à dix-huit mois entre l’annonce d’une puce par NVIDIA et sa disponibilité cloud à grande échelle, explique pourquoi des projets comme Voltaire de Mistral AI continuent de tourner sur du H200 plutôt que d’attendre une allocation B200 : le calendrier d’un projet d’entraînement ne peut pas toujours attendre le cycle de disponibilité matérielle des hyperscalers.
Impact sur le marché européen du cloud IA
Pour les entreprises européennes, ce lancement soulève une question de souveraineté autant que de coût. Les trois hyperscalers concernés (AWS, Google Cloud, Azure) sont soumis au droit américain, notamment au Cloud Act, ce qui pose un problème récurrent pour les organisations qui traitent des données sensibles ou réglementées. Or, à ce jour, aucun opérateur cloud européen (OVHcloud, Scaleway, T-Systems) ne propose de capacité GPU Blackwell B200 à une échelle comparable à celle des trois géants américains. L’écart d’investissement en capex reste considérable : les trois hyperscalers américains ont annoncé collectivement des engagements de dépenses d’infrastructure IA de l’ordre de 595 milliards de dollars pour la période récente, un montant sans commune mesure avec les capacités d’investissement des acteurs cloud européens.
Cette asymétrie alimente le débat en cours à Bruxelles sur le Cloud and AI Development Act (CADA), qui vise à réduire la dépendance européenne aux trois hyperscalers américains sur les segments jugés stratégiques, dont le calcul IA. Mais concrètement, une entreprise qui a besoin de louer aujourd’hui de la capacité B200 pour entraîner un modèle n’a, dans l’immense majorité des cas, pas d’alternative européenne crédible à court terme. C’est un rapport de force que les nouvelles règles européennes de souveraineté numérique n’ont pas encore rééquilibré.
Sur le plan purement économique, l’arrivée du B200 chez AWS accentue aussi la pression sur les prix pratiqués par les fournisseurs de cloud GPU spécialisés (les néo-clouds comme CoreWeave ou Lambda Labs), qui avaient bâti leur modèle sur un accès plus rapide aux nouvelles générations NVIDIA que les hyperscalers généralistes. À mesure qu’AWS, Google Cloud et Azure rattrapent leur retard de déploiement, l’avantage concurrentiel de ces acteurs spécialisés sur la seule variable du délai d’accès au matériel s’amenuise.
Ce que ce lancement change pour les équipes techniques
Pour une équipe MLOps qui planifie un cycle d’entraînement en fin d’année 2026, l’arrivée du P6-B200 chez AWS change trois paramètres concrets. D’abord, le ratio mémoire par GPU (environ 180 Go de HBM3e par puce) permet de réduire le nombre de nœuds nécessaires pour entraîner des modèles de la classe 70 à 180 milliards de paramètres, ce qui simplifie l’orchestration réseau et réduit la surface d’erreur liée au parallélisme distribué. Ensuite, la disponibilité de la capacité reste le vrai facteur limitant : un tarif catalogue attractif ne vaut rien si la capacité n’est pas allouable au moment voulu, un problème que de nombreuses équipes ont rencontré avec les générations H100 et H200 en 2024 et 2025.
Enfin, le choix entre AWS, Google Cloud et Azure ne devrait plus se faire uniquement sur le prix horaire affiché. Les équipes techniques doivent désormais intégrer dans leur calcul le coût de sortie des données, la compatibilité avec leur pile logicielle existante (CUDA, frameworks de distribution comme DeepSpeed ou Megatron), et la localisation géographique de la capacité disponible, qui conditionne à la fois la latence et, pour les entreprises soumises au RGPD, la conformité réglementaire du traitement.
Les limites de la comparaison tarifaire brute
Comparer un prix par GPU-heure entre trois fournisseurs donne une image incomplète de la réalité économique. La configuration Azure GB200 NVL72 interconnecte davantage de GPU dans un même domaine mémoire que les instances à huit GPU d’AWS et de Google Cloud, ce qui peut réduire le temps total d’entraînement pour les modèles les plus volumineux et donc compenser un tarif horaire plus élevé. De même, les trois fournisseurs appliquent des politiques de remise différentes selon l’engagement contractuel : instance réservée sur un an, sur trois ans, ou capacité négociée sur mesure pour les plus gros comptes.
Un autre facteur souvent négligé : la disponibilité réelle de la capacité au moment où l’entreprise en a besoin. Un tarif catalogue publié ne garantit pas un accès immédiat aux GPU, particulièrement pour les commandes de plusieurs centaines d’instances simultanées. Plusieurs entreprises rapportent des délais d’attente de plusieurs semaines à plusieurs mois pour obtenir une allocation de capacité GPU de dernière génération chez les trois hyperscalers, un phénomène qui persiste depuis le début de la vague d’investissement en IA générative.
NVIDIA, l’arbitre silencieux des prix du cloud IA
Derrière la bataille tarifaire entre AWS, Google Cloud et Azure se cache un acteur qui fixe en réalité une bonne partie des règles du jeu : NVIDIA. C’est l’entreprise qui décide, trimestre après trimestre, quel volume de puces B200 est alloué à chaque hyperscaler, en fonction de contrats négociés en amont et de la capacité de production disponible chez TSMC. Cette allocation conditionne directement la disponibilité réelle des instances P6-B200, A4 et ND128isr-NDR-GB200-v6 sur le marché, bien plus que la politique tarifaire propre de chaque cloud.
Cette dépendance structurelle explique aussi pourquoi les trois hyperscalers investissent massivement dans leurs propres puces maison, à l’image des TPU de Google ou du projet Trainium chez AWS, dans l’espoir de réduire à terme leur dépendance à un fournisseur unique de silicium. Mais pour l’essentiel des charges de travail d’entraînement de grands modèles de langage aujourd’hui en production, l’écosystème logiciel CUDA de NVIDIA reste la référence, ce qui limite en pratique la bascule vers des alternatives maison à court terme.
Prévisions : ce qu’il faut surveiller d’ici fin 2026 et début 2027
Sur la base des tendances observées depuis le début de l’année, plusieurs évolutions semblent probables pour les prochains mois :
- Une extension progressive des instances P6-B200 d’AWS à d’autres régions au-delà de Hyderabad, avec une probable arrivée en Europe (Irlande, Francfort) au cours des prochains trimestres, sous réserve de disponibilité de capacité NVIDIA.
- Une pression tarifaire à la baisse sur les instances H100 et H200, désormais reléguées au rang de génération intermédiaire, à mesure que le B200 se généralise chez les trois hyperscalers.
- Un débat institutionnel renforcé autour du Cloud and AI Development Act, alimenté par l’écart croissant entre la capacité GPU disponible chez les hyperscalers américains et celle des opérateurs cloud européens.
- Une clarification attendue des politiques de remise sur engagement, les entreprises réclamant davantage de transparence après plusieurs cas documentés d’écarts de facturation entre le tarif catalogue et le prix réellement payé.
- Une montée en puissance des offres hybrides mixant GPU loués à la demande et capacité réservée à long terme, à mesure que les équipes financières des entreprises cherchent à lisser un poste de dépense devenu l’un des plus volatils du budget IT.
Comment choisir entre AWS, Google Cloud et Azure pour un projet GPU
En pratique, le choix ne devrait jamais se limiter au tarif horaire affiché. Les équipes qui pilotent des projets d’IA générative à l’échelle de l’entreprise gagnent à établir une grille de décision qui intègre plusieurs axes : le coût total de possession sur la durée du projet (calcul, stockage, sortie de données), la disponibilité effective de la capacité dans la région géographique visée, la compatibilité avec la pile logicielle déjà en production, et la sensibilité réglementaire des données traitées.
Pour un projet d’entraînement ponctuel de courte durée, le tarif à la demande le plus bas (aujourd’hui celui d’AWS) reste souvent le critère décisif. Mais pour une charge de travail récurrente et prévisible sur plusieurs années, la négociation d’un contrat de capacité réservée avec remise substantielle change complètement l’équation, et l’écart entre fournisseurs peut alors s’inverser selon les conditions obtenues.
Foire aux questions sur les instances AWS EC2 P6-B200
Quand les instances AWS EC2 P6-B200 sont-elles devenues disponibles ?
AWS a annoncé leur disponibilité dans la région Asie-Pacifique (Hyderabad) le 3 septembre 2026.
Combien de GPU embarque une instance P6-B200 ?
Chaque instance dispose de huit GPU NVIDIA Blackwell B200, pour un total d’environ 1 440 Go de mémoire HBM3e.
Quel est le prix d’une instance P6-B200 chez AWS ?
Le tarif à la demande pour une instance p6-b200.48xlarge dans la région US East (Ohio) s’élève à 98,84 dollars par heure, soit environ 12,36 dollars par GPU-heure.
AWS est-il moins cher que Google Cloud et Azure pour du GPU B200 ?
Sur la base des tarifs catalogue à la demande, AWS affiche le prix par GPU-heure le plus bas (environ 12,36 dollars), suivi de Google Cloud (environ 13,75 dollars) et d’Azure (entre 20 et 27 dollars selon la configuration). Ces chiffres ne tiennent pas compte des remises sur engagement ni des différences d’architecture réseau entre les offres.
Pourquoi Azure facture-t-il plus cher son instance GB200 ?
L’instance ND128isr-NDR-GB200-v6 d’Azure repose sur l’architecture GB200 NVL72, qui interconnecte davantage de GPU dans un même domaine mémoire cohérent via NVLink. Cette architecture peut réduire le temps total d’entraînement pour les très grands modèles, ce qui peut compenser le tarif horaire plus élevé selon la charge de travail.
Existe-t-il une alternative européenne aux GPU Blackwell des hyperscalers américains ?
À ce jour, aucun opérateur cloud européen ne propose de capacité GPU Blackwell B200 à une échelle comparable à celle d’AWS, Google Cloud ou Azure. Le débat sur le Cloud and AI Development Act (CADA) vise justement à réduire cette dépendance, mais aucune offre européenne équivalente n’est encore disponible à grande échelle.
Le prix catalogue reflète-t-il le coût réel payé par les entreprises ?
Non. Les tarifs publiés sont des prix à la demande sans engagement. Les entreprises qui réservent de la capacité sur plusieurs années obtiennent généralement des remises substantielles, ce qui rend toute comparaison de prix catalogue incomplète sans connaître les conditions contractuelles réelles.
Quelle génération de GPU a précédé le B200 chez les hyperscalers ?
Le B200 (architecture Blackwell) succède au H200, lui-même une évolution du H100 lancé fin 2022. Le NVIDIA A100, sorti en 2020, avait initié la course cloud à l’IA générative chez les trois hyperscalers.




