Lien copié !

La guerre du silicium : Google TPU contre Nvidia Blackwell

Les nouveaux TPU Trillium et Ironwood de Google remettent en question la domination de Blackwell par Nvidia grâce à une efficacité supérieure et des coûts inférieurs. Nous analysons les spécifications, l'économie et le gagnant.

🌐
Traduction automatique

Cet article a été traduit automatiquement depuis l’original en anglais. Lire l’original en anglais

Écran partagé montrant le rack de serveur Google TPU à gauche et le rack Nvidia Blackwell à droite

Points clés à retenir

  • Efficacité en termes de coûts : le TPU v6 (Trillium) de Google offre des performances par dollar 4,7 fois supérieures sur les tâches d’inférence par rapport au Nvidia H100/Blackwell.
  • Energy King : les TPU de Google consomment 67 % d’énergie en moins pour la même charge de travail, un facteur critique alors que la demande énergétique des centres de données monte en flèche.
  • Le nouveau Challenger : le « Ironwood » de Google (TPU v7) correspond aux performances brutes de Blackwell tout en conservant une efficacité supérieure.
  • Le verdict : Nvidia régit toujours la formation, mais Google gagne la guerre pour l’inférence d’IA à grande échelle.

Depuis trois ans, « matériel IA » est synonyme d’un seul nom : Nvidia. Les puces H100 et Blackwell ultérieures de la société ont été la référence, alimentant tout, de ChatGPT à Gemini. Mais à mesure que l’industrie de l’IA passe de la « formation » (création de modèles) à « l’inférence » (les exécuter), le calcul change.

Entrez Google. Alors que le monde se battait pour l’allocation Nvidia, Google perfectionnait tranquillement son propre silicium personnalisé : le Tensor Processing Unit (TPU). Avec la sortie des architectures Trillium (v6) et Ironwood (v7) à venir, Google ne propose pas seulement une alternative ; ils revendiquent leur supériorité sur les paramètres les plus importants pour les hyperscalers : le coût et l’énergie.

Advertisement

This isn’t just a spec sheet battle. C’est un choc de philosophies : flexibilité à usage général (Nvidia) contre efficacité spécialisée (Google). Ce choix définira l’économie de l’ère de l’IA.

Contexte : Contexte

Le monopole de Nvidia

La domination de Nvidia n’était pas un hasard. Leur écosystème logiciel CUDA a créé un « fossé » qui a rendu incroyablement difficile le changement pour les développeurs. Si vous vouliez entraîner un modèle de pointe, vous utilisiez les GPU Nvidia. Période. Cela a permis à Nvidia de réaliser des marges énormes, les racks Blackwell coûtant plus de 3 millions de dollars.

Le long jeu de Google

Google a pris un chemin différent. Réalisant il y a plus de dix ans que les processeurs et les GPU standards ne pouvaient pas répondre à leurs besoins en matière d’IA, ils ont commencé à créer des TPU spécifiquement pour leurs propres charges de travail (Recherche, Cartes et maintenant Gemini). Pendant des années, ce furent des secrets internes. Ils constituent désormais l’épine dorsale de l’offre d’IA de Google Cloud.

Comprendre le matériel

Nvidia Blackwell (B200/GB200)

Le Blackwell de Nvidia est une bête. Elle est conçue pour être la puce à tout faire.

  • Atouts : bande passante mémoire massive, puissance de calcul brute incroyable et capacité à gérer tout type de charge de travail d’IA (formation, inférence, simulation scientifique).
  • Faiblesses : gourmand en énergie et incroyablement cher. C’est comme conduire une voiture de Formule 1 jusqu’à l’épicerie, rapide, mais excessif pour de nombreuses tâches.

Google Trillium (TPU v6) & Ironwood (TPU v7)

Google’s TPUs are precision instruments. Ils suppriment l’héritage des GPU en matière de rendu graphique pour se concentrer uniquement sur les mathématiques matricielles (le cœur de l’IA).

  • Atouts : Efficacité énergétique extrême, interconnexions optiques (permettant à des milliers de puces de fonctionner comme un seul « supercalculateur ») et coût réduit.
  • Faiblesses : Plus difficile à programmer (nécessite une expertise JAX/TensorFlow) et moins flexible pour les tâches non IA.

The Data: By The Numbers

Les chiffres dressent un tableau sombre pour les acheteurs professionnels.

Advertisement

Cost Comparison (3-Year TCO)

MétriqueNvidia H100/Blackwell ClusterPod Google TPU v6Gagnant
Coût du matériel~\100 millions de dollars~\52 M$TPU (-48%)
Coût de l’électricité~\47 millions de dollars~\16 M$TPU (-66%)
Coût total~\147 millions de dollars~\68 M$TPU (-54%)

Source: AINewsHub, CloudOptimo

Mesures de performances

  • Inférence : le TPU v6 offre des performances par dollar 4,7 fois supérieures à celles de la génération actuelle de Nvidia.
  • Efficacité : les puces de Google offrent des performances par watt 100 % supérieures dans des charges de travail de transformateur spécifiques.

Impact sur l’industrie

The Shift to Inference

À mesure que des modèles comme Gemini 3 et GPT-5 deviennent des produits utilisés par des milliards de personnes, les dépenses de l’industrie passent de la formation (création du modèle) à l’inférence (service du modèle). This plays directly into Google’s hand. Les puces de Nvidia sont fantastiques pour la formation, mais pour répondre à des millions de requêtes par jour, elles coûtent trop cher.

The “Walled Garden” Effect

Les TPU de Google ne sont disponibles que via Google Cloud. Vous ne pouvez pas acheter un TPU et l’installer dans votre propre centre de données. Cela oblige les entreprises à choisir : rester flexibles avec Nvidia (sur AWS, Azure ou sur site) ou s’enfermer dans l’écosystème de Google pour de meilleures économies.

Défis et limites

Despite the specs, Nvidia isn’t going anywhere.

  1. Le CUDA Moat : L’écosystème logiciel de Nvidia est toujours largement supérieur. Most AI researchers learn on CUDA. Porter du code vers JAX ou TensorFlow de Google peut être un casse-tête.
  2. Disponibilité : vous pouvez louer des GPU Nvidia auprès de presque tous les fournisseurs de cloud. Les TPU sont réservés à Google.
  3. Polyvalence : si votre charge de travail change, un GPU peut probablement la gérer. A TPU is a specialist tool; si l’architecture de votre modèle ne correspond pas à ses atouts, les performances peuvent chuter.

Ce que cela signifie pour vous

If you’re an AI Startup:

  • Stick with Nvidia for R&D and training. La flexibilité en vaut le coût. - Envisagez de passer aux TPU pour le déploiement si vous atteignez l’échelle. Les économies de 50 % peuvent faire la différence entre le profit et la faillite.

Si vous êtes un investisseur :

  • Les marges de Nvidia pourraient être mises sous pression à mesure que l’inférence deviendra la charge de travail dominante.
  • Google Cloud présente un énorme avantage structurel en termes de coûts qui n’est pas encore pleinement pris en compte.

Le résultat

La « guerre du silicium » ne consiste pas à ce qu’une puce tue l’autre ; it’s about specialization. Nvidia Blackwell reste le roi incontesté de la formation, moteur de l’innovation. Mais les TPU de Google ont conquis l’inférence, le moteur de l’économie.

Moving into 2026, expect to see a bifurcated market: Nvidia owns the enterprise and research clouds, while Google, AWS (Trainium), and Meta (MTIA) own the hyperscaler internal workloads. Pour l’instant, Google a lancé un coup de semonce de 9,6 milliards de dollars selon lequel l’efficacité, et pas seulement la puissance brute, est l’avenir de l’IA.

Nos sources (3)

Advertisement

🦋 Discussion sur Bluesky

Discuter sur Bluesky

Recherche de publications...