¡Enlace copiado!

La opción nuclear de Google: Vender TPU para romper el dominio de Nvidia

Google está rompiendo su regla de 'Jardín Amurallado' al vender TPU directamente a Meta y Apple. Este desglose cubre la arquitectura Trillium OCS, el acuerdo con Meta y por qué este cambio amenaza el monopolio de Nvidia.

🌐
Traducción automática

Este artículo fue traducido automáticamente del original en inglés. Leer el original en inglés

Racks de TPU de Google azules y brillantes que salen de una pared de vidrio para desafiar a un monolito verde de Nvidia

El “Jardín amurallado” ha caído oficialmente. Durante una década, las Unidades de Procesamiento Tensorial (TPU) de Google fueron el fruto prohibido del mundo de la IA. Podrías alquilarlos dentro de Google Cloud, observar su poder desde la distancia mientras entrenaban a AlphaGo y Gemini, pero nunca podrías poseerlos. Ciertamente no podrías instalarlos en tu propio centro de datos.

Esa regla simplemente se rompió.

En una medida que señala un cambio estructural en el mercado de la IA, valorado en billones de dólares, informes emergentes indican que Google está ultimando acuerdos para alquilar y eventualmente vender TPU directamente a Meta y potencialmente a Apple. Este no es sólo un acuerdo de proveedor; es la primera grieta real en la armadura de Nvidia y un movimiento brillante y desesperado de Google para salvar su propio ecosistema de software.

Si posee acciones de Nvidia o está creando una estrategia de infraestructura de inteligencia artificial, debe comprender la física, la economía y las guerras de software que impulsaron esta decisión.

Las noticias: extraños compañeros de cama

La alineación estratégica es clara. Meta (Facebook) ha sido el consumidor más voraz de Nvidia H100 en el mundo, acumulando más de 600.000. Pero Mark Zuckerberg ha sido abierto sobre su deseo de liberarse del “impuesto Nvidia”: la prima que se paga por el bloqueo de CUDA y el hardware de alto margen.

Advertisement

Según profundos rumores e informes de la industria:

  • El trato: Meta obtendrá acceso a instancias de TPU “bare metal” (probablemente Trillium v6) alojadas inicialmente por Google pero divididas completamente de la nube pública de Google.
  • La hoja de ruta: Para 2027, el marco permitirá a Meta comprar módulos de TPU directamente para instalarlos en sus propios centros de datos que no sean de Google.
  • El factor Apple: Se están produciendo discusiones similares con Apple, que necesita computación masiva para la “Inteligencia de Apple” pero es notoriamente alérgico a depender de competidores como Microsoft o pagar los márgenes de Nvidia.

Esto cambia la ecuación oferta/demanda de la noche a la mañana. Si Meta deja de comprar el 20% del suministro de Nvidia porque cambió a TPU, la escasez que sustenta el poder de fijación de precios de Nvidia se evapora.

Análisis técnico profundo: la física de la luz frente al cobre

¿Por qué Meta querría una TPU cuando la Nvidia Blackwell B200 es el “chip más potente del mundo”? La respuesta no está en el chip en sí: está en los cables. O mejor dicho, la falta de ellos.

La ventaja de OCS (conmutación de circuitos ópticos)

Los SuperPOD de Nvidia dependen de InfiniBand, una red de conmutación eléctrica tremendamente rápida pero tradicional. Para conectar 100.000 GPU, se necesitan kilómetros de cobre e interruptores eléctricos activos que conviertan constantemente electrones en fotones y viceversa.

El arma secreta de Google, implementada desde TPU v4, es Palomar (y ahora Jupiter), basado en Interruptores de circuitos ópticos (OCS).

En lugar de conmutación de paquetes digitales: donde un enrutador lee un paquete, lo almacena en un buffer, decide adónde va y lo retransmite: Google utiliza MEMS (Sistemas Microelectromecánicos). Se trata de pequeños espejos microscópicos que giran físicamente para hacer rebotar un haz de luz de un servidor a otro.

Advertisement

La física gana:

  1. Velocidad de la luz: No hay conversión óptica a eléctrica. La luz simplemente rebota.
  2. Power Zero: Un espejo requiere potencia cero para mantener su posición. Sólo consume energía cuando se mueve (reconfigura). Un interruptor eléctrico consume una enorme potencia las 24 horas del día, los 7 días de la semana, solo para mantener los puertos activos.
  3. Independiente de la topología: Google puede volver a cablear físicamente la red en milisegundos. Si una forma de “Toro” es mejor para el trabajo de entrenamiento A, y una forma de “libélula” es mejor para el trabajo de inferencia B, los espejos simplemente se inclinan y la supercomputadora se vuelve a cablear físicamente.

La matemática de la eficiencia

Mientras Nvidia busca FLOP sin procesar, Google busca Rendimiento/TCO. La TPU Trillium (v6) afirma tener una mejora en la eficiencia energética del 67 % con respecto a la v5e, en gran parte debido a esta eficiencia de interconexión.

Veamos las matemáticas teóricas del enfriamiento. Los interruptores eléctricos generan calor. Ese calor hay que enfriarlo. Los interruptores OCS casi no generan calor.

Total Power=Compute Power+Cooling Power+Networking Power\text{Total Power} = \text{Compute Power} + \text{Cooling Power} + \text{Networking Power}

En un clúster de Nvidia, la potencia de red puede representar entre el 15 y el 20 % del consumo total del clúster. En un módulo de TPU, OCS reduce el consumo de energía de la red en casi un 95 %. En un centro de datos de 100 MW, ese delta de eficiencia significa que puede incluir un 30 % más de computación en la misma envolvente de energía. Para Meta, entrenar Llama 5 vale miles de millones.

La guerra del software: JAX contra CUDA

Esta es la parte que Wall Street pasa por alto. Google no sólo vende chips porque quiere ingresos por hardware. Está vendiendo chips para salvar JAX.

Advertisement

El foso CUDA

El monopolio de Nvidia no es el hardware; es software. Todo el mundo codifica en CUDA (a través de PyTorch). Como todo el mundo usa CUDA, todo el mundo compra Nvidia. Es un bucle que se refuerza a sí mismo.

JAX de Google

El lenguaje interno de Google, JAX, es posiblemente superior para física avanzada y matemáticas pesadas. Se optimiza automáticamente para el compilador XLA (Álgebra lineal acelerada). Pero fuera de DeepMind y los investigadores especializados, la adopción es baja.

Al poner las TPU en manos de Meta, Google está obligando a los ingenieros de Meta (los mejores del mundo fuera de Google) a optimizar PyTorch para XLA.

  • Si PyTorch se ejecuta perfectamente en TPU (a través de XLA), el “CUDA Moat” se llena de arena.
  • De repente, los chips AMD (que también ejecutan XLA/ROCm) se vuelven viables.
  • Intel Gaudí se vuelve viable.
  • Todo el ecosistema se desacopla de Nvidia.

Historia contextual: una década de secretos

Google inventó la arquitectura Transformer (la “T” en GPT) en 2017. Construyeron la primera TPU en 2015. Estaban años por delante. ¿Por qué perdieron?

  • 2016 (TPU v1): Creado exclusivamente para inferencia (ejecutando AlphaGo).
  • 2018 (TPU v2/v3): Las bestias de entrenamiento. Refrigerado por líquido. Pero Google los mantuvo encerrados en la nube. “Si uno quiere el chip, debe usar la nube”.
  • 2020-2023 (The Hubris): Google asumió que su ventaja de hardware era infinita. No vendieron las patatas fritas.
  • 2024 (The Panic): Microsoft y OpenAI tomaron la delantera utilizando las GPU de Nvidia. AWS construyó Trainium.
  • 2025 (The Pivot): Google se da cuenta de que la “exclusividad en la nube” es una sentencia de muerte. Los desarrolladores van donde están los chips. Si los chips no están por todas partes, los desarrolladores se van.

Esta venta es una admisión de fracaso en la estrategia, pero un golpe de genialidad en la recuperación.

Análisis financiero: el cálculo del “impuesto Nvidia”

Analicemos los números de por qué Meta está aceptando este acuerdo.

El marcado de Nvidia:

  • Costo de fabricación del H100 (TSMC + CoWoS + HBM): ~$3000 - $4000
  • Precio de venta del H100: ~$25 000 - $30 000
  • Margen: ~85%

La economía de TPU: Google diseña la TPU internamente y utiliza Broadcom para el diseño de backend. No necesitan obtener un margen del 85% en Meta. Pueden vender la TPU por $15,000, obtener una ganancia saludable del 50% y aun así ofrecerle a Meta un 50% de descuento en relación con Nvidia.

Para un grupo de 100.000 chips:

  • Costo de Nvidia: $3 mil millones
  • Costo de TPU: $1,5 mil millones

Ahorros: $1,5 mil millones. Con ello se paga toda la infraestructura de refrigeración del centro de datos.

Análisis prospectivo: The Chip Alliance

Esta medida crea efectivamente una “Alianza Anti-Nvidia”.

  1. Google: genera ingresos por hardware + ahorra relevancia a JAX + perjudica a su mayor rival (Nvidia).
  2. Meta/Apple: obtiene impulso para negociar precios más bajos con Nvidia y diversifica la eficiencia de su cadena de suministro.
  3. Amazon: ya tiene Trainium, ahora ve la validación de la ruta que no es de Nvidia.

El impacto en el mercado: La industria está pasando de un Monopolio (Nvidia tiene una participación del 90%) a un Oligopolio (Nvidia, Google, AWS, AMD).

  • Corto plazo (1-2 años): Nvidia sigue siendo el rey. El retraso en el suministro es demasiado largo y el software tarda en adaptarse.
  • Medio plazo (3-5 años): Los márgenes se comprimen. Esta noticia específica es la señal de que los márgenes brutos del 80% que disfruta Nvidia probablemente estén alcanzando su punto máximo.

Veredicto: El hardware es real. La física (OCS) es superior para cargas de trabajo específicas. Si Google puede entregar el suministro, el “Código Rojo” ya no es sólo para Google: es para Jensen Huang.

Fuentes (4)

Advertisement

🦋 Discusión en Bluesky

Discutir en Bluesky

Buscando publicaciones...