¡Enlace copiado!

CXL: El fallo de la "RAM infinita"

Si se alcanzan los límites de RAM, la única opción es "hacer trampa". La solución de la industria a la escasez no es solo "fabricar más chips", sino un nuevo protocolo llamado CXL que finalmente brinda a los servidores la capacidad de "descargar más RAM".

🌐
Traducción automática

Este artículo fue traducido automáticamente del original en inglés. Leer el original en inglés

Visualización futurista de la agrupación de memoria CXL con flujos de datos brillantes que conectan racks de servidores

Conclusiones clave

  • La realidad de la “descarga de RAM”: CXL 3.0 permite a los servidores tomar prestada memoria de un grupo compartido a través de un bus tipo PCIe, resolviendo de manera efectiva las limitaciones de las ranuras físicas.
  • Resolver el desperdicio del 25%: hasta una cuarta parte de la memoria del centro de datos permanece inactiva (“bloqueada”) porque está bloqueada en una CPU que no la necesita. CXL libera esta capacidad.
  • Física de la velocidad de la luz: Al utilizar la señalización PCIe 6.0 PHY y PAM-4, CXL 3.0 alcanza 64 GT/s, lo que hace que la memoria remota sea lo suficientemente rápida como para sentirse local.
  • El fin de la placa base: la industria avanza hacia la “computación desagregada”, donde la CPU, la RAM y el almacenamiento son dispositivos separados conectados por luz y cobre.

Durante décadas, el meme del “uso de descargas de RAM” ha sido la prueba de fuego definitiva para los conocimientos informáticos. No puedes descargar hardware. La RAM es una barra física de silicio y condensadores, soldada o ranurada directamente al lado de la CPU porque la velocidad de la luz es demasiado lenta para colocarla en cualquier otro lugar.

Advertisement

Pero en 2025, el chiste se hará realidad. La industria se ha topado con un muro: el número de núcleos de CPU se está disparando, pero el número de canales de memoria que los ingenieros pueden insertar en una placa base, no. Los procesadores están muriendo de hambre.

Ingrese Compute Express Link (CXL), específicamente la revisión 3.0. Es un protocolo que permite a los ingenieros romper las leyes de la arquitectura de servidor tradicional. Al desacoplar la memoria de la CPU y colocarla en un “grupo” compartido, CXL permite que un servidor acceda a la memoria ubicada físicamente en otro cajón (o incluso en otro bastidor) a velocidades lo suficientemente cercanas a la DRAM local como para que el software no pueda notar la diferencia.

Es lo más cerca que estarán los centros de datos de un problema de “RAM infinita”. Aquí está la física, la economía y la ingeniería detrás del cambio de hardware más importante de la década.

Antecedentes: La crisis de la “memoria varada”

Para entender CXL, hay que entender la pesadilla económica de los hiperescaladores modernos (como Google, AWS y Azure).

El impuesto del 25%

En un servidor tradicional, compras una CPU y llenas las ranuras con RAM. Si ese servidor ejecuta una tarea de computación intensa que utiliza el 100 % de la CPU pero solo el 10 % de la RAM, el 90 % de esa RAM se desperdicia. Está “varado”. No se puede prestar al servidor de al lado que está fallando porque se quedó sin memoria.

Según una investigación de Microsoft y Marvell, aproximadamente el 25% de toda la memoria del centro de datos está bloqueada en un momento dado.

Wasted Capital=Total DRAM Spend×0.25\text{Wasted Capital} = \text{Total DRAM Spend} \times 0.25

Dado que se prevé que las ventas de DRAM para servidores alcancen los $40 mil millones para 2028, eso representa una $8 mil millones de pérdida anual. En una era en la que los modelos de IA duplican su tamaño cada pocos meses, dejar tanta capacidad sobre la mesa es inaceptable.

Advertisement

Comprensión de CXL 3.0: la física de las trampas

CXL no es un cable nuevo; es un protocolo que se encuentra encima de la interfaz eléctrica PCIe. Si PCIe es la carretera, CXL son las reglas de tráfico que permiten a los automóviles (datos) conducir a velocidades de Ferrari sin chocar.

Cómo funciona: crear “coherencia”

La magia de CXL es la Coherencia de caché.

Normalmente, si un dispositivo (como una GPU o un SSD) escribe en la memoria, la CPU no lo sabe instantáneamente. Es posible que la CPU tenga una copia antigua de esos datos en su caché L1/L2. Esta discrepancia provoca errores. CXL introduce tres protocolos para solucionar este problema:

  1. CXL.io: Descubrimiento y configuración (cosas básicas de PCIe).
  2. CXL.cache: permite que los dispositivos espíen el caché de la CPU.
  3. CXL.mem: Permite que la CPU lea/escriba la memoria del dispositivo como si fuera la RAM del sistema.

CXL 3.0 lleva esto un paso más allá con Memory Pooling.

Las matemáticas del ancho de banda

CXL 3.0 normalmente utiliza la capa física PCIe 6.0. Esto se basa en la señalización PAM-4 (modulación de amplitud de pulso de 4 niveles). En lugar de enviar 0 y 1 (NRZ), envía cuatro niveles de voltaje (00, 01, 10, 11), duplicando efectivamente el rendimiento por reloj.

Throughput=64 GT/s×16 lanes×256242(FEC overhead)128 GB/s\text{Throughput} = 64 \text{ GT/s} \times 16 \text{ lanes} \times \frac{256}{242} (\text{FEC overhead}) \approx 128 \text{ GB/s}

Si bien es más lento que el DDR5 local más rápido (que puede impulsar más de 200 GB/s a través de múltiples canales), es lo suficientemente rápido para la “Memoria de expansión”, el nivel de RAM que se utiliza cuando se llena la asignación local.

La evolución: por qué CXL 3.0 es el “fallo”

Para entender por qué CXL 3.0 es una revolución, el análisis debe mirar a sus predecesores.

  • CXL 1.0/1.1 era una conexión simple punto a punto. Permitía que una tarjeta de expansión de memoria entrara en un servidor y la CPU la vería. Útil, pero estático. Resolvió el problema de la “capacidad de memoria”, pero no el problema de la “memoria varada”.
  • CXL 2.0 introdujo la conmutación. Al igual que un conmutador de red, los ingenieros podrían conectar varios dispositivos a un solo host o dividir un dispositivo entre hosts. Este fue el nacimiento de la agrupación, pero se limitó a una única jerarquía de distribución.
  • CXL 3.0 es donde la física se vuelve interesante. Introduce “Telas”. En lugar de una simple estructura de árbol, los dispositivos pueden comunicarse entre sí en una malla de igual a igual. Una GPU puede comunicarse directamente con una tarjeta de memoria CXL sin activar la CPU. Esto reduce la latencia e imita el comportamiento de “RAM infinita” de un clúster localizado. Convierte todo el centro de datos en una placa base gigante.

La inmersión profunda: desagregación y fabricación

Las implicaciones de esto van más allá del simple ahorro de dinero. Cambia la forma en que se construyen los servidores.

Advertisement

La muerte de la placa base

Tradicionalmente, una placa base tiene un mapa estricto: 2 zócalos de CPU, 32 ranuras DIMM. Vives y mueres según ese mapa. Con CXL, la “placa base” se convierte en un “backplane”.

  • Cajón 1: Solo CPU (Computación).
  • Cajón 2: Sólo RAM (Memory Pool).
  • Cajón 3: Solo GPU (Aceleradores).

Se conectan a través de un conmutador CXL. Si el Servidor A necesita 1 TB de RAM hoy para una compilación masiva de bases de datos, el Switch lo asigna. Si mañana solo necesita 32 GB, el Switch recupera esa RAM y se la entrega al Servidor B para el entrenamiento de IA.

Dispositivos multilógicos (MLD)

CXL 3.0 introduce MLD, lo que permite dividir una sola unidad de memoria CXL y compartirla entre hasta 16 hosts simultáneamente. Dentro del controlador de memoria, una unidad llamada Unidad de administración de canales (CHMU) actúa como policía de tráfico, asegurando que cuando el Host A escribe en la dirección 0x100, no sobrescribe los datos del Host B en la misma dirección física (a menos que compartan datos intencionalmente, lo que CXL también admite).

Impacto en la industria

Impacto en el entrenamiento de IA

El entrenamiento de IA está ligado a la memoria. Las GPU H100 y B200 son bestias, pero a menudo están hambrientas de datos. CXL permite mantener pesos de modelos significativamente mayores en “casi memoria”, lo que reduce la necesidad de recuperar datos de SSD NVMe lentos.

Impacto en los precios de la nube

Esta eficiencia probablemente conducirá a instancias de “RAM puntual”. Así como puede comprar instancias EC2 al contado en AWS, es posible que pronto pueda aumentar dinámicamente su capacidad de RAM por unos centavos de dólar, utilizando la capacidad disponible del rack a su lado.

Desafíos y limitaciones

  1. Penalización por latencia: la física es terca. Agregar un interruptor y unos pocos pies de cable agrega nanosegundos. La memoria CXL tiene aproximadamente 170-250 ns de latencia, en comparación con 80-100 ns de la DRAM local. Es una memoria de “Nivel 2”: más rápida que las SSD, pero más lenta que la RAM local.
  2. Integridad de la señal: la señalización PAM-4 es frágil. A 64 GT/s, la señal se degrada después de unos pocos centímetros de traza de PCB. Se requieren retemporizadores complejos y cableado de alta calidad, lo que aumenta el costo inicial.
  3. Soporte de software: Los sistemas operativos deben ser “compatibles con CXL”. El kernel del sistema operativo debe ser lo suficientemente inteligente como para colocar datos “calientes” en la RAM local y datos “calientes” en la RAM CXL (Tiering).

Análisis prospectivo: perspectivas a cinco años

Corto Plazo: La Era Híbrida (2025-2026)

El mercado verá “CXL Expanders”: tarjetas complementarias que parecen SSD pero que contienen RAM. Estos se conectarán a servidores estándar para agregar 512 GB o 1 TB de capacidad económica.

Medio plazo: arquitectura a escala de rack (2027+)

El chasis del servidor desaparecerá. Los hiperescaladores comprarán “Compute Bricks” y “Memory Bricks”. Los centros de datos se parecerán menos a hileras de cajas de pizza y más a enormes colmenas de recursos desagregados refrigerados por líquido.

El horizonte de la “memoria infinita”

Con el tiempo, las aplicaciones no sabrán dónde está su memoria. Una aplicación podría solicitar 100 TB de RAM, y la estructura CXL los improvisará a partir de la capacidad disponible en todo el centro de datos.

El resultado final

CXL es la admisión por parte de la industria de que la Ley de Moore para pines y cables ha terminado. Los ingenieros no pueden meter más cables en un zócalo de CPU. Entonces, los fabricantes dejaron de intentar agrandar la tubería y, en su lugar, construyeron un sistema de plomería más inteligente.

Para el usuario medio, esto significa servicios en la nube que son más baratos y rápidos. Para el ingeniero, significa el fin de los errores de “Memoria insuficiente”. La RAM no es infinita, pero por primera vez en la historia, finalmente es fluida.

Fuentes (4)

Advertisement

🦋 Discusión en Bluesky

Discutir en Bluesky

Buscando publicaciones...