¡Enlace copiado!

Clasificación de poder de IA 2025: OpenAI lidera, Google persigue

La pausa de la IA ha terminado. Diciembre de 2025 trajo los mayores lanzamientos de modelos de la historia. Este análisis detalla por qué OpenAI y Anthropic están empatados en el primer lugar, y por qué el enorme ecosistema Gemini 3 de Google se sitúa en un cercano tercer puesto.

🌐
Traducción automática

Este artículo fue traducido automáticamente del original en inglés. Leer el original en inglés

Arena digital futurista que muestra a las entidades de IA de OpenAI, Anthropic y Google en una formación de tabla de clasificación

La narrativa de “la IA está chocando contra una pared” de principios de 2025 está oficialmente muerta. Durante la mayor parte del año, la industria permaneció en un extraño limbo: GPT-4.5 aterrizó en febrero con un encogimiento de hombros, las conversaciones sobre escalamiento se habían vuelto bajistas y “la IA es una burbuja” era la respuesta segura en las cenas.

Ese estado de ánimo se hizo añicos en seis semanas.

Entre el 12 de noviembre y el 11 de diciembre, los “Tres Grandes” abandonaron sus opciones nucleares en rápida sucesión: GPT-5.1 de OpenAI (12 de noviembre), Gemini 3 de Google (18 de noviembre) y Claude Opus 4.5 de Anthropic (24 de noviembre). Luego OpenAI regresó para un segundo giro: GPT-5.2 llegó el 11 de diciembre, supuestamente acelerado desde una ventana planificada para finales de diciembre después de un memorando interno de “Código Rojo” sobre el impulso de Gemini. El polvo ni siquiera se ha asentado, pero los puntos de referencia y, lo que es más importante, las comprobaciones de vibraciones, ya están disponibles.

Para los desarrolladores, estrategas o profesionales que deciden suscribirse a 2026, aquí está la fría y dura realidad de la nueva jerarquía.

Advertisement

Es casi un empate en la cima, pero por razones muy diferentes.

El ranking: una decisión dividida

Por primera vez desde el lanzamiento del GPT-4 en 2023, no existe un único “Rey”. En cambio, existe un duopolio funcional en la vanguardia, seguido de cerca por un enorme titán.

#1 (Empate): GPT-5.2 de OpenAI

El motor de razonamiento

OpenAI lo ha vuelto a hacer, pero no de la forma que la mayoría esperaba. GPT-5.2 no es sólo “más informado”. Es una bestia fundamentalmente diferente cuando se trata de razonar a la hora de responder.

GPT-5.2 se envía en tres modos: Instantáneo, Pensamiento y Pro, y el nivel Pensamiento es el que reescribe las tablas de clasificación. En ARC-AGI-2, el punto de referencia creado para castigar el recuerdo de patrones y recompensar la inducción genuina de reglas, GPT-5.2 Thinking obtiene una puntuación del 52,9 %, frente al 37,6 % de Claude Opus 4.5 y el 31,1 % de Gemini 3 Pro. Obtiene un 100% perfecto en el conjunto de olimpíadas de matemáticas AIME 2025 y lidera GDPval, el punto de referencia de OpenAI para el trabajo de conocimiento profesional real, con un 70,9% frente al 53,5% de Gemini 3.

Esa inteligencia tiene un precio: $1,75 por millón de tokens de entrada y $14 por millón de salida (aproximadamente un 40% por encima de GPT-5.1), y el nivel Pro tiene un precio aproximadamente un orden de magnitud superior a Thinking.

Es el rey indiscutible de la lógica, las matemáticas y el razonamiento frío y duro.

#1 (Empate): Claude Opus 4.5 de Anthropic

El caballo de batalla de la codificación que reduce su propio precio

Si GPT-5.2 es el motor de lógica fría, Claude Opus 4.5 es el caballo de batalla de producción.

Aquí importan dos números. El primero es 80,9%: la puntuación de Opus 4.5 en SWE-bench Verified, el punto de referencia que mide si un modelo realmente puede corregir errores reales en repositorios reales. Incluso después del lanzamiento de GPT-5.2 en diciembre, lo mejor de OpenAI se ubica en 80,0% en la misma prueba: el modelo dos semanas más antiguo mantuvo la corona de codificación, aunque solo fuera por un pelo. El segundo número es el precio: $5 por millón de tokens de entrada y $25 por millón de salida, un recorte de aproximadamente dos tercios del precio de Opus 4.1, hecho al mismo tiempo que ocupa la cima de las tablas de clasificación de codificación.

Advertisement

La compensación es el contexto: una ventana de 200.000 tokens, una fracción del millón de Gemini 3. La apuesta de Anthropic es que la mayor parte del trabajo profesional (una tarde de programación en pareja, una revisión de contrato, un bucle de agente) cabe cómodamente en 200k, y que los desarrolladores estarán felices de aprovechar la capacidad de codificación de frontera a precios de nivel medio de 2024.

Está alineado con la seguridad, tiene una prosa sólida y es el mejor “programador de pares” del mercado y, por primera vez, la inteligencia de clase Opus tiene un precio para el trabajo diario.

#2: Géminis 3 de Google

El gigante del ecosistema

Google ocupa el tercer lugar, pero no los descarte.

Durante seis días en noviembre, Gemini 3 parecía el modelo a batir: se lanzó a un LMArena Elo récord de 1501, el primer modelo que superó la línea 1500, y superó a GPT-5.1 en los puntos de referencia de razonamiento clave. Pero el contragolpe de GPT-5.2 en diciembre reabrió la brecha donde más duele: 31,1% versus 52,9% en ARC-AGI-2, y 53,5% versus 70,9% en GDPval. En los problemas más difíciles de razonamiento novedoso, Gemini 3 está ahora claramente detrás del duopolio.

Sin embargo, Gemini 3 tiene superpoderes que los demás no tienen: modalidad y alcance.

Es el modelo multimodal más potente de los tres: vídeo, audio e imágenes de forma nativa, con una ventana de contexto de un millón de tokens que eclipsa los 200.000 de Claude. Y Google está impulsando con fuerza la integración con Search y la suite Workspace. No es el cerebro aislado más inteligente, pero es el asistente más útil si vives en el ecosistema de Google.

Análisis técnico profundo: la arquitectura de la inteligencia

¿Por qué sucede esto? ¿Por qué la división? Porque los dos dirigentes pasaron 2025 apostando por cosas diferentes.

Advertisement

El pivote “Cómputo en tiempo de prueba”

OpenAI apostó mucho por el razonamiento en tiempo de inferencia. En lugar de simplemente entrenar un modelo más grande (cómputo de entrenamiento), optimizaron para que el modelo “pensara” más antes de responder (cómputo de inferencia).

Total ComputeTraining Ops+(Inference Ops×Reasoning Steps)\text{Total Compute} \approx \text{Training Ops} + (\text{Inference Ops} \times \text{Reasoning Steps})

Eso es exactamente lo que son los modos Thinking y Pro de GPT-5.2: marcan cuánto razonamiento gastar en el momento de responder. Es por eso que el modelo se detiene antes de responder preguntas difíciles (no se retrasa, sino que piensa) y es por eso que la puntuación ARC-AGI-2 saltó precisamente en la clase de problemas de reglas novedosas que los modelos de coincidencia de patrones fracasan.

La apuesta por la eficiencia

Anthropic, por otro lado, apuesta por hacer que la inteligencia de frontera sea lo suficientemente barata como para funcionar todo el día.

El titular de Opus 4.5 no era un punto de referencia: era la factura. Reducir el precio del buque insignia en aproximadamente dos tercios y encabezar SWE-bench Verified es una declaración sobre dónde cree Anthropic que está el dinero: no en una respuesta heroica, sino en agentes y asistentes de codificación que realizan miles de llamadas por tarea. Un modelo que es un 1% mejor pero 3 veces más caro pierde ese mercado.

Por eso Claude se siente el modelo “trabajador”. Está diseñado (y ahora tiene un precio) para un uso de producción sostenido.

La historia: cómo llegó aquí la industria

Para comprender diciembre de 2025, hay que mirar hacia atrás, al “invierno del descontento” de principios de 2025.

En febrero de 2025, las leyes de escala parecían estar chocando contra una pared. El GPT-4.5, el “Orion” del que se rumoreaba desde hace mucho tiempo, el modelo que muchos esperaban que fuera GPT-5, fue apenas mejor que su predecesor en las tareas cotidianas a pesar de ser enorme y costoso de ejecutar. Los inversores se estaban poniendo nerviosos. La narrativa cambió a “La IA es una burbuja”.

Lo que rompió el muro no fue una carrera previa al entrenamiento más grande. Fue razonamiento.

El aprendizaje por refuerzo en cadenas de pensamiento (modelos de entrenamiento para resolver problemas y recompensarlos cuando la respuesta es correcta) resultó a una escala donde el entrenamiento previo en bruto se había estancado. La serie o de OpenAI demostró el concepto; El lanzamiento de GPT-5 en agosto lo convirtió en el buque insignia; y para finales de 2025, todos los laboratorios fronterizos habían reconstruido su oferta en torno a modos de pensamiento.

Este ciclo de lanzamiento de diciembre es la primera cosecha completa de ese pivote. ¿El resultado? El muro estaba roto. Los rendimientos decrecientes ya no son la historia; la diferenciación es.

Análisis prospectivo: 2026 y más allá

Entonces, ¿hacia dónde se dirige la industria a partir de ahora?

Para los CTO o directores de ingeniería, la estrategia para 2026 es clara: Orquestación del modelo.

Se acabaron los días de elegir “un modelo para gobernarlos a todos”. No se puede simplemente comprar una licencia empresarial para OpenAI y dar por terminado el día.

La arquitectura del “enrutador”

La pila ganadora para 2026 se verá así:

  1. GPT-5.2 en la parte superior, actuando como “Arquitecto”. Recibe la consulta del usuario, la desglosa y planifica la ejecución.
  2. Claude Opus 4.5 como el “Trabajador”. Toma el plan y escribe el código o contenido específico, garantizando la seguridad y los matices estilísticos.
  3. Géminis 3 como “Ojos y oídos”. Procesa todas las entradas de vídeo, audio y documentos a gran escala antes de proporcionar contexto a los demás.

El costo de la inteligencia está cayendo, pero el valor de la inteligencia especializada se está disparando.

El cuello de botella de costos

Lo único que detiene este cohete es la factura. Peak Reasoning es ahora un producto premium: GPT-5.2 se lanzó a un 40% por encima de los precios de GPT-5.1, y su nivel Pro es aproximadamente un orden de magnitud superior al nivel Thinking. Cada respuesta “pensante” quema múltiplos de los tokens que consume una respuesta simple, que es exactamente por qué el recorte de precios de Anthropic fue un movimiento tan agresivo y por qué la escasez de computación sigue impulsando el cambio hacia la eficiencia arquitectónica.

Se espera que 2026 sea el año de los “modelos pequeños” (SLM) que se ejecutan en el dispositivo para tareas básicas, y que los tres grandes solo se someten a razonamientos complejos. Pero no nos equivoquemos: el techo de cristal se ha hecho añicos.

OpenAI y Anthropic están intercambiando golpes en la cumbre. Google está construyendo el estadio en el que luchan. El ritmo de la innovación nunca ha sido tan rápido.

Fuentes (13)

Advertisement

🦋 Discusión en Bluesky

Discutir en Bluesky

Buscando publicaciones...