¡Enlace copiado!

La revolución del razonamiento: la IA "piensa" antes de hablar

La IA ya no solo predice la siguiente palabra. Esta inmersión profunda explora el cambio tectónico del reconocimiento de patrones al verdadero razonamiento con modelos de cadena de pensamiento como o1 de OpenAI y Gemini 1.5 Pro de Google.

🌐
Traducción automática

Este artículo fue traducido automáticamente del original en inglés. Leer el original en inglés

Visualización digital del cerebro que muestra las vías neuronales de la cadena de pensamiento iluminándose secuencialmente

Conclusiones clave

  • El cambio: La industria ha pasado del pensamiento del “Sistema 1” (coincidencia de patrones rápida e intuitiva) al pensamiento del “Sistema 2” (razonamiento lento y deliberado) en los modelos de IA.
  • Cómputo en tiempo de prueba: la nueva ley de escala ya no se trata solo del tamaño de los datos de entrenamiento; se trata de cuánto cálculo gasta el modelo durante la generación de respuestas.
  • Los jugadores: o1 de OpenAI y Gemini 1.5 Pro de Google están liderando esta carga, pero con enfoques arquitectónicos fundamentalmente diferentes.

Durante los últimos cinco años, la receta para una mejor IA fue simple: Hazla más grande.

Más parámetros, más datos de entrenamiento, más GPU. Este enfoque de fuerza bruta produjo GPT-4 y Claude 3. Pero en 2025, las “leyes de escala” (las curvas matemáticas que predecían cuánto más inteligente se volvería la IA con más datos) comenzaron a aplanarse. El campo estaba chocando contra una pared. Los modelos eran máquinas de alucinaciones, excelentes para parecer confiados pero terribles para la lógica.

Luego vino la “Revolución del Razonamiento”.

No se trataba de hacer el modelo más grande; se trataba de cambiar cómo responde. En lugar de soltar el primer token estadísticamente probable, nuevos modelos como o1 de OpenAI y Gemini 1.5 Pro de Google fueron entrenados para hacer una pausa, “pensar” (generar cadenas de pensamiento ocultas) y autocorregirse antes de presentar una respuesta final.

Advertisement

El acantilado de la ley de escala

Para entender por qué ocurrió este cambio ahora, hay que mirar el “Acantilado de la Ley de Escalamiento” de 2024.

Durante una década, las Leyes de escala de Kaplan (llamadas así por el artículo de Jared Kaplan de 2020) se cumplieron: Rendimiento = (Tamaño del conjunto de datos)^α * (Computación)^β. Básicamente, si duplicaba los datos y las GPU, obtenía una caída predecible en las tasas de error.

A finales de 2024, esta curva empezó a aplanarse.

  • Escasez de datos: Las sesiones de capacitación se quedaron sin Internet de alta calidad. Las empresas ya habían eliminado Wikipedia, Reddit, arXiv y todos los libros digitalizados que existen. Los datos restantes (datos sintéticos o redes sociales de baja calidad) produjeron un “colapso del modelo”, donde la IA entrenada en desechos generados por IA se volvió más tonta.
  • Rendimientos decrecientes: estaba costando mil millones de dólares entrenar un modelo que era solo un 2% mejor que la versión anterior. La economía estaba quebrando.

La industria enfrentó una crisis existencial: si los modelos no se pueden hacer más inteligentes haciéndolos más grandes, ¿cómo avanza el campo?

La respuesta fue dejar de optimizar el pre-entrenamiento (acumular conocimientos) y comenzar a optimizar el post-entrenamiento (razonar sobre ese conocimiento). Resulta que los modelos pequeños que “piensan” durante 10 segundos pueden superar a los modelos masivos que responden instantáneamente.

El cambio técnico: del entrenamiento a la inferencia

Para entender por qué esto es un gran avance, es necesario hablar de computación.

Entrenamiento previo versus inferencia

Tradicionalmente, el 99,9 % del coste computacional se producía durante el preentrenamiento (enseñanza del modelo). La inferencia (responder a tu pregunta) fue barata y rápida.

Los nuevos modelos “System 2” invierten esta lógica. Introducen el concepto de “Computación en tiempo de prueba”.

  • A la antigua usanza: Pregunta -> [Conjetura estadística instantánea] -> Respuesta
  • Nueva forma: Pregunta -> [Paso de razonamiento 1] -> [Crítica] -> [Paso de razonamiento 2] -> [Verificación] -> Respuesta

O1 de OpenAI, por ejemplo, genera miles de “pensamientos” internos para resolver un problema matemático difícil. Podría intentar acercarse, darse cuenta de que es un callejón sin salida, retroceder y volver a intentarlo: todo antes de mostrarte una sola palabra. Este monólogo interno (Cadena de pensamiento) permite que el modelo “razona” a través de problemas que confunden a los LLM estándar.

Advertisement

Dentro de la caja negra: cómo funcionan las fichas “pensantes”

Cuando le haces una pregunta, no se queda ahí sentada en silencio. Debajo del capó, está generando tokens de “Cadena de pensamiento oculta” (CoT).

  1. Generación: El modelo desglosa el problema. “Paso 1: definir variables para aclarar la intención del usuario”.
  2. Crítica: Revisa su propio paso. El modelo señala posibles ambigüedades o discrepancias en las intenciones del usuario.
  3. Refinamiento: Regenera el paso. “Paso 1 revisado: utilice la biblioteca asyncio de Python”.

Estos tokens están ocultos para el usuario (principalmente para evitar que los competidores roben los datos de razonamiento), pero son cálculos reales.

Fundamentalmente, se utiliza Aprendizaje por refuerzo (RL) para entrenar este comportamiento. Durante el entrenamiento, al modelo se le plantea un difícil problema matemático. Si obtiene la respuesta correcta, toda la cadena de pensamiento que condujo hasta allí será recompensada. Si falla, la cadena es penalizada. A lo largo de miles de millones de ciclos, el modelo “aprende” qué patrones de pensamiento (desglosar problemas, comprobar casos extremos) conducen a respuestas correctas.

Estudios de casos: o1 frente a Gemini 1.5 Pro

Mientras OpenAI inició el tren del “razonamiento”, Google ha estado jugando un juego diferente que involucra un contexto masivo.

OpenAI o1: El pensador profundo

  • Estrategia: Aprendizaje por refuerzo del razonamiento. El modelo fue recompensado durante el entrenamiento específicamente por generar cadenas de pensamiento correctas.
  • Fortalezas: Matemáticas, codificación y lógica. Domina pruebas como el AIME (competición de matemáticas) porque se comporta como un matemático humano, comprobando su trabajo paso a paso.
  • Debilidad: Es lento. Ese “tiempo para pensar” crea una latencia generalmente inaceptable para un chatbot, aunque necesaria para una tarea de codificación compleja.

Google Gemini 1.5 Pro: el rey del contexto

  • Estrategia: Ventana de contexto extensa (más de 2 millones de tokens) + Aprendizaje en contexto.
  • Fortalezas: Síntesis de información. Gemini 1.5 Pro no sólo “piensa” profundamente; “lee” de ancho. Puede cargar una base de código completa, una película o una biblioteca de libros en su memoria a corto plazo y razonar a partir de esos datos específicos.
  • El matiz: Investigaciones recientes muestran que, si bien Géminis sobresale en la recuperación y la síntesis, a veces tiene dificultades con los acertijos de “lógica pura” que o1 aplasta, a menos que se le indique explícitamente que use la Cadena de pensamiento (CoT).

El costo de pensar

Esta revolución tiene un precio.

Advertisement

En la era GPT-4, el precio era simple: tokens de entrada (baratos) + tokens de salida (caros). Con los modelos de razonamiento, hay un nuevo costo oculto: Fichas de razonamiento.

  • Mensaje estándar: “¿Cuál es la capital de Francia?” -> Salida de 5 tokens. Costo: Micro centavos.
  • Mensaje de razonamiento: “Planifique una ruta logística para 50 camiones evitando peajes”. -> El modelo podría generar 5000 tokens “pensantes” para resolver el rompecabezas, pero solo generará 100 tokens del plan final.

Pagas por pensar. Esto cambia la economía de la IA. Encarece las tareas simples (chatbots, resúmenes) si se utiliza el modelo incorrecto, pero hace posibles por primera vez tareas imposibles (codificación de aplicaciones complejas, descubrimiento legal).

Hay una bifurcación en el mercado:

  1. Modelos rápidos (GPT-4o mini, Gemini Flash): Pensadores del “Sistema 1” baratos e instantáneos para la interacción con la interfaz de usuario.
  2. Modelos profundos (o1, Claude 3.5 Opus): Pensadores del “Sistema 2”, costosos y lentos, para trabajos de alto valor.

Rompiendo el muro de los 5 minutos

¿Por qué te importa esto?

Porque la IA puramente generativa (del tipo “Sistema 1”) tenía un techo. Nunca se podría confiar plenamente en él para escribir código u ofrecer consejos médicos porque no sabía cuándo estaba mal. Era sólo una suposición.

Los modelos de razonamiento desbloquean la Tarea de 5 minutos (y, finalmente, la Tarea de 5 horas).

  • 2023: “Escribe una función de Python para calcular los números de Fibonacci”. (Éxito)
  • 2025: “Escriba un backend de Python para esta arquitectura de aplicación específica, auditelo para detectar fallas de seguridad y escriba el conjunto de pruebas”. (Posible con o1/Géminis)

Al gastar más computación en el momento de la inferencia, la compensación es velocidad por confiabilidad. El cambio es de una IA que se basa en la memorización a una IA que se basa en la deducción.

El futuro: flujos de trabajo agentes

Este es el precursor de los verdaderos Agentes. Un agente que realiza una acción (como navegar por la web o escribir un archivo) necesita razonar sobre las consecuencias de esa acción antes de realizarla.

Los LLM estándar eran demasiado impulsivos para esto. Eliminarían un archivo porque la distribución de probabilidad así lo decía. Los modelos de razonamiento, con su capacidad de “pensar” y autocorregirse, son las células cerebrales faltantes que se necesitan para agentes autónomos y seguros que pueden trabajar durante horas sin supervisión.

El resultado no son sólo mejores chatbots. Son los empleados digitales los que realmente piensan antes de hablar.

Fuentes (3)

Advertisement

🦋 Discusión en Bluesky

Discutir en Bluesky

Buscando publicaciones...