¡Enlace copiado!

Fable 5 duró 3 días. Una carta a las 5:21 p. m. lo apagó todo

El gobierno de EE. UU. utilizó una directiva de control de exportaciones para obligar a Anthropic a cerrar Fable 5 y Mythos 5 el 12 de junio, tres días después de su lanzamiento. El supuesto jailbreak, según Anthropic: pedirle al modelo que solucionara errores de software. Dos días antes, Anthropic había pedido públicamente exactamente este tipo de poder gubernamental.

🌐
Traducción automática

Este artículo fue traducido automáticamente del original en inglés. Leer el original en inglés

Una mano con un traje oscuro tira de un gran interruptor industrial rojo mientras una inmensa sala de centro de datos se apaga fila por fila detrás de un cristal, simbolizando el cierre de un modelo de IA ordenado por el gobierno

Conclusiones clave

  • Washington retiró un modelo de IA activo: El 12 de junio de 2026, el gobierno de EE. UU. emitió una directiva de control de exportaciones que obligó a Anthropic a desactivar Claude Fable 5 y Claude Mythos 5 para todos los clientes, tres días después de su lanzamiento.
  • El desencadenante está en disputa: Anthropic dice que la evidencia del gobierno es un único jailbreak “estrecho y no universal” que consiste en pedirle al modelo que lea un código base y corrija sus errores, una capacidad que, según afirma, ya tienen otros modelos públicos.
  • El momento es implacable: Dos días antes de la directiva, Anthropic publicó un marco de políticas en el que argumentaba que el gobierno debería tener la autoridad legal para bloquear implementaciones peligrosas de IA. Obtuvo el poder que pidió, menos el debido proceso que solicitó.
  • Lo que realmente está en juego es la arquitectura: Fable 5 y Mythos 5 son el mismo modelo subyacente separados por una capa de seguridad. Una afirmación creíble de jailbreak contra Fable es una afirmación de que cualquiera puede acceder a lo que Anthropic llama el modelo de ciberseguridad más fuerte del mundo.

Una carta a las 5:21 p. m.

A las 5:21 p. m., hora del este (ET), del 12 de junio, llegó una carta a Anthropic. Al final de la noche, el modelo de inteligencia artificial (IA) cuyas capacidades según Anthropic “superan las de cualquier modelo” que haya puesto a disposición del público en general había desaparecido, desactivado para todos los clientes del planeta.

Advertisement

La carta era una directiva de control de exportaciones del gobierno de EE. UU., emitida bajo autoridades de seguridad nacional. Ordenaba la suspensión de todo acceso a Claude Fable 5 y Claude Mythos 5 por parte de “cualquier ciudadano extranjero, ya sea dentro o fuera de los Estados Unidos, incluidos los empleados extranjeros de Anthropic”. La empresa dice que el efecto neto de la orden la obligó a “desactivar abruptamente Fable 5 y Mythos 5” para todos los clientes. No es difícil ver por qué: ningún servicio público de IA comprueba los pasaportes en la ventana de chat. El acceso a todos los demás modelos de Anthropic sigue activo.

Fable 5 se lanzó el 9 de junio. Sobrevivió tres días.

Los gobiernos han prohibido aplicaciones dentro de sus fronteras, sancionado a fabricantes de chips y restringido las exportaciones de semiconductores. Pero una orden que hace que una empresa apague su propio modelo insignia en todo el mundo, uno que Anthropic dice que se implementó para “cientos de millones de personas”, es un instrumento de poder estatal genuinamente nuevo. Y la empresa receptora es la misma que pasó los últimos cuatro meses en conflicto abierto con la administración Trump, y los últimos dos días argumentando que los gobiernos deberían tener una versión de este mismo poder.

Qué hace realmente la directiva

Comencemos con el mecanismo, que es más extraño de lo que sugieren los titulares. Esto no fue una orden judicial ni una retirada bajo la ley de protección al consumidor. La autoridad de bloqueo que la propia Anthropic ha propuesto iría, en palabras de la empresa, “más allá de lo que existe en la ley actual o en las propuestas existentes en el Congreso”, lo que significa que no había ningún estatuto de retirada específico de IA disponible para usar. A lo que recurrió el gobierno en su lugar fue a una directiva de control de exportaciones, la familia legal de herramientas que normalmente se utilizan para evitar que los chips, los diseños de armas y el cifrado lleguen a adversarios extranjeros.

Advertisement

El alcance es lo que la convierte en un cierre total de facto. Al prohibir el acceso a cualquier ciudadano extranjero en cualquier lugar, incluso dentro de los Estados Unidos y dentro de la propia Anthropic, la directiva hizo que el cumplimiento mediante filtrado fuera prácticamente imposible. Anthropic dice que la carta “no proporcionó detalles específicos de su preocupación por la seguridad nacional”. La empresa afirma que solo ha recibido “evidencia verbal” del problema que el gobierno cree haber encontrado.

Eso importa para lo que viene después. Una reglamentación formal se puede litigar línea por línea. Una directiva justificada verbalmente, sin nada publicado, deja a su objetivo argumentando contra una afirmación que no puede ver por completo. No es necesario ponerse del lado de Anthropic en esta lucha para notar que el proceso es lo opuesto a transparente.

El jailbreak que supuestamente lo justificó

Según Anthropic, el gobierno cree haber tenido conocimiento de un método para eludir, o hacer “jailbreak”, a los sistemas de seguridad de Fable 5. Jailbreaking significa diseñar instrucciones que consigan que un modelo haga cosas que sus salvaguardas se supone que deben rechazar.

La descripción que hace Anthropic de la técnica es donde la historia se inclina hacia lo absurdo. La empresa dice que el jailbreak afirmado “consiste esencialmente en pedirle al modelo que lea un código base específico y corrija cualquier error de software”. Ese no es un ataque exótico. Es una descripción del trabajo rutinario de seguridad defensiva, del tipo que realizan a diario todos los equipos de seguridad corporativa del planeta. Anthropic dice que revisó una demostración y un informe que cree que subyace a la directiva, y descubrió que la técnica reveló “un pequeño número de vulnerabilidades menores previamente conocidas” que otros modelos públicos, “incluido el GPT-5.5 de OpenAI”, también pueden encontrar sin ninguna elusión. No se ha hecho pública ninguna orden comparable contra ningún modelo rival.

Advertisement

Dos advertencias merecen el mismo peso. Primero, esta es completamente la caracterización de Anthropic. La directiva no es pública, el informe no es público y el gobierno puede estar actuando sobre evidencia que Anthropic no ha visto o no describirá. Segundo, existían afirmaciones públicas de jailbreak contra Fable 5 antes de la directiva. Días después del lanzamiento, el conocido red-teamer de IA Pliny the Liberator dijo públicamente que su equipo eludió los clasificadores de seguridad de Fable 5, publicando capturas de pantalla que según él muestran al modelo produciendo material que debería rechazar, incluido código de explotación de software en funcionamiento. TechTimes informó sobre esas afirmaciones el 12 de junio sin establecer ninguna conexión con la acción del gobierno, y ninguna evidencia pública las vincula con la directiva.

El contrapunto de Anthropic es el proceso, no la negación. La empresa dice que en las semanas previas al lanzamiento realizó pruebas de vulnerabilidad de las salvaguardas de Fable con el gobierno de EE. UU., el Instituto de Seguridad de IA del Reino Unido (UK AISI) y terceros privados durante “miles de horas en total”, y que “ningún evaluador ha podido encontrar un jailbreak universal todavía”. También admite, notablemente, que probablemente no exista una resistencia perfecta al jailbreak para ningún proveedor, razón por la cual combina las salvaguardas con el monitoreo y un requisito de retención de datos de 30 días diseñado para detectar y estudiar los ataques.

Un modelo, dos nombres

Para entender por qué una afirmación de jailbreak contra Fable 5 activa la maquinaria de seguridad nacional, se necesita la arquitectura. Fable 5 y Mythos 5 no son hermanos. Son el mismo modelo subyacente con ropas diferentes.

Fable 5 es la versión pública. Se distribuye con clasificadores de seguridad que detectan solicitudes relacionadas con ciberseguridad, biología y química, o destilación de modelos, y entregan esas respuestas al modelo inferior, Claude Opus 4.8, informando al usuario cuando ocurre. Anthropic dice que estas salvaguardas se ajustaron de manera conservadora y se activan “in menos del 5% de las sesiones” en promedio. Haga la aritmética sobre ese límite y la escala se vuelve vívida: por cada millón de sesiones, hasta 50.000 podrían sufrir el desvío. Anthropic señaló esa compensación en el lanzamiento, y su declaración de suspensión admite que las salvaguardas son tan fuertes que “muchos usuarios se han quejado de que son demasiado amplias”.

Mythos 5 es el mismo modelo “con las salvaguardas levantadas en algunas áreas”, lanzado solo a un pequeño grupo de ciberdefensores y proveedores de infraestructura a través de Project Glasswing, un programa de acceso controlado ejecutado en colaboración con el gobierno de EE. UU. Anthropic lo llama el modelo con “las capacidades de ciberseguridad más fuertes de cualquier modelo en el mundo”.

Ese diseño es todo el juego. La brecha entre Fable y Mythos no es la capacidad. Es un clasificador. Así que cuando alguien afirma haber hecho jailbreak a Fable 5, lo que realmente está afirmando es que el público puede alcanzar una capacidad ciberofensiva de grado Mythos sin la evaluación de Project Glasswing. Si es cierto, eso colapsa toda la arquitectura de seguridad de dos niveles. La defensa de Anthropic es que los jailbreaks revelados son “respuestas completamente benignas o hallazgos menores que no proporcionan ninguna mejora específica de Mythos”. El gobierno, al parecer, no se quedó tranquilo.

Anthropic pidió este poder dos días antes

Aquí está la parte que se enseñará en los cursos de políticas. El 10 de junio, dos días antes de que llegara la directiva, Anthropic publicó un marco de políticas en el que argumentaba que el gobierno de EE. UU. debería tener nuevos poderes legales sobre la IA de frontera. La propuesta es explícita: cuando un modelo representa un riesgo catastrófico, “el gobierno debería tener la autoridad legal para bloquear o disuadir su implementación”, respaldado por sanciones civiles vinculadas a los ingresos anuales globales. El marco se aplicaría a modelos entrenados con más de 10²⁵ operaciones de punto flotante (FLOP, el recuento bruto de pasos aritméticos utilizados en el entrenamiento) y creados por empresas que obtengan más de 500 millones de dólares en ingresos relacionados con la IA o gasten más de 1.000 millones de dólares en investigación y desarrollo de IA. Esos umbrales están diseñados para capturar exactamente la clase de modelo a la que pertenece Fable 5.

El mismo ensayo advirtió sobre el modo de falla. Anthropic escribió que los formuladores de políticas “también deben evitar un poder regulatorio demasiado amplio o de mano dura” y propuso salvaguardas concretas para evitar que se abuse de la autoridad de bloqueo.

Dos días después, el gobierno bloqueó la implementación de Anthropic. No a través del proceso estatutario que propuso la empresa, con evaluadores independientes, pruebas publicadas y protecciones procesales, sino a través de una carta de control de exportaciones con evidencia entregada verbalmente. La declaración de Anthropic aborda este dilema con visible incomodidad: la empresa reafirma que el gobierno debería poder bloquear implementaciones inseguras “como parte de un proceso estatutario que sea transparente, justo, claro y basado en hechos técnicos”, y luego asesta el golpe: “Esta acción no se adhiere a esos principios”.

Para ser precisos sobre lo que esto no es: no hay evidencia pública de que la directiva fuera una respuesta al ensayo de Anthropic, y leerlo como un castigo deliberado requiere suposiciones que nadie puede respaldar actualmente. La explicación aburrida es que un gobierno que ya estaba en guerra con esta empresa recibió un informe de jailbreak sobre un modelo de frontera nuevo y recurrió a la herramienta más roma del cajón. Pero la yuxtaposición se sostiene solo en las fechas verificadas. Anthropic pidió un interruptor de apagado con debido proceso el miércoles. El viernes descubrió que el gobierno ya tenía uno, y que el debido proceso era opcional.

Cuatro meses de guerra abierta

Nada de esto sucedió en el vacío. La directiva es la última ronda de un conflicto que este sitio ha seguido desde febrero, cuando la empresa se negó a permitir que Claude se utilizara para la vigilancia masiva de estadounidenses o para guiar armas autónomas y el Departamento de Defensa respondió declarando a Anthropic un riesgo para la cadena de suministro para la seguridad nacional, junto con una prohibición en todo el gobierno.

El registro del mundo real de esa lucha es público. A principios de marzo, Nextgov informó que las agencias federales habían comenzado a deshacerse de los contratos de Anthropic tras el llamado del presidente Trump a las agencias para que detuvieran las operaciones con productos de Anthropic, y el Tesoro confirmó que dejaría de usar la tecnología de Anthropic y el Departamento de Estado y el Departamento de Salud y Servicios Humanos (HHS) tomaron medidas para eliminar gradualmente las herramientas de la empresa de sus flujos de trabajo. Luego intervinieron los tribunales. El 26 de marzo de 2026, el Tribunal de Distrito de los EE. UU. para el Distrito Norte de California emitió una orden judicial preliminar que detuvo la implementación de la directiva del presidente, y para el 3 de abril la Administración de Servicios Generales (GSA) anunció que estaba “restaurando la tecnología de Anthropic al statu quo vigente antes del 27 de febrero de 2026”.

Anthropic, en otras palabras, estaba ganando la pelea de los contratos en los tribunales. La directiva de control de exportaciones abre un segundo frente que la orden judicial no cubre, dirigido no a las compras gubernamentales de Claude sino al propio buque insignia comercial de Anthropic. Si eso es coincidencia o estrategia es exactamente la pregunta que la administración no ha respondido; no ha publicado nada.

Los datos

El cronograma verificado se comprime en una semana brutal:

Fecha (2026)Evento
9 de junioLanzamiento de Fable 5 y Mythos 5; Anthropic dice que las capacidades de Fable superan a las de cualquier modelo que haya puesto a disposición del público
10 de junioAnthropic publica su marco solicitando autoridad gubernamental para bloquear implementaciones peligrosas de IA
12 de junio (durante el día)TechTimes informa sobre afirmaciones públicas de jailbreak por parte del red-teamer Pliny the Liberator
12 de junio, 5:21 p. m. ETLlega la directiva de control de exportaciones; Anthropic desactiva ambos modelos

La economía de lo que acaba de apagarse es igualmente concreta. Fable 5 y Mythos 5 tenían un precio de 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida, lo que según Anthropic es “menos de la mitad del precio de Claude Mythos Preview”, el predecesor por invitación. Esa sola frase permite limitar lo que costaba la capacidad de frontera antes de la semana pasada:

PMythosPreview>2×PFable5    PMythosPreview>20 (entrada)  /  100 (salida)P_{\text{MythosPreview}} > 2 \times P_{\text{Fable5}} \;\Rightarrow\; P_{\text{MythosPreview}} > 20 \text{ (entrada)} \;/\; 100 \text{ (salida)}

en dólares por millón de tokens. El lanzamiento redujo el precio del modelo de ciberseguridad más fuerte del mundo a más de la mitad y lo abrió, de forma empaquetada, a cualquier persona con una cuenta de Claude. Tres días después, el propio empaque se convirtió en una cuestión de seguridad nacional.

Qué se rompe a continuación

El precedente es la historia ahora, y corta en todas las direcciones.

Para los laboratorios de frontera, el cálculo de implementación acaba de cambiar. La propia advertencia de Anthropic es la versión más aguda: si un “jailbreak potencial estrecho” es motivo de retirada, ese estándar “básicamente detendría todas las nuevas implementaciones de modelos para todos los proveedores de modelos de frontera”. Todos los asesores de laboratorios en San Francisco leyeron esa carta esta noche y comenzaron a redactar planes de contingencia para una carta propia a las 5:21 p. m.

Para las empresas, la lección es más fea. Las empresas que trasladaron las cargas de trabajo de producción a Fable 5 perdieron un modelo recomendado por el proveedor de la noche a la mañana, sin culpa del tiempo de actividad del proveedor. Espere cláusulas de suspensión de modelos en los contratos de IA empresarial, más arquitecturas multimodelo y una prima silenciosa en los modelos que han sobrevivido en el mercado durante años en lugar de días. Anthropic dice que está tratando la situación como “un malentendido” y trabajando para restaurar el acceso, con más detalles técnicos prometidos dentro de las 24 horas de su declaración. Hasta entonces, todos los demás modelos de Anthropic siguen disponibles.

Para la lucha política, la ironía se solidificará en argumento. Los defensores de la supervisión estatutaria de la IA, Anthropic entre ellos, tienen ahora una demostración en vivo de cómo se ve el poder de bloqueo sin las salvaguardas que propusieron: sin evidencia publicada, sin evaluación independiente, sin un camino claro de apelación. Los opositores a cualquier papel del gobierno utilizarán el mismo episodio como prueba de que no se puede confiar en ese poder en absoluto. Ambas partes argumentan a partir de los mismos tres días.

Conclusión

Elimine los nombres de las marcas y la semana se ve así: una empresa envió un modelo de IA de frontera, le pidió al gobierno que regulara modelos como este a través de un proceso legal transparente y luego fue cerrada por uno opaco, con evidencia que nadie fuera de un pequeño círculo ha visto, por una capacidad que según ella ya ofrecen los modelos de la competencia.

El gobierno puede saber algo que el público no. Eso es genuinamente posible, y el escenario de evidencia clasificada es el caso más sólido para la directiva. Pero un poder estatal que retira tecnología comercial sobre evidencia no publicada, entregada verbalmente, sin un marco estatutario detrás, no es un régimen de seguridad. Es discreción. Y la discreción ejercida contra una empresa a la que la administración ha pasado cuatro meses castigando públicamente merece exactamente cero beneficio de la duda hasta que la evidencia esté sobre la mesa. El camino de salida es el que casi todos en esta historia ya afirman querer: poner el interruptor de apagado en la ley, con evidencia publicada y revisión independiente, de modo que la próxima carta de las 5:21 p. m. tenga que mostrar su trabajo.

Fuentes (9)

Advertisement

🦋 Discusión en Bluesky

Discutir en Bluesky

Buscando publicaciones...