Conclusiones clave
- La deflación es real: la consulta de un modelo de Inteligencia Artificial (IA) con un rendimiento de nivel GPT-3,5 cayó de $20,00 a $0,07 por millón de tokens entre noviembre de 2022 y octubre de 2024, un colapso de más de 280 veces.
- Las facturas subieron de todos modos: el 98% de las organizaciones encuestadas por la Fundación FinOps ahora gestionan activamente el gasto en IA, frente al 31% hace apenas dos años.
- Junio de 2026 fue el mes en que murió la tarifa fija: GitHub trasladó todos los planes de Copilot a facturación medida basada en tokens el 1 de junio. Anthropic anunció una división similar y luego la pausó el 15 de junio, el día en que debía entrar en vigor.
- El culpable es el volumen, no el precio: las cargas de trabajo de agentes consumen órdenes de magnitud más tokens por tarea que una consulta de chat. Unidades más baratas multiplicadas por un consumo explosivo equivalen a una factura mayor. Ésa es la paradoja de Jevons: funcionar a escala de centro de datos.
El mes en que el plan $20 dejó de tener sentido
Durante tres años, el trato fue simple: entregarle a un proveedor de IA una tarifa mensual fija y usar el modelo como un buffet libre. En junio de 2026 cerró el buffet.
El 1 de junio, GitHub reemplazó las “solicitudes premium” de Copilot con créditos de GitHub AI en todos los planes, con un consumo consumido “basado en el uso de tokens, incluidos los tokens de entrada, salida y caché, de acuerdo con las tarifas de API publicadas para cada modelo”. Dos semanas después, Anthropic estaba programado para impulsar su propia versión: trasladar el SDK (kit de desarrollo de software) de Claude Agent y el uso de agentes de terceros de los grupos de suscripción a créditos mensuales separados, que van desde $20 en el plan Pro hasta $200 en el nivel superior. Nunca sucedió. El 15 de junio, el día en que el cambio debía entrar en vigor, Anthropic lo detuvo y dijo: “Nada cambia por ahora” y que estaba “trabajando para alinear mejor el plan con los patrones de uso reales”.
Esto es lo que hace que esta ola de cambios de precios sea realmente extraña: llegó en el momento exacto en que los tokens de IA se volvieron más baratos que nunca. Comprender por qué ambas cosas son ciertas al mismo tiempo explica hacia dónde se dirige realmente su factura de IA.
La gran deflación es real
Comience con el lado de la historia de los proveedores. Tiene la ventaja de ser verdad.
El Índice de IA de Stanford, la contabilidad anual más citada sobre el progreso de la IA, encontró que el costo de consultar un modelo que obtiene una puntuación equivalente a GPT-3.5 en MMLU (Comprensión masiva del lenguaje multitarea, un punto de referencia de conocimiento estándar) “cayó de 20 dólares por millón de tokens en noviembre de 2022 a solo 0,07 dólares por millón de tokens en octubre de 2024”, una reducción de más de 280 veces en aproximadamente 18 años. meses. Dependiendo de la tarea, el mismo informe encontró que los precios de inferencia han caído entre 9 y 900 veces por año. Además del software, los costos del hardware de aprendizaje automático han caído alrededor de un 30% anual, mientras que la eficiencia energética mejoró aproximadamente un 40% anual.
Un colapso de precios de esa magnitud debería convertir los presupuestos de IA en un error de redondeo. En cambio, sucedió lo contrario.
La explosión del consumo
La Fundación FinOps, el organismo industrial para las operaciones financieras en la nube (FinOps), encontró en su informe Estado de FinOps 2026 que el 98% de las organizaciones ahora administran el gasto en IA, según los 693 profesionales que respondieron esa pregunta, en comparación con el 63% en 2025 y el 31% en 2024. La gestión de costos de IA se clasificó como el conjunto de habilidades número uno que los equipos deben desarrollar. No se construye una disciplina completa en torno a un costo que se está reduciendo.
Lo que cambió no es el precio de un token. Es la cantidad de tokens que consume una sola pieza de trabajo.
Un intercambio de chatbot de la era 2023 fue una solicitud: una pregunta entrante, una respuesta saliente, unos pocos miles de tokens de un extremo a otro. Una sesión de codificación agente es un animal completamente diferente. El agente lee su repositorio, planifica, llama a herramientas, lee su salida, falla, reintenta y verifica su propio trabajo. Cada uno de esos pasos es una nueva llamada modelo que lleva el contexto acumulado de todo lo anterior. Un autocompletado de cuatro segundos y una refactorización autónoma de cuarenta y cinco minutos se encuentran en extremos opuestos de una brecha simbólica que abarca aproximadamente tres órdenes de magnitud.
Gartner puso una fecha sobre a dónde conduce esto. A finales de junio de 2026, la firma de investigación pronosticó que el gasto en agentes de codificación de IA está en camino de superar el salario promedio de un desarrollador de software para 2028, informando que casi una cuarta parte de los líderes tecnológicos ya gastan entre $200 y $500 por desarrollador cada mes en tokens de codificación de IA, y alrededor del 6% reporta gastar más de $2000 por desarrollador mensualmente. Ya sea que ese pronóstico específico aterrice o no, la dirección no está en disputa. La unidad se volvió barata; la carga de trabajo se volvió enorme.
Anatomía de una revalorización silenciosa
La suscripción de tarifa plana tenía un precio para la era de los chatbots, y la era de los agentes rompió sus cálculos. Lo que siguió fue menos un aumento coordinado de precios que una serie de correcciones cada vez más incómodas.
GitHub fue primero y llegó más lejos. Bajo el nuevo esquema Copilot, los precios de los planes siguen siendo los mismos, pero cada plan ahora incluye una asignación equivalente de créditos de IA: Pro a $10 por mes incluye $10 en créditos, Business a $19 por usuario incluye $19, Enterprise a $39 incluye $39. Un crédito vale $0,01. Las completaciones de código y las sugerencias de próxima edición no se miden, por lo que el usuario ocasional de autocompletar no nota nada. El usuario agente, por el contrario, ahora está gastando un medidor de tokens que se ejecuta a las tarifas publicadas de API (interfaz de programación de aplicaciones).
Anthropic lo intentó, luego parpadeó. El plan habría mantenido el chat y la interfaz de línea de comandos (CLI) oficial de Claude Code en los límites de suscripción estándar, al mismo tiempo que habría impedido que el SDK del Agente, el comando claude -p sin cabeza y las aplicaciones de terceros aprovecharan esos límites, facturándolos a las tarifas API vigentes, amortiguados por esos créditos mensuales. La pausa del 15 de junio se produjo cuando el Wall Street Journal informó que OpenAI está considerando fuertes recortes de precios para su propia API, lo que habría hecho que aumentar unilateralmente los precios efectivos fuera una medida incómoda. Una revisión de precios que un proveedor envía y su rival abandona el día del lanzamiento indica que la industria aún no ha encontrado el piso.
La palanca más sutil es el tokenizador. La propia documentación de precios de Anthropic señala que Claude Opus 4.7 y modelos posteriores utilizan un tokenizador que “produce aproximadamente un 30 % más de tokens para el mismo texto”. Mismo precio de lista, mismo texto, más unidades facturables. El sitio marcó exactamente esta dinámica cuando Opus 4.7 se lanzó con el precio principal sin cambios.
Y los precios de lista en sí han dejado silenciosamente de caer en la frontera. La hoja de precios de Anthropic muestra a Claude Sonnet 5 a un precio introductorio de $2 por millón de tokens de entrada y $10 por millón de tokens de salida hasta el 31 de agosto de 2026, después del cual entra en vigor el precio estándar de $3 y $15, un aumento programado del 50%. El nuevo Claude Fable 5 de primer nivel cotiza en $10 de entrada y $50 de salida, el doble de $5 y $25 de Claude Opus 4.8. Incluso el peldaño del presupuesto subió: Claude Haiku 4.5 cotiza en $1 y $5, por encima de los $0,80 y $4 del Haiku 3.5 retirado al que reemplazó. En esta hoja de precios, cada nivel está cambiando de precio al alza. La deflación que persiste vive en la competencia, en rivales más baratos y modelos abiertos, no en los precios de lista del actual operador.
Los datos
Toda la paradoja cabe en una línea de aritmética. Lo que cuesta una tarea es el precio de un token multiplicado por la cantidad de tokens que consume la tarea:
Entre 2022 y 2024, se redujo aproximadamente 280 veces por una calidad constante. Pero para las cargas de trabajo que ahora dominan, creció entre cientos y miles. Cuando el segundo factor crece más rápido que el primero se reduce, aumenta incluso cuando cada token individual se vuelve más barato.
Ejecute los números en el nuevo plan Copilot para ver qué tan rápido se drena un medidor. Realice una sesión agente en un modelo de frontera con un precio como el de Claude Opus 4.8, a $5 por millón de tokens de entrada y $25 por millón de tokens de salida. Una sesión que procesa 1,5 millones de tokens de entrada y genera 100.000 tokens de salida cuesta exactamente $10,00 a esas tasas:
| Línea de pedido | Volumen | Tasa (por M tokens) | Costo |
|---|---|---|---|
| Fichas de entrada | 1.500.000 | $5 | $7,50 |
| Fichas de salida | 100.000 | $25 | $2,50 |
| Total de la sesión | $10,00 |
Dos sesiones como esa y un asiento Copilot Business han consumido toda su asignación de crédito mensual de $19. Todo lo que sigue se considera excedente medido. La tarifa fija no se volvió más cara. Simplemente dejó de cubrir la forma en que la gente trabaja realmente ahora.
El piso falso
Entonces ¿quién es el villano aquí? Elige tu teoría.
Una lectura es cínica: las tarifas planas fueron apropiaciones de tierras subsidiadas, y junio fue la recuperación, el momento en que el piso subsidiado comenzó a romperse. La otra lectura es aburrida: nadie necesitaba planificar nada. Una tarifa fija económica frente a una carga de trabajo que puede consumir cientos de dólares de computación a tarifas API es una aritmética que falla por sí sola, no requiere malicia.
La evidencia favorece la lectura aburrida, con un giro. Esto no es una reducción de la oferta. La misma semana que se estableció la pausa de Anthropic, Reuters informó que Meta planea vender su exceso de capacidad informática de IA a través de un negocio en la nube, según Bloomberg News. La capacidad no es escasa; El consumo a escala de frontera simplemente está superando los modelos de precios creados para el chat.
Y los clientes tienen adónde ir. Reuters informó el 2 de julio que un nuevo modelo chino de IA económico se está poniendo al día con las ofertas de vanguardia de Anthropic y OpenAI. Tom’s Hardware ha documentado que las empresas cambian las cargas de trabajo a modelos chinos y abiertos específicamente para estirar los presupuestos de IA a medida que las suscripciones se topan con un muro de precios. Cada factura medida es un anuncio del modelo más económico a una llamada API de distancia. Eso, más que la buena voluntad del cliente, es comprobar hasta dónde puede llegar la revisión de precios.
La rima de 1865
Nada de esto es nuevo. En 1865, el economista William Stanley Jevons observó que a medida que la tecnología de combustión de carbón se hacía más eficiente, el consumo total de carbón en Gran Bretaña aumentaba en lugar de disminuir, porque la eficiencia hacía que la industria impulsada por carbón fuera económica en muchos más lugares. Unidades más baratas, mayor consumo total. Cambie el carbón por tokens y la industria de la inteligencia artificial estará realizando el mismo experimento con el mismo resultado.
La rima más cercana es fibra. A finales de la década de 1990, los operadores de telecomunicaciones pidieron prestado enormes sumas de dinero para desarrollar una capacidad que creció mucho más rápido que la demanda, y cuando el financiamiento se agotó después del estallido de la burbuja de las puntocom, sus cargas de deuda provocaron una ola de quiebras que derribó a gigantes como WorldCom y Global Crossing. La lección de esa época no es que la demanda fuera falsa. La demanda siguió creciendo; simplemente creció más lentamente que la infraestructura y los modelos de negocio creados para servirle, y la corrección llegó de repente. La economía de la generación de vídeos con IA ya ha tocado este muro; Los agentes de texto lo están golpeando en cámara lenta.
¿Qué pasa después?
La trayectoria a corto plazo es visible en los restos del accidente de junio.
Spreads de medición. GitHub ya ha demostrado que la versión políticamente viable es “el precio del plan no cambia, el uso del agente se mide”, y la pausa en Anthropic se lee como una revisión, no como una retirada; La compañía dijo que está realineando el plan, no abandonándolo. Mire el 1 de septiembre, cuando el aumento programado del 50% en el precio de lista de Sonnet 5 entre en vigencia y pruebe si los precios de nivel medio realmente pueden aumentar sin perder cargas de trabajo frente a alternativas de peso abierto.
Espere que la capa de enrutamiento se convierta en un campo de batalla interesante. Las empresas ya están combinando modelos de vanguardia con alternativas que cuestan aproximadamente diez veces menos para el trabajo rutinario. Una vez que se mide cada token, enviar la mayoría de las solicitudes por el camino económico deja de ser una optimización y comienza a ser el juego completo. Y espere que “finOps simbólicos” se convierta en un título de trabajo. Cuando el 98% de las organizaciones gestionan el gasto en IA y la principal brecha de habilidades es la gestión de costos de IA, se contrata a alguien para que sea propietario del medidor.
Qué significa esto para ti
Si escribes código con herramientas de IA:
- Verifique cuáles de sus herramientas pasaron a la facturación medida en junio. El nivel de autocompletar sigue siendo efectivamente plano; el nivel de agente no lo es.
- Relacionar el modelo con la tarea. Ejecutar un modelo de frontera en el trabajo que maneja un modelo barato es ahora una línea de pedido visible, y la diferencia de precios entre niveles es de un orden de magnitud.
Si tienes un presupuesto de IA:
- Previsión de tokens por tarea, no de asientos. El presupuesto basado en escaños es la forma en que se produjeron los excesos en 2026.
- Trate los precios de lista de proveedores como el comienzo de los cálculos, no como la respuesta. Los cambios en los tokenizadores y el crecimiento del consumo mueven los costos reales incluso cuando la hoja de precios no lo hace.
Preguntas frecuentes
Si los precios de los tokens siguen cayendo, ¿no se solucionará esto solo?
Los precios unitarios probablemente seguirán cayendo; Los datos de Stanford muestran disminuciones de 9 a 900 veces por año dependiendo de la tarea. Pero el consumo por tarea ha crecido más rápido de lo que han caído los precios, y los agentes siguen volviéndose más autónomos. Apostar su presupuesto a que la deflación supere su propio consumo ha sido una apuesta perdida durante dos años consecutivos.
¿Anthropic canceló su cambio de facturación o simplemente lo retrasó?
Pausado, no cancelado. La compañía dijo que “nada cambia por ahora” y que está trabajando para realinear el plan con los patrones de uso reales. La presión estructural que produjo el cambio no desapareció.
¿Se trata simplemente de un aumento de precios por parte de los proveedores de IA?
La evidencia apunta en otra dirección. La facturación medida a las tarifas API publicadas es más transparente que una tarifa fija que silenciosamente subsidiaba a los usuarios habituales, y la competencia de modelos chinos baratos y de peso abierto limita hasta dónde puede llegar alguien. La verdadera historia es que la unidad de precio (un mes de acceso) ya no coincidía con la unidad de costo (un token), y el desajuste finalmente se rompió.
El resultado final
La era de los tokens baratos y la era de los billetes gigantes de IA son la misma historia contada desde extremos opuestos del billete. La deflación hizo que la inteligencia fuera lo suficientemente barata como para gastar imprudentemente, los agentes industrializaron el gasto y la suscripción de tarifa plana que ocultaba el medidor murió de aritmética en junio de 2026. La corrección que ahora está en marcha es incómoda pero honesta: medidores visibles, precios reales y un mercado donde el costo de una tarea finalmente dice la verdad sobre lo que se necesitaba para ejecutarla. Los presupuestos basados en esa verdad funcionarán bien. Los presupuestos basados en que el buffet permanezca abierto no lo harán.
Fuentes (13)
- hai.stanford.edu Stanford HAI - AI Index Report 2025: Research and Development
- github.blog GitHub Blog - GitHub Copilot Is Moving to Usage-Based Billing
- docs.github.com GitHub Docs - Models and Pricing for GitHub Copilot
- platform.claude.com Anthropic - Claude API Pricing Documentation
- data.finops.org FinOps Foundation - State of FinOps 2026 Report
- the-decoder.com The Decoder - Anthropic Backs Off Unpopular Billing Overhaul
- thenewstack.io The New Stack - Anthropic Pauses Claude Agent SDK Subscription Change
- reuters.com Reuters - Meta to Sell Excess AI Computing Capacity
- reuters.com Reuters - Inexpensive Chinese AI Model Catching Up
- devops.com DevOps.com - AI Coding Costs Could Exceed Developer Salaries, Gartner Warns
- tomshardware.com Tom's Hardware - AI Costs Spike as Subscriptions Hit Pricing Wall
- en.wikipedia.org Wikipedia - Jevons Paradox
- en.wikipedia.org Wikipedia - Telecoms Crash
🦋 Discusión en Bluesky
Discutir en Bluesky