Link copiado!

Quanto mais barata a IA fica, maior é a sua fatura

Os preços de IA por token despencaram mais de 280 vezes em cerca de dois anos, mas as faturas de IA continuam subindo. As cargas de trabalho de agentes multiplicaram o consumo, o GitHub mudou o Copilot para cobrança baseada em uso e a Anthropic pausou sua própria reprecificação no último minuto. Aqui está a matemática por trás do paradoxo.

🌐
Tradução automática

Este artigo foi traduzido automaticamente do original em inglês. Ler o original em inglês

Uma contadora serena admira uma única moeda de um centavo em sua mesa de escritório enquanto uma onda gigante de tsunami de moedas se curva sobre ela, prestes a desabar

Principais conclusões

  • A deflação é real: a consulta de um modelo de Inteligência Artificial (IA) no nível de desempenho GPT-3,5 caiu de $20,00 para $0,07 por milhão de tokens entre novembro de 2022 e outubro de 2024, um colapso de mais de 280 vezes.
  • As contas subiram de qualquer maneira: 98% das organizações pesquisadas pela FinOps Foundation agora gerenciam ativamente os gastos com IA, contra 31% há apenas dois anos.
  • Junho de 2026 foi o mês em que a taxa fixa morreu: o GitHub mudou todos os planos do Copilot para faturamento medido e baseado em token em 1º de junho. A Anthropic anunciou uma divisão semelhante e a pausou em 15 de junho, dia em que deveria entrar em vigor.
  • O culpado é o volume, não o preço: cargas de trabalho de agente consomem muito mais tokens por tarefa do que uma consulta de chat. Unidades mais baratas multiplicadas pela explosão do consumo equivalem a uma fatura maior. Esse é o paradoxo de Jevons, executado em escala de data center.

O mês em que o plano de $20 parou de fazer sentido

Durante três anos, o acordo foi simples: entregar a um fornecedor de IA uma taxa mensal fixa e usar o modelo como um buffet livre. Em junho de 2026 o buffet fechou.

Advertisement

Em 1º de junho, o GitHub substituiu as “solicitações premium” do Copilot por GitHub AI Credits em todos os planos, com uso consumido “com base no uso de token, incluindo entrada, saída e tokens em cache, de acordo com as taxas de API publicadas para cada modelo”. Duas semanas depois, a Anthropic estava programada para lançar sua própria versão: transferindo o uso do Claude Agent SDK (Software Development Kit) e de agentes terceirizados de pools de assinaturas para créditos mensais separados, variando de $20 no plano Pro até $200 no nível superior. Isso nunca aconteceu. Em 15 de junho, dia em que a mudança deveria entrar em vigor, a Anthropic a pausou, dizendo “Nada muda por enquanto” e que estava “trabalhando para alinhar melhor o plano com os padrões reais de uso”.

Aqui está o que torna essa onda de reprecificação genuinamente estranha: ela chegou no exato momento em que os tokens de IA se tornaram os mais baratos de todos os tempos. Compreender por que ambas as coisas são verdadeiras ao mesmo tempo explica para onde realmente está indo seu projeto de lei de IA.

A Grande Deflação é Real

Comece com o lado da história dos fornecedores. Tem a vantagem de ser verdade.

O Índice de IA de Stanford, a contabilidade anual mais citada do progresso da IA, descobriu que o custo de consultar um modelo com pontuação equivalente a GPT-3,5 no MMLU (Massive Multitask Language Understanding, um benchmark de conhecimento padrão) “caiu de $20,00 por milhão de tokens em novembro de 2022 para apenas $0,07 por milhão de tokens em outubro de 2024”, uma redução de mais de 280 vezes em aproximadamente 18 meses. Dependendo da tarefa, o mesmo relatório concluiu que os preços de inferência caíram entre 9 e 900 vezes por ano. Por baixo do software, os custos de hardware de aprendizagem automática caíram cerca de 30% ao ano, enquanto a eficiência energética melhorou cerca de 40% anualmente.

Advertisement

Um colapso de preços dessa magnitude deveria tornar os orçamentos de IA um erro de arredondamento. Em vez disso, aconteceu o oposto.

A explosão do consumo

A Fundação FinOps, o órgão da indústria para operações financeiras em nuvem (FinOps), descobriu em seu relatório State of FinOps 2026 que 98% das organizações agora gerenciam gastos com IA, com base nos 693 profissionais que responderam a essa pergunta, acima dos 63% em 2025 e 31% em 2024. O gerenciamento de custos de IA foi classificado como o conjunto de habilidades número um que as equipes precisam desenvolver. Você não constrói toda uma disciplina em torno de um custo que está diminuindo.

O que mudou não foi o preço de um token. É quantos tokens um único trabalho consome.

Uma troca de chatbot da era de 2023 era um pedido: uma pergunta, uma resposta, alguns milhares de tokens de ponta a ponta. Uma sessão de codificação de agente é algo totalmente diferente. O agente lê seu repositório, planeja, chama ferramentas, lê sua saída, falha, tenta novamente e verifica seu próprio trabalho. Cada uma dessas etapas é uma nova chamada de modelo que carrega o contexto acumulado de tudo antes dela. Um preenchimento automático de quatro segundos e um refator autônomo de quarenta e cinco minutos ficam em extremidades opostas de uma lacuna simbólica que abrange aproximadamente três ordens de magnitude.

O Gartner definiu uma data para onde isso levará. No final de junho de 2026, a empresa de pesquisa previu que os gastos com agentes de codificação de IA estão no caminho certo para ultrapassar o salário médio do desenvolvedor de software até 2028, relatando que quase um quarto dos líderes de tecnologia já gastam entre $200 e $500 por desenvolvedor por mês em tokens de codificação de IA, e cerca de 6% relatam gastar mais de $2.000 por desenvolvedor mensalmente. Quer essa previsão específica chegue ou não, a direção não está em disputa. A unidade ficou barata; a carga de trabalho ficou enorme.

Advertisement

Anatomia de uma reavaliação silenciosa

A assinatura de taxa fixa tinha o preço da era do chatbot, e a era do agente quebrou a matemática. O que se seguiu foi menos uma subida coordenada dos preços do que uma série de correcções cada vez mais incómodas.

O GitHub foi o primeiro e foi mais longe. No novo esquema Copilot, os preços dos planos permanecem os mesmos, mas cada plano agora inclui uma concessão correspondente de créditos de IA: Pro a $10 por mês inclui $10 em créditos, Business a $19 por usuário inclui $19, Enterprise a $39 inclui $39. Um crédito vale $0,01. As conclusões de código e as sugestões de Próxima Edição permanecem ilimitadas, de modo que o usuário casual de preenchimento automático não percebe nada. O usuário agente, por outro lado, agora está gastando um medidor de token executado com taxas de API (Interface de Programação de Aplicativo) publicadas.

Anthropic tentou, depois piscou. O plano teria mantido o bate-papo e a interface de linha de comando (CLI) oficial do Claude Code nos limites de assinatura padrão, ao mesmo tempo em que impediria que o Agent SDK, o comando headless claude -p e aplicativos de terceiros utilizassem esses limites, cobrando-os de acordo com as taxas de API vigentes, amortecidos por esses créditos mensais. A pausa em 15 de junho ocorreu quando o Wall Street Journal informou que a OpenAI está considerando cortes drásticos nos preços de sua própria API, o que tornaria o aumento unilateral dos preços efetivos uma medida desconfortável. Uma reavaliação que um fornecedor envia e seu rival abandona no dia do lançamento indica que a indústria ainda não encontrou o caminho.

A alavanca mais sutil é o tokenizer. A própria documentação de preços da Anthropic observa que Claude Opus 4.7 e modelos posteriores usam um tokenizer que “produz aproximadamente 30% mais tokens para o mesmo texto”. Mesmo preço de tabela, mesmo texto, mais unidades faturáveis. O site sinalizou exatamente essa dinâmica quando Opus 4.7 foi lançado com preço inalterado.

E os próprios preços de tabela pararam silenciosamente de cair na fronteira. A planilha de preços da Anthropic mostra Claude Sonnet 5 com um valor introdutório de $2 por milhão de tokens de entrada e $10 por milhão de tokens de saída até 31 de agosto de 2026, após o qual o preço padrão de $3 e $15 entra em vigor, um aumento programado de 50%. O novo Claude Fable 5 de primeira linha lista $10 de entrada e $50 de saída, o dobro dos $5 e $25 de Claude Opus 4.8. Até mesmo o nível do orçamento subiu: Claude Haiku 4.5 lista $1 e $5, acima dos $0,80 e $4 do Haiku 3.5 aposentado que ele substituiu. Nesta tabela de preços, cada nível está sendo reavaliado para cima. A deflação que permanece reside na concorrência, em rivais mais baratos e modelos de peso aberto, e não nos preços de tabela do operador histórico.

Os dados

Todo o paradoxo cabe em uma linha de aritmética. O custo de uma tarefa é o preço de um token vezes o número de tokens que a tarefa consome:

Ctask=Ptoken×TtaskC_{task} = P_{token} \times T_{task}

Entre 2022 e 2024, PtokenP_{token} caiu cerca de 280 vezes para qualidade constante. Mas para as cargas de trabalho que agora dominam, TtaskT_{task} cresceu por um fator de centenas a milhares. Quando o segundo fator cresce mais rápido do que o primeiro diminui, CtaskC_{task} aumenta mesmo que cada token individual fique mais barato.

Execute os números do novo plano Copilot para ver a rapidez com que um medidor drena. Faça uma sessão de agente em um modelo de fronteira com preço igual ao de Claude Opus 4.8, a $5 por milhão de tokens de entrada e $25 por milhão de tokens de saída. Uma sessão que processa 1,5 milhão de tokens de entrada e gera 100.000 tokens de saída custa exatamente $10,00 nessas taxas:

Item de linhaVolumeTaxa (por M tokens)Custo
Tokens de entrada1.500.000$5$7,50
Tokens de saída100.000$25$2,50
Total da sessão$10,00

Duas sessões como essa e uma vaga no Copilot Business consumiram todo o seu limite de crédito mensal de US$ 19. Tudo depois disso é medido em excesso. A taxa fixa não ficou mais cara. Simplesmente parou de cobrir a maneira como as pessoas realmente trabalham agora.

O piso falso

Então, quem é o vilão aqui? Escolha sua teoria.

Uma leitura é cínica: as taxas fixas foram apropriações de terras subsidiadas e Junho foi a recuperação, o momento em que o piso subsidiado começou a quebrar. A outra leitura é chata: ninguém precisou planejar nada. Uma taxa fixa barata aplicada a uma carga de trabalho que pode consumir centenas de dólares de computação com taxas de API é uma aritmética que falha por si só, sem necessidade de malícia.

A evidência favorece a leitura enfadonha, com um toque especial. Isto não é um aperto na oferta. Na mesma semana em que a pausa da Anthropic se instalou, a Reuters informou que a Meta planeja vender seu excesso de capacidade de computação de IA por meio de um negócio em nuvem, de acordo com a Bloomberg News. A capacidade não é escassa; o consumo em escala fronteiriça está ultrapassando os modelos de preços criados para chat.

E os clientes têm para onde ir. A Reuters informou em 2 de julho que um novo e barato modelo chinês de IA está alcançando as ofertas de fronteira da Anthropic e OpenAI. Tom’s Hardware documentou empresas transferindo cargas de trabalho para modelos chineses e de peso aberto especificamente para esticar os orçamentos de IA à medida que as assinaturas atingem um limite de preços. Cada fatura medida é um anúncio do modelo mais barato, a uma chamada de API de distância. Isso, mais do que a boa vontade do cliente, é a verificação de até onde pode ir a reavaliação.

A rima de 1865

Nada disso é novo. Em 1865, o economista William Stanley Jevons observou que à medida que a tecnologia de queima de carvão se tornava mais eficiente, o consumo total de carvão na Grã-Bretanha aumentava em vez de diminuir, porque a eficiência tornou a indústria movida a carvão económica em muito mais locais. Unidades mais baratas, mais queima total. Troque carvão por tokens e a indústria de IA estará realizando o mesmo experimento com o mesmo resultado.

A rima mais próxima é fibra. No final da década de 1990, as operadoras de telecomunicações contraíram empréstimos enormes para desenvolver capacidade que cresceu muito mais rapidamente do que a procura, e quando o financiamento secou após o rebentamento da bolha das pontocom, as suas dívidas provocaram uma onda de falências que derrubou gigantes como a WorldCom e a Global Crossing. A lição daquela época não é que a procura era falsa. A demanda continuou crescendo; simplesmente cresceu mais lentamente do que a infra-estrutura e os modelos de negócio construídos para a servir, e a correcção chegou de uma só vez. A economia da geração de vídeos com IA já atingiu esse obstáculo; agentes de texto estão atacando em câmera lenta.

O que acontece a seguir

A trajetória de curto prazo é visível nos destroços de junho.

Medição de spreads. O GitHub já mostrou que a versão politicamente viável é “preço do plano inalterado, uso do agente medido”, e a pausa na Anthropic parece uma revisão, não um recuo; a empresa disse que está realinhando o plano, não o abandonando. Assista ao dia 1º de setembro, quando o aumento programado de 50% no preço de tabela do Sonnet 5 entrará em vigor e testará se os preços intermediários podem realmente subir sem perder cargas de trabalho para alternativas de peso aberto.

Espere que a camada de roteamento se torne um campo de batalha interessante. As empresas já estão a combinar modelos de fronteira com alternativas que custam cerca de dez vezes menos para o trabalho de rotina. Depois que cada token é medido, enviar a maioria fácil das solicitações pelo caminho barato deixa de ser uma otimização e passa a ser o jogo inteiro. E espere que “token FinOps” se torne um cargo. Quando 98% das organizações gerenciam gastos com IA e a principal lacuna de habilidades é o gerenciamento de custos de IA, alguém está sendo contratado para possuir o medidor.

O que isso significa para você

Se você escreve código com ferramentas de IA:

  • Verifique quais das suas ferramentas passaram para o faturamento medido em junho. A camada de preenchimento automático ainda é efetivamente plana; a camada do agente não é.
  • Combine o modelo com a tarefa. Executar um modelo de fronteira no trabalho que um modelo barato realiza agora é um item de linha visível, e a diferença de preço entre os níveis é uma ordem de magnitude.

Se você possui um orçamento de IA:

  • Previsão de tokens por tarefa, não de assentos. O orçamento baseado em assentos é como aconteceram os excedentes de 2026.
  • Trate os preços de tabela do fornecedor como o início da matemática, não como a resposta. As mudanças no tokenizador e o crescimento do consumo movimentam os custos reais, mesmo quando a tabela de preços não o faz.

Perguntas frequentes

Se os preços dos tokens continuarem caindo, isso não será resolvido?

Os preços unitários provavelmente continuarão a cair; Os dados de Stanford mostram quedas de 9 a 900 vezes por ano, dependendo da tarefa. Mas o consumo por tarefa cresceu mais rapidamente do que a queda dos preços e os agentes continuam a ficar mais autónomos. Apostar o seu orçamento na deflação que ultrapassa o seu próprio uso tem sido uma aposta perdida durante dois anos consecutivos.

A Anthropic cancelou a alteração no faturamento ou apenas adiou?

Pausado, não cancelado. A empresa disse “Nada muda por enquanto” e que está trabalhando para realinhar o plano com os padrões reais de uso. A pressão estrutural que produziu a mudança não desapareceu.

Isso é apenas uma manipulação de preços dos fornecedores de IA?

A evidência aponta para o outro lado. A facturação medida a taxas API publicadas é mais transparente do que uma taxa fixa que subsidiava discretamente os utilizadores pesados, e a concorrência de modelos chineses baratos e de peso aberto limita até onde qualquer um pode ir. A verdadeira história é que a unidade de preço (um mês de acesso) não correspondia mais à unidade de custo (um token) e a incompatibilidade finalmente foi quebrada.

O resultado final

A era dos tokens baratos e a era das notas gigantes de IA são a mesma história contada em extremos opostos da fatura. A deflação tornou a inteligência suficientemente barata para ser gasta de forma imprudente, os agentes industrializaram os gastos e a subscrição fixa que escondia o contador morreu de aritmética em Junho de 2026. A correcção agora em curso é desconfortável mas honesta: medidores visíveis, preços reais e um mercado onde o custo de uma tarefa finalmente lhe diz a verdade sobre o que foi necessário para ser executada. Orçamentos baseados nessa verdade funcionarão bem. Orçamentos construídos com base no buffet aberto, não.

Fontes (13)

Advertisement

🦋 Discussão no Bluesky

Discutir no Bluesky

Procurando publicações...