링크가 복사되었습니다!

AI가 저렴해질수록 청구서는 더 커진다

토큰당 AI 가격은 약 2년 만에 280분의 1 이하로 폭락했지만, AI 청구서는 계속해서 치솟고 있습니다. 에이전트 기반 워크로드가 소비를 배가시켰고, GitHub은 Copilot을 사용량 기반 요금제로 전환했으며, Anthropic은 마지막 순간에 가격 개편을 일시 중단했습니다. 이 역설 뒤에 숨겨진 수학적 원리를 설명합니다.

🌐
기계 번역

이 기사는 영어 원문에서 자동 번역되었습니다. 영어 원문 읽기

사무실 책상에서 단 하나의 페니 동전을 평온하게 바라보고 있는 회계사와 그녀의 위로 덮치기 직전인 거대한 페니 동전 쓰나미 파도

핵심 요점

  • 물가 하락은 현실이다: 2022년 11월부터 2024년 10월 사이에 GPT-3.5 수준의 인공지능(AI) 모델을 쿼리하는 비용이 백만 토큰당 $20.00에서 $0.07로 하락했으며, 이는 280배 이상의 폭락이다.
  • 청구서는 더 올랐다: FinOps Foundation이 조사한 조직의 98%가 이제 AI 지출을 적극적으로 관리하고 있으며, 이는 2년 전 31%에서 크게 상승했다.
  • 2026년 6월은 정액제가 소멸한 달이다: GitHub는 6월 1일에 모든 Copilot 플랜을 토큰 기반 종량제 청구로 전환했다. Anthropic도 유사한 분할을 발표했으나 시행 예정일인 6월 15일에 일시 중단했다.
  • 문제는 가격이 아니라 수량이다: 에이전트 기반 워크로드는 채팅 쿼리보다 작업당 훨씬 더 많은 토큰을 소비한다. 저렴한 단가에 급증하는 소비를 곱하면 더 큰 청구서가 나온다. 이것이 데이터센터 규모에서 실행되는 제본스의 역설이다.

$20 플랜이 의미를 잃은 달

3년 동안 거래 구조는 간단했다. AI 벤더에게 정액 월요금을 지불하고 모델을 뷔페처럼 무제한으로 사용하는 것이었다. 2026년 6월, 그 뷔페가 문을 닫았다.

6월 1일, GitHub는 모든 플랜에서 Copilot의 “프리미엄 요청”을 GitHub AI 크레딧으로 대체했으며, 사용량은 “각 모델의 게시된 API 요금에 따라 입력, 출력 및 캐시된 토큰을 포함한 토큰 사용량 기준”으로 계산된다. 2주 뒤, Anthropic은 자체 버전을 추진할 예정이었다. Claude Agent SDK(소프트웨어 개발 키트)와 제3자 에이전트 사용을 구독 풀에서 제거하고 월별 크레딧(Pro 플랜에서 $20에서 최상위 플랜의 $200까지)로 이전하는 것이었다. 하지만 그 일은 일어나지 않았다. 6월 15일, 변경이 시행되기로 예정된 날, Anthropic은 “지금은 변경되지 않는다”고 하면서 일시 중단했으며, “플랜을 실제 사용 패턴에 더 잘 맞추기 위해 작업 중”이라고 했다.

Advertisement

이 요금 개편 물결이 정말 이상한 이유는 AI 토큰이 사상 최저 가격에 도달한 바로 그 순간에 도래했기 때문이다. 두 가지가 동시에 사실인 이유를 이해하면 AI 청구서가 실제로 어디로 향하는지 알 수 있다.

큰 물가 하락은 현실이다

벤더 입장에서의 이야기부터 시작하자. 이 이야기는 사실이라는 장점이 있다.

Stanford AI Index, 가장 많이 인용되는 연간 AI 진전 보고서에 따르면 MMLU(대규모 멀티태스크 언어 이해 벤치마크)에서 GPT-3.5에 해당하는 수준의 모델을 쿼리하는 비용이 “2022년 11월 백만 토큰당 $20.00에서 2024년 10월 백만 토큰당 $0.07로 하락했으며”, 이는 약 18개월 동안 280배 이상의 감소이다. 작업에 따라 동일 보고서는 추론 가격이 연간 9배에서 900배 사이로 하락했음을 발견했다. 소프트웨어 아래에서 머신러닝 하드웨어 비용은 연간 약 30% 하락했으며 에너지 효율은 매년 약 40% 개선되었다.

이 정도 규모의 가격 붕괴는 AI 예산을 오차 범위 정도로 만들어야 한다. 대신 정반대가 일어났다.

소비 폭발

클라우드 금융운영(FinOps) 산업 기구인 FinOps Foundation은 2026년 FinOps 현황 보고서에서 조사에 응한 693명의 실무자를 바탕으로 조직의 98%가 이제 AI 지출을 관리한다고 발견했으며, 이는 2025년의 63%와 2024년의 31%에서 상승했다. AI 비용 관리가 팀이 개발해야 할 1순위 기술로 평가되었다. 축소되는 비용 주위에 전체 학문 분야를 구축하지는 않는다.

변한 것은 토큰의 가격이 아니다. 업무 1건이 소비하는 토큰의 양이다.

2023년대 채봇 교환은 1건의 요청이었다. 질문이 들어오면 답변이 나가고, 처음부터 끝까지 수천 개의 토큰이다. 에이전트 기반 코딩 세션은 완전히 다른 동물이다. 에이전트는 저장소를 읽고, 계획을 세우고, 도구를 호출하고, 그 출력을 읽고, 실패하고, 다시 시도하고, 자신의 작업을 검증한다. 이러한 각 단계는 이전의 모든 것의 누적 문맥을 담은 신선한 모델 호출이다. 4초 자동완성과 45분짜리 자동 리팩토는 약 3개 자릿수 규모에 걸쳐 있는 토큰 격차의 반대편에 위치한다.

Gartner는 이것이 이끌어갈 곳에 날짜를 붙였다. 2026년 6월 말, 조사 회사는 AI 코딩 에이전트 지출이 2028년까지 평균 소프트웨어 개발자의 급여를 초과하도록 예상하고 있으며, 기술 리더의 거의 4분의 1이 이미 개발자 1명당 월 $200~$500을 AI 코딩 토큰에 지출한다고 보고했고, 약 6%는 월별 개발자 1명당 $2,000 이상을 지출한다고 보고했다. 그 특정 예측이 정확하든 아니든, 방향은 논쟁의 여지가 없다. 단가는 싸졌고, 워크로드는 거대해졌다.

Advertisement

조용한 요금 개편의 해부

정액 구독은 채봇 시대를 기준으로 책정되었으며, 에이전트 시대는 그 수학을 깨뜨렸다. 뒤따른 것은 조정된 가격 인상이라기보다는 점점 더 어색한 수정 사항들이었다.

GitHub가 먼저 가장 멀리 나갔다. 새로운 Copilot 방식 아래에서 플랜 가격은 그대로이지만, 각 플랜에는 이제 일치하는 AI 크레딧 한도가 포함된다. Pro는 월 $10에 $10 크레딧, Business는 사용자당 $19에 $19, Enterprise는 $39에 $39이다. 1 크레딧은 $0.01의 가치가 있다. 코드 완성 및 다음 편집 제안은 계량되지 않으므로 casual 자동완성 사용자는 아무것도 알아채지 못한다. 대조적으로 에이전트 사용자는 이제 게시된 API(응용프로그래밍 인터페이스) 요금으로 실행되는 토큰 미터를 소모하고 있다.

Anthropic은 시도했다가 눈을 깜빡였다. 그 계획은 채팅 및 공식 Claude Code 명령어 인터페이스(CLI)를 표준 구독 한도로 유지하면서, Agent SDK, 헤드리스 claude -p 명령 및 제3자 앱이 해당 한도를 사용하지 못하도록 중지하고, 대신 현행 API 요금으로 청구하되, 월별 크레딧으로 완충되도록 했을 것이다. 6월 15일의 일시 중단은 Wall Street Journal이 OpenAI가 자체 API의 큰 가격 인하를 검토 중이라고 보도한 것으로 인한 것으로, 일방적으로 유효 가격을 인상하는 것은 불편한 움직임이었을 것이다. 한 벤더가 배포하고 경쟁자가 출시일에 포기한 요금 개편은 업계가 아직 바닥을 찾지 못했음을 알려준다.

더 미묘한 지렛대는 토크나이저다. Anthropic의 가격 책정 문서에 따르면 Claude Opus 4.7 이상의 모델은 “동일한 텍스트에 대해 약 30% 더 많은 토큰을 생성하는” 토크나이저를 사용한다. 동일한 정가, 동일한 텍스트, 더 많은 청구 가능 단위다. 이 사이트는 Opus 4.7이 변경되지 않은 헤드라인 가격으로 출시되었을 정확히 이 역학을 지적했다.

그리고 정가 자체는 선두에서 조용히 하락을 멈췄다. Anthropic의 가격표는 Claude Sonnet 5를 백만 입력 토큰당 입도 $2, 출도 $10의 도입가로 표시하고 있으며, 이는 2026년 8월 31일까지이고, 그 후 표준 가격 $3과 $15가 적용되며, 이는 50% 인상이 예정되어 있다. 새로운 최상위 Claude Fable 5는 입도 $10, 출도 $50으로 나열되어 있으며, 이는 Claude Opus 4.8의 $5와 $25의 2배이다. 예산 계층도 올랐다. Claude Haiku 4.5는 $1과 $5로 나열되어 있으며, 이는 대체한 은퇴 Haiku 3.5의 $0.80과 $4 이상이다. 이 하나의 가격표에서 모든 계층이 상향 조정되고 있다. 남은 물가 하락은 경쟁에, 더 저렴한 경쟁사와 오픈 가중치 모델에 살고 있으며, 현직자의 정가에는 없다.

Advertisement

데이터

전체 역설은 한 줄의 산술로 맞춘다. 작업의 비용은 토큰의 가격에 작업이 소비하는 토큰의 수를 곱한 것이다.

Ctask=Ptoken×TtaskC_{task} = P_{token} \times T_{task}

2022년과 2024년 사이에 일정한 품질의 경우 PtokenP_{token}은 약 280배 감소했다. 하지만 현재 지배적인 워크로드의 경우 TtaskT_{task}는 수백에서 수천 배 증가했다. 두 번째 인수가 첫 번째 인수의 감소보다 빠르게 증가하면, 모든 개별 토큰이 저렴해져도 CtaskC_{task}는 증가한다.

새로운 Copilot 플랜에서 미터가 얼마나 빨리 소모되는지 보려면 숫자를 실행하자. Claude Opus 4.8처럼 가격이 정해진 선두 모델에 대한 에이전트 세션을 사용하자. 백만 입력 토큰당 $5, 백만 출력 토큰당 $25이다. 150만 입력 토큰을 처리하고 10만 출력 토큰을 생성하는 세션은 이 요금으로 정확히 $10.00의 비용이 든다.

라인 항목볼륨요금(M 토큰당)비용
입력 토큰1,500,000$5$7.50
출력 토큰100,000$25$2.50
세션 합계$10.00

이런 식의 2개 세션으로 Copilot Business 좌석은 전체 월 크레딧 한도 $19을 소모했다. 그 이후 모든 것은 종량제 초과이다. 정액제가 더 비싸진 게 아니다. 이제 사람들이 실제로 일하는 방식을 충당하지 못할 뿐이다.

거짓 바닥

그렇다면 누가 악당인가? 당신의 이론을 선택하자.

한 읽기는 냉소적이다. 정액제는 보조금이 지원되는 영토 확보이고, 6월은 회수이며, 보조금이 지원되는 바닥이 부서지기 시작한 순간이다. 다른 읽기는 지루하다. 아무도 아무것도 계획할 필요가 없었다. API 요금으로 수백 달러의 계산 처리량을 소비할 수 있는 워크로드에 대해 설정된 저렴한 정액제는 악의 없이도 자체적으로 실패하는 산술이다.

증거는 지루한 읽기를 선호하며, 한 가지 반전이 있다. 이것은 공급 부족이 아니다. Anthropic의 일시 중단이 정착된 같은 주에 Reuters는 Meta가 클라우드 사업을 통해 초과 AI 계산 처리량을 판매할 계획이 있다고 보도했다. 용량은 부족하지 않다. 선두 규모 소비가 채팅 시대를 위해 구축된 가격 책정 모델을 앞질렀을 뿐이다.

고객들은 갈 곳이 있다. Reuters는 7월 2일에 새로운 저렴한 중국 AI 모델이 Anthropic과 OpenAI의 선두 제품을 따라잡고 있다고 보도했다. Tom’s Hardware는 회사들이 구독이 가격 벽에 부딪히면서 AI 예산을 늘리기 위해 중국 및 오픈 가중치 모델로 워크로드를 이동시키고 있음을 문서화했다. 모든 종량제 청구서는 한 API 호출 떨어진 더 저렴한 모델에 대한 광고다. 그것이 고객 호의보다는, 요금 개편이 얼마나 멀리 나갈 수 있는지에 대한 견제다.

1865년의 운율

이 모든 것은 새로운 게 아니다. 1865년에 경제학자 William Stanley Jevons는 석탄 연소 기술이 더 효율적으로 되면서 영국의 총 석탄 소비가 감소하지 않고 오히려 증가했음을 관찰했다. 효율성이 석탄 동력 산업을 훨씬 더 많은 장소에서 경제적으로 만들었기 때문이다. 더 저렴한 단위, 더 많은 총 소비. 석탄을 토큰으로 바꾸면 AI 산업은 동일한 실험을 동일한 결과로 실행하고 있다.

더 가까운 운율은 광섬유다. 1990년대 말, 통신 회사들은 수요보다 훨씬 빠르게 성장한 용량을 구축하기 위해 막대한 자금을 차용했고, 닷컴 버블이 터진 후 자금 조달이 마말랐을 때, 그들의 부채 부담은 WorldCom과 Global Crossing 같은 거인들을 격파한 파산 물결을 일으켰다. 그 시대의 교훈은 수요가 거짓이었다는 것이 아니다. 수요는 계속 증가했다. 이는 단순히 인프라와 그것을 서비스하도록 구축된 비즈니스 모델보다 느리게 증가했을 뿐이고, 수정은 한 번에 도래했다. AI 비디오 생성의 경제학은 이미 이 벽에 부딪혔고, 텍스트 에이전트는 천천히 부딪히고 있다.

다음은 어떻게 되나

단기 궤적은 6월의 잔해에서 보인다.

계량은 퍼져나간다. GitHub는 정치적으로 생존 가능한 버전이 “플랜 가격 변경 없음, 에이전트 사용 계량”이라는 것을 이미 보여주었고, Anthropic의 일시 중단은 후퇴가 아니라 수정으로 읽힌다. 회사는 플랜을 포기하지 않고 재정렬하고 있다고 했다. 9월 1일을 주시하자. Sonnet 5의 예정된 50% 정가 인상이 발효되고 중상층 가격이 오픈 가중치 대체재로의 워크로드 손실 없이 실제로 상승할 수 있는지 테스트한다.

라우팅 계층이 흥미로운 전쟁터가 될 것으로 예상한다. 회사들은 이미 일상적인 작업을 위해 비용이 대략 10배 저렴한 대체재와 함께 선두 모델을 쌍으로 묶고 있다. 모든 토큰이 계량되면, 요청의 쉬운 다수를 저렴한 경로로 라우팅하는 것은 최적화가 아닌 전체 게임이 된다. 그리고 “토큰 FinOps”가 직책이 될 것으로 예상한다. 조직의 98%가 AI 지출을 관리하고 있으며 1순위 기술 격차가 AI 비용 관리일 때, 누군가는 미터를 소유하기 위해 고용되고 있다.

이것이 당신을 위해 의미하는 것

AI 도구로 코드를 작성하면:

  • 6월에 종량제 청구로 이동한 도구를 확인하자. 자동완성 계층은 여전히 실질적으로 정액이지만, 에이전트 계층은 아니다.
  • 모델을 작업과 맞추자. 저렴한 모델이 처리할 수 있는 작업에서 선두 모델을 실행하는 것은 이제 눈에 띄는 라인 항목이며, 계층 간 가격 격차는 한 자리 수 규모이다.

AI 예산을 소유하면:

  • 좌석이 아닌 작업당 토큰으로 예측하자. 좌석 기반 예산이 2026년 초과의 원인이었다.
  • 벤더 정가를 수학의 답이 아니라 시작점으로 생각하자. 토크나이저 변경 및 소비 성장은 가격표가 변경되지 않아도 실제 비용을 움직인다.

자주 묻는 질문

토큰 가격이 계속 하락하면 이것이 해결되지 않을까?

단가는 아마도 계속 하락할 것이다. Stanford의 데이터는 작업에 따라 연간 9배에서 900배 사이의 감소를 보여준다. 하지만 작업당 소비는 가격이 하락한 것보다 빠르게 성장했으며, 에이전트는 여전히 더 자율적이 되고 있다. 당신의 예산을 물가 하락이 당신 자신의 사용을 앞서간다는 것에 내기는 2년 연속으로 손실 베팅이었다.

Anthropic이 청구 변경을 취소했나 아니면 연기했나?

일시 중단, 취소 아님. 회사는 “지금은 변경되지 않는다”고 말했고 플랜을 실제 사용 패턴에 재정렬하기 위해 작업 중이라고 했다. 변경을 만든 구조적 압력은 사라지지 않았다.

이것은 단지 AI 벤더의 가격 담합일까?

증거는 다른 쪽을 가리킨다. 게시된 API 요금의 종량제 청구는 정액제보다 더 투명하며, 저렴한 중국 및 오픈 가중치 모델의 경쟁은 누구도 얼마나 멀리 밀어붙일 수 있는지 제한한다. 진짜 이야기는 가격의 단위(한 달의 액세스)가 더 이상 비용의 단위(토큰)와 일치하지 않았고, 불일치가 마침내 깨졌다는 것이다.

결론

저렴한 토큰의 시대와 거대한 AI 청구서의 시대는 청구서의 반대편에서 말한 같은 이야기다. 물가 하락은 지능을 무분별하게 지출할 수 있을 정도로 저렴하게 만들었고, 에이전트는 지출을 산업화했으며, 미터를 숨긴 정액 구독은 2026년 6월 산술로 소멸했다. 지금 진행 중인 수정은 불편하지만 정직하다. 눈에 띄는 미터, 실제 가격, 그리고 작업 비용이 마침내 그것을 실행하는 데 무엇이 들었는지 당신에게 알려주는 시장. 그 진실 위에 구축된 예산은 잘할 것이다. 뷔페가 열려 있다는 것에 구축된 예산은 그렇지 않을 것이다.

출처 (13)

Advertisement

🦋 Bluesky 토론

Bluesky에서 토론하기

게시물 검색 중...