링크가 복사되었습니다!

2025년 AI 파워 랭킹: OpenAI의 선두와 Google의 추격

AI 정체기는 끝났다. 2025년 12월은 역사상 가장 거대한 모델 출시를 기록했다. 이번 분석에서는 OpenAI와 Anthropic이 공동 1위를 차지한 이유와 Google의 거대한 Gemini 3 생태계가 근소한 차이로 3위에 머문 이유를 파헤친다.

🌐
기계 번역

이 기사는 영어 원문에서 자동 번역되었습니다. 영어 원문 읽기

OpenAI, Anthropic, Google AI 엔티티가 리더보드 대형으로 배치된 미래지향적인 디지털 아레나

GPT-5.1, Gemini 3, Claude Opus 4.5, GPT-5.2: 6주 만에 바뀐 AI 서열

2025년 초의 “AI가 벽에 부딪혔다”는 서사는 이제 공식적으로 끝났다. 올해 대부분의 기간 동안 업계는 애매한 정체 상태에 머물러 있었다. GPT-4.5는 2월에 별다른 반향 없이 출시됐고, 스케일링에 대한 낙관론은 약해졌으며, “AI는 거품이다”라는 말이 저녁 식사 자리에서 무난한 화제가 되었다.

그 분위기는 6주 만에 완전히 뒤집혔다.

11월 12일부터 12월 11일 사이, “빅3”는 잇달아 필살기를 꺼내 들었다. OpenAI의 GPT-5.1(11월 12일), 구글의 Gemini 3(11월 18일), 앤트로픽의 Claude Opus 4.5(11월 24일)가 차례로 등장했다. 그리고 OpenAI가 다시 한번 나섰다. GPT-5.2가 12월 11일에 등장했는데, 이는 Gemini의 상승세에 대한 내부 “코드 레드” 메모 이후 원래 12월 말로 예정됐던 출시 일정을 앞당긴 것으로 알려졌다. 먼지가 채 가라앉기도 전에 벤치마크, 그리고 더 중요한 실사용 체감 평가가 나오고 있다.

2026년 구독을 결정해야 하는 개발자, 전략가, 혹은 전문가들을 위해, 새로운 서열의 냉정한 현실을 짚어본다.

최상위권은 거의 동률이지만, 그 이유는 서로 매우 다르다.

순위: 갈린 승부

2023년 GPT-4 출시 이후 처음으로, 단일 “왕좌”는 존재하지 않는다. 대신 최전선에는 사실상 양강 구도가 형성되었고, 거대한 강자 하나가 바짝 뒤쫓고 있다.

공동 1위: OpenAI의 GPT-5.2

추론 엔진

OpenAI는 또 한 번 해냈다. 다만 대부분이 예상했던 방식은 아니었다. GPT-5.2는 단순히 “더 많이 아는” 모델이 아니다. 답변 시점의 추론 방식에서 근본적으로 다른 존재다.

Advertisement

GPT-5.2는 인스턴트(Instant), 씽킹(Thinking), 프로(Pro) 세 가지 모드로 출시되는데, 리더보드를 다시 쓰고 있는 것은 씽킹 티어다. 패턴 암기를 벌하고 진정한 규칙 유추 능력을 보상하도록 설계된 벤치마크인 ARC-AGI-2에서 GPT-5.2 씽킹은 52.9%를 기록했다. 이는 Claude Opus 4.5의 37.6%, Gemini 3 Pro의 31.1%와 대비된다. 이 모델은 AIME 2025 수학 올림피아드 문제 세트에서 완벽한 100%를 기록했으며, OpenAI의 실제 전문 지식 업무 벤치마크인 GDPval에서도 70.9%로 Gemini 3의 53.5%를 앞서며 선두를 달리고 있다.

그 지능에는 대가가 따른다. 입력 토큰 100만 개당 1.75달러, 출력 토큰 100만 개당 14달러로, GPT-5.1보다 약 40% 비싸졌으며, 프로 티어는 씽킹 티어보다 대략 한 자릿수 배 더 비싸다.

논리, 수학, 그리고 냉철한 추론 영역에서는 명실상부한 최강자다.

공동 1위: 앤트로픽의 Claude Opus 4.5

가격을 스스로 낮춘 코딩 일벌레

GPT-5.2가 차가운 논리 엔진이라면, Claude Opus 4.5는 실전 투입형 일벌레다.

여기서 중요한 숫자는 두 개다. 첫 번째는 **80.9%**로, Opus 4.5가 실제 저장소의 실제 버그를 고칠 수 있는지를 측정하는 벤치마크인 SWE-bench Verified에서 받은 점수다. GPT-5.2가 12월에 출시된 이후에도, OpenAI의 최고 모델은 같은 테스트에서 80.0%에 머물렀다. 2주 더 오래된 모델이 근소한 차이로 코딩 왕좌를 지킨 셈이다. 두 번째 숫자는 가격이다. 입력 토큰 100만 개당 5달러, 출력 토큰 100만 개당 25달러로, Opus 4.1 가격 대비 약 3분의 2가 인하됐는데, 이는 코딩 리더보드 최상위를 차지한 것과 동시에 이루어졌다.

대신 컨텍스트에서는 타협했다. 20만 토큰 윈도우로, Gemini 3의 100만 토큰에 비하면 일부에 불과하다. 앤트로픽의 승부수는 대부분의 전문 업무, 즉 오후 내내 이어지는 페어 프로그래밍, 계약서 검토, 에이전트 루프 등이 20만 토큰 안에 충분히 들어가며, 개발자들은 2024년 중급 모델 가격에 최상위급 코딩 능력을 얻는 것을 기꺼이 받아들이리라는 것이다.

안전성 정렬이 잘 되어 있고 문장력도 뛰어나며, 시장 최고의 “페어 프로그래머”다. 그리고 처음으로, Opus급 지능이 일상 업무용 가격으로 책정됐다.

2위: 구글의 Gemini 3

생태계의 거인

구글은 3위지만, 결코 무시할 수 없는 존재다.

11월의 6일 동안, Gemini 3는 최강자로 보였다. LMArena에서 사상 최초로 1500선을 돌파한 1501의 기록적인 Elo 점수로 출시됐고, 핵심 추론 벤치마크 전반에서 GPT-5.1을 앞섰다. 하지만 GPT-5.2의 12월 반격이 뼈아픈 지점에서 격차를 다시 벌려놓았다. ARC-AGI-2에서는 31.1% 대 52.9%, GDPval에서는 53.5% 대 70.9%였다. 가장 어려운 신규 추론 문제에서 Gemini 3는 이제 양강 구도에 확실히 뒤처져 있다.

Advertisement

그럼에도 Gemini 3에는 다른 모델에 없는 초능력이 있다. 바로 멀티모달리티와 확장성이다.

셋 중 가장 강력한 멀티모달 모델로, 비디오, 오디오, 이미지를 네이티브로 처리하며, Claude의 20만 토큰을 압도하는 100만 토큰 컨텍스트 윈도우를 갖췄다. 그리고 구글은 검색과 워크스페이스 제품군과의 통합을 적극적으로 밀어붙이고 있다. 가장 똑똑한 독립적 두뇌는 아니지만, 구글 생태계 안에서 산다면 가장 쓸모 있는 비서다.

기술 심층 분석: 지능의 아키텍처

왜 이런 일이 벌어졌을까? 왜 갈렸을까? 두 선두 주자가 2025년 내내 서로 다른 것에 승부를 걸었기 때문이다.

“테스트 타임 컴퓨트”로의 전환

OpenAI는 추론 시점 연산에 사활을 걸었다. 그저 더 큰 모델을 훈련(훈련 연산)하는 대신, 답변 전에 모델이 더 오래 “생각”하도록(추론 연산) 최적화한 것이다.

총 연산량훈련 연산+(추론 연산×추론 단계)\text{총 연산량} \approx \text{훈련 연산} + (\text{추론 연산} \times \text{추론 단계})

이것이 바로 GPT-5.2의 씽킹 및 프로 모드의 정체다. 답변 시점에 얼마나 많은 추론을 투입할지를 조절하는 다이얼인 셈이다. 어려운 질문 앞에서 모델이 멈칫하는 이유가 여기에 있다. 지연되고 있는 게 아니라 생각하고 있는 것이다. 그리고 패턴 매칭형 모델들이 낙제하는 바로 그 부류의 신규 규칙 문제에서 ARC-AGI-2 점수가 급등한 이유이기도 하다.

효율성에 건 승부수

반면 앤트로픽은 최상위급 지능을 하루 종일 돌릴 수 있을 만큼 저렴하게 만드는 것에 승부를 걸었다.

Opus 4.5의 핵심 소식은 벤치마크가 아니라 청구서였다. SWE-bench Verified 1위를 차지하면서 동시에 플래그십 가격을 약 3분의 2 낮춘 것은, 앤트로픽이 돈이 어디에 있다고 보는지에 대한 선언이다. 한 번의 영웅적인 답변이 아니라, 작업당 수천 번의 호출을 만들어내는 에이전트와 코딩 어시스턴트에 있다는 것이다. 1% 더 나은데 3배 더 비싼 모델은 그 시장에서 패배한다.

이것이 Claude가 “일꾼” 모델처럼 느껴지는 이유다. 지속적인 실전 투입을 위해 설계됐고, 이제는 그에 걸맞은 가격까지 갖췄다.

역사: 업계가 여기까지 온 과정

2025년 12월을 이해하려면, 2025년 초의 “불만의 겨울”을 되돌아봐야 한다.

2025년 2월 무렵, 스케일링 법칙은 벽에 부딪힌 듯 보였다. 오랫동안 소문으로 떠돌던 “오라이언(Orion)”, 즉 많은 이들이 GPT-5가 될 것이라 기대했던 모델인 GPT-4.5는, 방대하고 운용 비용이 큼에도 불구하고 일상적인 작업에서 전작보다 별로 나아진 게 없었다. 투자자들은 초조해지기 시작했다. 서사는 “AI는 거품이다”로 옮겨갔다.

Advertisement

벽을 깬 것은 더 큰 사전 훈련이 아니었다. 추론이었다.

사고 사슬(chain of thought)에 대한 강화학습, 즉 모델이 문제를 풀어나가도록 훈련하고 답이 맞아떨어질 때 보상하는 방식은, 원시 사전 훈련이 정체된 지점에서 오히려 스케일링이 가능하다는 것을 증명했다. OpenAI의 o시리즈가 그 개념을 입증했고, 8월에 출시된 GPT-5는 이를 플래그십에 녹여냈다. 그리고 2025년 말이 되자 모든 최상위 연구소들이 씽킹 모드를 중심으로 라인업을 재구축했다.

이번 12월 출시 사이클은 그 전환의 첫 본격적인 수확이다. 결과는? 벽은 깨졌다. 수확 체감은 더 이상 이야기의 중심이 아니다. 차별화가 그 자리를 대신하고 있다.

전망 분석: 2026년과 그 너머

그렇다면, 업계는 여기서 어디로 향할까?

CTO나 엔지니어링 매니저들에게 2026년의 전략은 명확하다. 모델 오케스트레이션이다.

“모든 것을 지배할 하나의 모델”을 고르던 시대는 끝났다. 그냥 OpenAI 엔터프라이즈 라이선스를 구매하는 것으로 끝낼 수 없다.

“라우터” 아키텍처

2026년의 승리 공식은 다음과 같은 모습일 것이다.

  1. GPT-5.2가 최상단에서 “설계자” 역할을 맡는다. 사용자 질의를 받아 이를 분해하고 실행 계획을 세운다.
  2. Claude Opus 4.5가 “일꾼” 역할을 맡는다. 계획을 받아 구체적인 코드나 콘텐츠를 작성하며, 안전성과 문체적 뉘앙스를 챙긴다.
  3. Gemini 3가 “눈과 귀” 역할을 맡는다. 다른 모델들에 컨텍스트를 넘기기 전에 들어오는 모든 비디오, 오디오, 대용량 문서 입력을 처리한다.

지능의 비용은 떨어지고 있지만, 특화된 지능의 가치는 급등하고 있다.

비용이라는 병목

이 로켓의 발목을 잡는 유일한 요소는 청구서다. 최상위 추론은 이제 프리미엄 상품이다. GPT-5.2는 GPT-5.1보다 40% 비싼 가격으로 출시됐고, 프로 티어는 씽킹 티어보다 대략 한 자릿수 배 더 비싸게 돌아간다. “씽킹” 답변 하나하나가 일반 답변보다 몇 배나 많은 토큰을 태운다. 바로 이 때문에 앤트로픽의 가격 인하가 그토록 공격적인 행보였던 것이고, 연산 자원의 희소성이 아키텍처 효율화로의 전환을 계속 밀어붙이는 이유이기도 하다.

2026년은 기본적인 작업을 기기 내에서 처리하는 “소형 모델(SLM)“의 해가 되고, 복잡한 추론이 필요할 때만 빅3에 의지하게 될 것으로 예상된다. 하지만 착각하지 말자. 유리 천장은 이미 깨졌다.

OpenAI와 앤트로픽은 정상에서 서로 주먹을 주고받고 있다. 구글은 그들이 싸우는 경기장 자체를 짓고 있다. 혁신의 속도는 그 어느 때보다 빠르다.

출처 (13)

Advertisement

🦋 Bluesky 토론

Bluesky에서 토론하기

게시물 검색 중...