주요 내용
- Opus 4.5는 새로운 코딩 왕: SWE-bench Verified에서 80.9%의 점수를 획득하여 GPT-5.1과 Gemini 3 Pro를 모두 능가합니다.
- 무게를 뛰어넘는 Haiku 4.5 펀치: “소형” 모델은 이제 이전 세대 Sonnet 4의 코딩 성능과 일치합니다.
- 가격 전쟁: Opus 4.5는 입력 토큰 백만 개당 5달러로 공격적으로 가격이 책정되어 경쟁사보다 훨씬 저렴합니다.
- 하이브리드 추론: 두 모델 모두 복잡한 작업을 위한 새로운 “전환 가능한” 추론 기능을 갖추고 있습니다.
OpenAI와 Google이 11월 릴리스를 통해 방의 모든 산소를 빨아들이는 것처럼 보였던 바로 그 순간, Anthropic은 엄청난 반격으로 대응했습니다. Claude Opus 4.5 및 Claude Haiku 4.5의 출시는 단순한 반복 업데이트가 아닙니다. 이는 개발자 시장의 중심에 대한 계산된 파업입니다.
지난 몇 주 동안 대화는 GPT-5의 추론과 Gemini 3의 생태계 통합에 의해 지배되었습니다. 그러나 Anthropic은 심각한 작업을 위한 가장 유능하고 신뢰할 수 있으며 조종 가능한 모델을 구축한다는 핵심 철학을 고수해 왔습니다. 이러한 새 릴리스를 통해 그들은 코딩 및 복잡한 에이전트 워크플로우에서 Claude가 여전히 이길 수 있는 모델이라는 강력한 사례를 만들고 있습니다.
Claude Opus 4.5 이해하기
2025년 11월 24일에 출시된 Opus 4.5는 Anthropic의 새로운 주력 제품입니다. 이는 가장 까다로운 작업을 위해 설계된 라인업에서 “가장 스마트한” 모델로 원래 Opus를 대체합니다.
사양
- 컨텍스트 창: 200,000개 토큰
- 가격: 백만 입력 토큰당 $5 / 백만 출력 토큰당 $25
- 주요 기능: 하이브리드 추론(즉각적 응답과 확장된 “사고” 모드 간 전환)
벤치마크
여기의 헤드라인 수치는 **SWE 벤치 검증에서 80.9%**입니다. AI 평가의 잡초에 깊이 빠져 있지 않은 사람들을 위해 SWE-bench는 실제 소프트웨어 엔지니어링 문제를 해결하는 AI의 능력을 테스트하기 위한 최적의 표준입니다.
- 클로드 오푸스 4.5: 80.9%
- GPT-5.1: ~78%(추정)
- Gemini 3 Pro: ~76%(추정)
이것은 오차범위의 승리가 아닙니다. 이는 현재 LLM의 가장 상업적으로 가치 있는 영역인 코드 작성에서 결정적인 선두입니다.
클로드 하이쿠 4.5 이해하기
Opus가 헤드라인을 장식하는 동안 Haiku 4.5(10월 15일에 조용히 출시되어 현재 완전히 출시됨)는 비즈니스에 더 중요한 모델일 수 있습니다.
중요한 이유
하이쿠는 항상 “빠르고 저렴한” 모델이었습니다. 그러나 Haiku 4.5는 “빠르고, 저렴하며, *스마트”하다는 점에서 방정식을 바꿉니다. Anthropic은 불과 몇 달 전만 해도 최첨단 모델이었던 Sonnet 4의 코딩 성능과 일치한다고 주장합니다.
경제학
- 가격: 백만 입력 토큰당 $1 / 백만 출력 토큰당 $5
- 사용 사례: “에이전트” 워크플로를 위한 엔진입니다. 로그 분석, 지원 티켓 분류, 단위 테스트 작성 등 수천 개의 하위 작업을 실행해야 하는 시스템이 있는 경우 Haiku 4.5를 사용하면 품질 저하 없이 경제적으로 실행 가능합니다.
비교: Claude vs. GPT-5 vs. Gemini 3
2025년 후반의 AI 환경은 세 마리의 경주입니다. 쌓이는 방법은 다음과 같습니다.
| 기능 | 클로드 오푸스 4.5 | GPT-5.1 | 제미니 3 프로 |
|---|---|---|---|
| 주요 강점 | 코딩 및 에이전트 제어 | 일반 추론 및 다중 양식 | Google 생태계 통합 |
| 코딩 벤치마크 | 80.9% | ~78% | ~76% |
| 가격(입력/출력) | $5 / $25 | ~$15 / $75 | ~$10 / $50 |
| 컨텍스트 창 | 20만 | 128k | 128k |
평결: 소비자 챗봇을 구축하는 경우 GPT-5는 여전히 ‘개성’ 측면에서 우위를 점할 수 있습니다. Google Workspace에 깊이 빠져 있다면 Gemini 3는 당연한 선택입니다. 그러나 소프트웨어, 에이전트 또는 복잡한 데이터 파이프라인을 구축하는 경우 Claude Opus 4.5는 객관적으로 현재 작업에 가장 적합한 도구이며 훨씬 저렴합니다.
업계에 미치는 영향
“하이브리드 추론”의 부상
Opus 4.5의 가장 흥미로운 기능 중 하나는 “추론”을 켜고 끄는 기능입니다. “사고”를 잠시 멈추게 하는 OpenAI의 o1 모델과 달리 Claude는 개발자가 선택할 수 있도록 합니다. 이러한 유연성은 간단한 쿼리에는 낮은 대기 시간이 필요하지만 복잡한 쿼리에는 깊은 생각이 필요한 애플리케이션에 매우 중요합니다.
기업 안전
Anthropic은 계속해서 “Constitutional AI” 브랜딩에 전념하고 있습니다. Opus 4.5에는 엔터프라이즈급 보안 기능과 “AI 안전 레벨 2” 인증이 함께 제공됩니다. 은행, 의료 서비스 제공자 및 정부 기관의 경우 이러한 안전 우선 접근 방식이 결정적인 요인이 되는 경우가 많습니다.
다음은 무엇입니까?
Opus 4.5의 출시로 Anthropic의 2025년 라인업이 완성되었습니다. 이제 문제는 OpenAI와 Google이 어떻게 대응할 것인가입니다. 업계에서는 코딩 격차를 줄이기 위해 2026년 초에 “GPT-5.5” 또는 “Gemini 3 Ultra”가 나올 가능성이 높습니다.
하지만 지금은 공이 그들의 코트에 있습니다. Anthropic은 승리하기 위해 가장 큰 과대 광고 기계가 필요하지 않다는 것을 입증했습니다. 최고의 코드가 필요합니다.
결론
Claude Opus 4.5는 집중 엔지니어링 분야의 마스터클래스입니다. 코딩 기능, 에이전트 신뢰성 및 비용 효율성을 우선시함으로써 Anthropic은 개발자 커뮤니티가 요구한 것을 정확하게 제공했습니다. 이는 단지 GPT-5의 경쟁자가 아닙니다. 많은 사용 사례에서 이는 탁월한 선택입니다.
출처 (3)
- anthropic.com Anthropic Opus 4.5 Announcement
- anthropic.com Anthropic Haiku 4.5 Announcement
- aboutamazon.com AWS Bedrock News
🦋 Bluesky 토론
Bluesky에서 토론하기