링크가 복사되었습니다!

DeepSeek-V3 대 세계: 1억 달러의 해자를 깨다

보고된 교육 비용이 560만 달러에 불과한 DeepSeek-V3는 GPT-4o의 경쟁자일 뿐만 아니라 폐쇄 소스 모델에 대한 경제적 비난이기도 합니다. MLA 및 MoE 아키텍처가 지능 규칙을 다시 작성하는 방법은 다음과 같습니다.

🌐
기계 번역

이 기사는 영어 원문에서 자동 번역되었습니다. 영어 원문 읽기

돌담을 부수는 디지털 두뇌, DeepSeek의 파괴적 혁신을 상징합니다.

AI 산업은 규모가 유일한 해자이고 컴퓨팅이 유일한 통화라는 단일하고 값비싼 가정에 따라 운영되어 왔습니다. 2년 동안의 로드맵은 명확했습니다. 즉, H100 클러스터에 1억 달러, 10억 달러, 100억 달러를 지출하여 무차별 지능을 수행하는 것입니다.

DeepSeek-V3는 이러한 가정을 깨뜨렸습니다.

중국 연구소에서 조용히 출시된 DeepSeek-V3는 표면적으로 MATH 및 LiveCodeBench와 같은 중요한 벤치마크에서 GPT-4o 및 Claude 3.5 Sonnet과 일치합니다. 하지만 성과는 헤드라인이 아닙니다. 헤드라인은 가격표입니다. DeepSeek은 약 560만 달러의 컴퓨팅 크레딧으로 이 6,710억 개의 매개변수 괴물을 훈련했다고 주장합니다.

이 수치가 정확하다면 생성 AI 부문의 재정적 논리가 뒤집힐 것입니다. 업계는 LLM의 “Linux 순간”을 목격하고 있습니다. 즉, 아키텍처의 우아함이 무차별적인 힘을 이기고 실리콘 밸리 거대 기업의 독점 해자가 증발하기 시작하는 변화입니다.

반란의 역사: LLaMA에서 DeepSeek까지

이번 릴리스의 중요성을 이해하려면 2023년부터 계속된 “개방 대 폐쇄” 전쟁 내에서 이를 맥락화할 필요가 있습니다.

1단계: 누출(LLaMA-1)

2023년 2월, Meta의 LLaMA-1 모델이 4chan에 ‘유출’되었습니다. 처음으로 연구원들은 자체 하드웨어에서 GPT-3 클래스 모델을 실행할 수 있었습니다. 이는 캄브리아기의 미세 조정(Alpaca, Vicuna) 폭발을 촉발하여 더 작고 최적화된 모델이 무게보다 큰 성능을 발휘할 수 있음을 입증했습니다. 하지만 GPT-4에 비하면 여전히 장난감이었습니다.

2단계: 컨텐더스(미스트랄 및 라마 3)

그런 다음 Mistral Large와 Llama 3이 나왔습니다. 이 모델은 GPT-3.5 또는 GPT-4 Turbo 수준의 성능을 제공하여 격차를 좁혔습니다. 그들은 오픈 웨이트가 취미 생활자만을 위한 것이 아니라 엔터프라이즈급 애플리케이션에도 적합하다는 것을 증명했습니다. 그러나 그들은 여전히 ​​대규모의 전통적인 클러스터에서 교육을 받았으며 교육 비용은 여전히 ​​수천만 달러에 달했습니다.

Advertisement

3단계: 효율성 충격(DeepSeek-V3)

DeepSeek-V3는 세 번째 단계입니다. 이는 단순히 “개방형 모델에 적합”한 것이 아닙니다. 전반적으로 최첨단(SOTA) 성능을 주장하고 있습니다. 그러나 중요한 것은 Meta나 Microsoft의 무한한 예산 없이 이를 달성했다는 것입니다. DeepSeek은 아키텍처 자체를 최적화함으로써 알고리즘 혁신 > 원시 컴퓨팅 규모를 입증했습니다.

효율성 역설: ‘확장 법칙’ 위반

DeepSeek-V3가 비공개 소스 연구실에 무서운 이유를 이해하려면 내부를 살펴봐야 합니다. 오늘날 대부분의 LLM은 밀도가 높은 모델 또는 표준 전문가 혼합(MoE)입니다. 그들은 석탄 기관차처럼 VRAM을 태웁니다.

DeepSeek은 단지 더 큰 모델을 훈련한 것이 아닙니다. 그들은 엔진의 물리학을 바꾸었습니다.

다중 헤드 잠재 주의(MLA): 메모리 압축기

DeepSeek-V3의 킬러 기능은 **Multi-Head Latent Attention(MLA)**입니다. 기존 Transformer 모델에서 KV(키-값) 캐시는 메모리 뱀파이어입니다. 컨텍스트 창이 커짐에 따라(예: 128,000개 토큰) 특정 “키”와 “값”을 저장하는 데 필요한 메모리가 폭발적으로 증가하여 연구자는 추론을 제공하기 위해 더 많은 H100을 구입해야 합니다.

MLA는 이 캐시를 압축합니다. 전체 키 및 값 헤드를 저장하는 대신 이를 낮은 순위의 잠재 벡터에 투영합니다.

cKV=xWDKV\mathbf{c}_{KV} = \mathbf{x} W_{DKV}

MLA는 원시 데이터 자체가 아닌 주의 데이터의 압축된 “요약”을 저장함으로써 표준 아키텍처에 비해 KV 캐시 크기를 거의 93% 줄입니다. 이를 통해 DeepSeek-V3는 긴 컨텍스트 성능을 유지하면서 훨씬 적은 수의 GPU에서 실행할 수 있습니다. “초당 토큰”(TPS) 비용에 집착하는 업계의 경우 이는 성배입니다.

DeepSeekMoE: 전문가 떼

DeepSeek은 또한 MoE(Mixture-of-Experts) 아키텍처를 개선합니다. 표준 MoE 모델은 최상위 전문가(예: “코딩 전문가” 또는 “역사 전문가”)에게 쿼리를 라우팅합니다. 그러나 전통적인 MoE는 소수의 전문가가 모든 작업을 수행하고 다른 전문가는 가만히 앉아 있는 ‘전문가 붕괴’ 문제를 겪고 있습니다.

DeepSeek-V3는 세분화된 접근 방식을 사용합니다.

  1. 세분화된 전문가: 8명의 대규모 전문가 대신 기능을 더 미세한 조각으로 분할합니다(예: 64명의 라우팅 전문가).
  2. 공유 전문가: 특정 전문가를 일반 지식을 포착하는 “상시 접속” 공유 리소스로 지정하여 전문 전문가가 일반 문법이나 논리를 놓치는 “지식 섬” 문제를 방지합니다.

결과는? 토큰당 370억만 활성화하는 6,710억 개의 매개변수를 갖춘 모델입니다. 뇌 크기는 거인 수준이지만 칼로리 소모량은 유아 수준이다.

보조 무손실 로드 밸런싱

가장 기술적이면서도 영향력 있는 혁신 중 하나는 바로 훈련 안정성입니다. 일반적으로 MoE 기능의 모든 “전문가”가 동일하게 사용되도록 하기 위해 연구자는 “보조 손실” 기능을 추가합니다. 즉, 모델이 특정 전문가를 무시하는 경우 페널티가 발생합니다.

Advertisement

문제? 이 페널티는 모델의 실제 성능을 저하시킵니다. 이는 모델이 단지 할당량을 충족하기 위해 “최적 수준이 아닌” 전문가를 사용하도록 강제합니다. DeepSeek-V3에는 보조 무손실 로드 밸런싱이 도입되었습니다. 모델에 불이익을 주는 대신 각 전문가에 대한 “편향” 용어를 동적으로 조정합니다. 전문가가 과로하면 호출에 대한 “비용”이 약간 올라가므로 그라데이션 초점을 저하시키지 않고 자연스럽게 라우터가 다른 곳을 찾도록 유도합니다.

FP8 혼합 정밀도: 속도 제한 위반

560만 달러의 훈련 비용 수치는 FP8(8비트 부동 소수점) 정밀도 사용에 크게 의존합니다.

역사적으로 모델은 BF16(16비트)에서 학습되었습니다. FP8은 특히 행렬 곱셈에 필요한 메모리 공간과 대역폭 요구 사항을 절반으로 줄입니다. NVIDIA의 H100은 FP8을 지원하지만 불안정성(수치 오버플로)으로 인해 프론티어 모델을 FP8로만 성공적으로 훈련한 연구실은 거의 없습니다.

DeepSeek가 이를 해독했습니다. 세분화된 양자화 전략(작은 1x16 타일에 대한 배율 인수 차단)을 사용하여 수렴에 필요한 수치 정밀도를 유지하면서 8비트 수학의 엄청난 속도 향상을 거두었습니다. 이를 통해 표면적으로는 비슷한 BF16 실행보다 약 40% 더 빠르게 훈련할 수 있었고 GPU 클러스터에 대한 임대 비용이 직접적으로 절감되었습니다.

지정학적 결함

DeepSeek-V3의 존재는 미국 수출 통제에 대한 직접적인 도전입니다. 바이든 행정부의 10월 7일 칩 금지 조치는 NVIDIA의 최첨단 H100에 대한 액세스를 거부함으로써 GPT-3 시대에 중국의 AI 개발을 동결시키도록 고안되었습니다.

초당 3.2테라비트의 상호 연결 속도가 없으면 프론티어 모델을 교육할 수 없다는 이론이 있었습니다.

DeepSeek은 저대역폭 통신에 맞게 최적화하여 이를 우회했습니다. GPU 간에 전송되는 데이터를 공격적으로 압축함으로써(FP8 정밀도 및 이중 파이프 라우팅 사용) “구식”이거나 기술적으로 제한되는 하드웨어에서 개척 모델을 훈련할 수 있었습니다.

그들은 봉쇄를 깨뜨리지 않았습니다. 그들은 다른 연료로 작동하는 자동차를 설계했습니다.

성능 현실 점검

실제로 GPT-4o만큼 좋은가요? 벤치마크에서는 “대부분 그렇습니다”라고 제안합니다.

“Big Three” 벤치마크의 결과는 다음과 같습니다.

벤치마크도메인DeepSeek-V3GPT-4o(2024년 5월)클로드 3.5 소네트
수학고급 수학90.0%76.6%71.1%
라이브코드벤치코딩(하드)40.2%43.1%46.2%
MMLU일반 지식88.5%88.7%88.3%

공개적으로 보고된 기술 보고서 및 독립 평가 도구에서 가져온 데이터입니다.

“수학” 변칙

MATH의 90.0% 점수는 엄청납니다. 이는 DeepSeek가 추론 데이터 세트, 즉 다른 프론티어 모델(증류)에서 생성된 합성 데이터에 대해 과도한 색인을 생성했음을 시사합니다. 그러나 코딩에서는 여전히 개발자의 마음을 사로잡는 Claude 3.5 Sonnet보다 약간 뒤떨어집니다.

Advertisement

뉘앙스 & “바이브”

정성 테스트에서는 뚜렷한 차이가 나타납니다. DeepSeek-V3는 GPT-4o보다 훨씬 더 “로봇적”이고 간결합니다. OpenAI가 악명 높은 RLHF(인간 피드백을 통한 강화 학습)를 모델에 적용한 “창의적인 보풀”이 부족합니다. 창의적인 글쓰기에서는 GPT-4o가 여전히 승리합니다. PDF에서 데이터를 엄격하게 추출하려면? DeepSeek은 “예의바른 대화”를 덜 환각시키기 때문에 실제로 더 나을 수도 있습니다.

세입자 시대의 종말?

업계는 “서비스로서의 모델(Model as a Service)” 시대에서 멀어지고 있습니다. 560만 달러의 훈련 실행이 1억 달러의 훈련 실행 결과를 효과적으로 복제할 수 있다면 OpenAI와 Anthropic의 마진은 위험에 처해 있습니다.

토큰 경제학

현재 OpenAI는 GPT-4o에 대해 대략 $2.50 / 1M 입력 토큰을 청구합니다. DeepSeek API는 V3의 가격을 대략 $0.14/1M 입력 토큰으로 책정합니다.

17배의 가격 차이입니다.

RAG(Retrieval Augmented Generation) 파이프라인을 구축하는 스타트업의 경우 이는 한계 최적화가 아닙니다. 이는 비즈니스 모델을 가능하게 하는 요소입니다. GPT-4o에서 구축하기에는 “너무 비용이 많이 드는” 애플리케이션(예: 모든 쿼리에 대해 전체 법적 저장소 읽기)이 DeepSeek에서는 갑자기 하찮아졌습니다.

향후 전망: 2026년 및 그 이후

DeepSeek-V3는 신을 만드는 데 1조 달러가 필요하지 않다는 것을 증명합니다. 더 나은 수학이 필요합니다.

2026년을 바라보며 AI 기업을 구별하는 요소는 더 이상 “누가 최고의 모델을 갖고 있는가?”가 아니라 그 격차가 0에 가까워질 것입니다. 구별되는 요소는 통합과 신뢰입니다.

미국 방산업체가 독점 코드베이스를 갖춘 중국 모델을 신뢰할 수 있습니까? 대답은 “아니요”입니다. 그러나 베를린에 있는 부트스트랩 SaaS 창업자의 대답은 “그렇습니다. 물론입니다.”입니다.

해자가 사라졌습니다. 수문이 열려 물이 빠르게 불어나고 있습니다.

출처 (3)

Advertisement

🦋 Bluesky 토론

Bluesky에서 토론하기

게시물 검색 중...