이 전략은 서류상으로는 완벽해 보였습니다. 2022년 10월과 2023년 말에 미국 정부는 최첨단 실리콘에 대한 중국의 접근을 효과적으로 제거했습니다. 워싱턴은 Nvidia의 H100 및 A100 GPU 수출을 금지함으로써 베이징의 인공 지능 야망을 컴퓨팅에 굶주림으로써 무너뜨리려는 목표를 세웠습니다.
이론은 간단했습니다. 현대 AI는 무차별 대입의 기능입니다. 국가가 보유하는 FLOP(부동 소수점 연산)이 많을수록 모델은 더 똑똑해집니다. FLOP를 거부하고 미래를 거부하세요.
3년 후, 그 전략은 역효과를 냈습니다.
제재 조치는 중국 AI를 무력화시키는 대신 실리콘 밸리가 직면한 적이 없는 진화적 압력을 가했습니다. OpenAI와 Google이 100,000개 단위의 H100 클러스터로 인프라를 확장하여 원시 규모의 문제를 해결하기 위해 기가와트의 전력을 소비하는 동안 DeepSeek과 같은 중국 연구소는 수학으로 문제를 해결해야 했습니다.
DeepSeek V4는 2026년 초에 등장했습니다. 이 시스템은 알고리즘의 우아함을 사용하여 하드웨어 봉쇄를 완전히 우회하는 새로운 유형의 “Lean AI”를 나타내며 표준 LLM과 크게 다릅니다. 아이러니하게도 효율성 혁신, 특히 “Engram” 아키텍처는 고급 소비자 워크스테이션만큼 접근 가능한 하드웨어에서 추론 작업을 수행할 것을 약속합니다.
봉쇄는 업계를 굶주리게 만들려는 의도였습니다. 대신 엔지니어들에게 단식 방법을 가르쳤습니다.
최적화 함정
DeepSeek V4가 패러다임 전환인 이유를 이해하려면 서양 AI의 “게으른 시대”(2023-2025)를 이해해야 합니다.
서양에서는 컴퓨팅에 대한 액세스가 사실상 무한했습니다. 모델에 지능이 부족한 경우 일반적으로 해결책은 “더 크게 만드는 것”이었습니다. 이것이 바로 확장 법칙 도그마입니다. 즉, 매개변수 수의 증가와 데이터의 증가는 지능의 증가와 같습니다. 작동하지만 비효율적입니다. 이는 가속력을 향상시키기 위해 골프 카트에 V12 엔진을 설치하는 것과 동일한 엔지니어링입니다.
중국에는 그런 사치가 없었습니다. 암시장 H100이 MSRP의 두 배 또는 세 배인 $50,000에서 $120,000에 거래되면서 모든 부동 소수점 연산은 그 존재를 정당화해야 했습니다. 이러한 희소성 때문에 엔지니어들은 Transformer 아키텍처 자체의 비효율성을 조사해야 했습니다.
- 같은 사실을 반복해서 다시 계산하는 이유는 무엇입니까?
- 모든 토큰이 다른 모든 토큰에 주의를 기울여야 하는 이유는 무엇입니까?
- 신경망이 너무 불안정해서 대규모 중복이 필요한 이유는 무엇입니까?
DeepSeek V4는 Engram, DSA 및 mHC의 세 가지 특정 기술을 통해 이러한 질문에 답합니다.
1. 엔그램: O(1) 기억 혁명
V4의 가장 급진적인 혁신은 2026년 1월에 발표된 논문에 소개된 Engram 아키텍처입니다.
표준 LLM은 일종의 디지털 기억 상실증을 앓고 있습니다. 프랑스의 수도에 대해 질문을 받으면 GPT-4는 신경 가중치를 처리하여 이에 대해 “생각”하고 모든 추론 단계에서 답을 효과적으로 다시 도출합니다. 이 프로세스는 계산 비용이 많이 듭니다.
엔그램은 지식을 다르게 취급합니다. 추론(유동 지능)과 사실(결정화된 기억)을 분리합니다. 이는 부족한 GPU VRAM이 아닌 시스템 RAM(마더보드의 표준 DDR5 메모리)에 있는 대규모 읽기 전용 조회 테이블로 정적 지식을 오프로드합니다.
컴퓨터 과학 용어로 이는 지식 검색의 복잡성을 심층 신경 전달에서 O(1) 조회로 변경합니다.
DeepSeek V4는 1,000억 개의 매개변수 지식 테이블을 CPU RAM으로 오프로드함으로써 서양 모델에 필요한 GPU 메모리의 일부만으로 대규모 컨텍스트 창을 작동합니다. GPU는 추론에 집중할 수 있고 CPU는 암기 암기를 처리합니다. 이 아키텍처는 특히 승인된 카드의 VRAM 병목 현상을 우회합니다.
2. DSA: 희소 주의 물리학
두 번째 기둥은 **DeepSeek Sparse Attention(DSA)**입니다.
표준 Transformer에서 “주의 메커니즘”은 2차()입니다. 입력 문서의 길이가 두 배로 늘어나면 이를 처리하는 데 필요한 계산 작업도 네 배로 늘어납니다. 모든 단어는 다른 모든 단어를 분석합니다.
DSA는 이러한 물리학을 변화시킵니다. 특정 단어에 대해 문서에 있는 다른 단어의 대부분은 관련이 없다고 가정합니다. DSA는 동적 희소성 마스크를 구현하여 복잡성을 ****로 줄입니다. 여기서 는 관련 토큰의 작은 상수입니다.
DSA에서 행렬은 완전히 계산되지 않습니다. 대신, top-k 라우터는 어떤 텍스트 블록이 관련되어 있는지 예측하고 해당 블록에 대해서만 주의를 계산합니다. 이를 통해 DeepSeek 모델은 동일한 크기의 표준 Llama-3 모델을 실행하지 못하는 하드웨어에서 128k+ 컨텍스트 창을 처리할 수 있습니다.
3. mHC: 스택 안정화
MHC(Manifold-Constrained Hyper-Connections) 논문(2025년 12월)에 자세히 설명된 퍼즐의 마지막 조각은 딥 네트워크의 안정성 문제를 해결합니다.
모델이 더 깊어질수록(더 많은 레이어) 모델을 통과하는 신호는 폭발(무한화)되거나 사라지는(0이 됨) 저하되는 경향이 있습니다. 서양 연구실에서는 모든 단계에서 무차별적인 통계 조정을 수행하는 “레이어 정규화”를 통해 이 문제를 해결합니다.
mHC는 기하학적 접근 방식을 취합니다. 이는 연결 행렬이 Birkhoff Polytope(이중 확률론적 행렬)이라는 수학적 개체에 유지되도록 합니다.
DeepSeek는 신호 표준이 유지된다는 것을 수학적으로 보장함으로써 값비싼 정규화 단계의 필요성을 제거합니다. 이를 통해 더 빠르게 훈련하고 더 안정적으로 실행되는 훨씬 더 깊고 좁은 네트워크가 가능합니다.
다윈의 가격표
이러한 아키텍처 차이를 충분히 이해하려면 이를 주도한 경제성을 살펴봐야 합니다.
실리콘 밸리에서는 “나쁜 아이디어”의 비용이 낮습니다. 엔지니어가 10% 비효율적인 교육을 실행하는 경우 해당 비용은 업계를 뒷받침하는 막대한 벤처 캐피탈 보조금으로 흡수됩니다. 컴퓨팅은 물처럼 취급됩니다. 그것은 자유롭게 흐른다.
선전에서는 “나쁜 아이디어”의 대가가 실존적입니다. 회색 시장에서 H100의 가격은 $100,000 이상이므로 10% 비효율성은 항목이 아닙니다. 그것은 프로젝트를 죽이는 비용입니다. 이렇게 과도하게 부풀려진 컴퓨팅 비용은 다윈주의적 필터 역할을 했습니다. 가장 효율적인 코드만이 살아남았습니다.
비대해진 아키텍처, 게으른 메모리 관리 및 중복 계산은 엄청난 효율성을 위해 선택되었습니다. 그 결과, 서구의 소프트웨어보다 더 간결하고, 더 의미 있고, 훨씬 더 최적화된 소프트웨어 스택이 탄생했습니다. 미국 개발자가 프롬프트 엔지니어링을 배우는 동안 중국 개발자는 1GB의 VRAM을 절약하기 위해 주의 메커니즘의 기본 수학을 다시 작성하는 방법을 배우고 있었습니다.
이러한 경제적 압박으로 인해 영구적인 격차가 발생했습니다. 내일 제재가 해제되더라도 중국 연구소는 모델 제작에 있어서 ‘서구’ 방식으로 돌아가지 않을 것입니다. 그들은 더 나은 방법을 찾았습니다.
소비자 하드웨어 신기루?
GitHub와 HuggingFace에는 DeepSeek V4가 “듀얼 RTX 4090에서 실행된다”는 소문이 돌고 있습니다. 이 주장이 정확합니까?
부분적으로.
V3 아키텍처의 전체 6,710억 매개변수 밀도(V4는 이를 미러링하거나 초과할 것으로 예상됨)를 상업적으로 실행 가능한 속도로 실행하려면 거의 400GB의 VRAM이 필요하며 이는 소비자 카드(4090 한 쌍의 48GB)에서는 불가능합니다.
그러나 엔그램 아키텍처는 방정식을 변경하려고 시도합니다. 대부분의 “지식”이 시스템 RAM(사용자가 1,000달러 미만의 비용으로 256GB의 DDR5를 쉽게 설치할 수 있음)으로 오프로드되기 때문에 GPU는 이론적으로 “추론 코어”만 보유하면 됩니다.
이는 고급 워크스테이션을 사용하는 Shenzen의 연구원이나 오하이오의 취미 활동가가 사실 조회에 대한 대기 시간이 더 길기는 하지만 1조 매개변수의 거인처럼 동작하는 모델을 실행할 수 있음을 의미합니다. 데이터센터의 독점을 깨뜨릴 위험이 있습니다. 사용자는 SOTA AI를 실행하기 위해 더 이상 H100 클러스터가 필요하지 않습니다. 상당한 양의 저렴한 RAM과 스마트 아키텍처가 필요합니다.
자동차 산업의 병행
역사는 반복됩니다. 1970년대 미국 자동차 산업은 이주에 중독되었습니다. 큰 V8 엔진은 엄청난 양을 통해 마력을 생산했습니다. 석유 위기가 닥쳤을 때 디트로이트는 무방비 상태였습니다.
자원이 부족하고 연료세도 부과되는 일본은 작고 효율적인 인라인 4 엔진을 완성하는 데 수십 년을 보냈습니다. 휘발유 가격이 비싸졌을 때 Honda Civic은 Ford Mustang과만 경쟁하지 않았습니다. 시장을 장악했습니다.
미국 AI는 1970년대 V8입니다. 강력하고 시끄럽고 엄청나게 낭비적입니다. 중국 AI는 1980년대 시민입니다. 이는 간결하고 효율적이며 점점 더 적은 비용으로 동일한 작업을 수행할 수 있는 능력을 갖추고 있습니다.
미국의 제재는 봉쇄 역할을 하도록 의도됐다. 대신에 탄소세의 역할을 했습니다. 컴퓨팅 비용을 높임으로써 미국의 정책은 라이벌이 하이브리드 정보 엔진을 발명하도록 강요했습니다. 이제 서구 데이터 센터의 전력 수요로 인해 전력망이 붕괴되기 시작하면서 필요에 따라 탄생한 “Lean AI”가 진정으로 확장할 수 있는 유일한 아키텍처임이 입증될 수 있습니다.
출처 (5)
- dataconomy.com DeepSeek Reveals MODEL1 Architecture in GitHub Update
- arxiv.org Manifold-Constrained Hyper-Connections (mHC)
- rewire.it Engram - How DeepSeek Added a Second Brain to LLMs
- infoq.com DeepSeek V3.2 and Sparse Attention
- subhadipmitra.com DeepSeek mHC and Stability
🦋 Bluesky 토론
Bluesky에서 토론하기