주요 내용
- “RAM 다운로드” 현실: CXL 3.0을 사용하면 서버가 PCIe와 같은 버스를 통해 공유 풀에서 메모리를 빌려 물리적 슬롯 제한을 효과적으로 해결할 수 있습니다.
- 25% 낭비 해결: 데이터 센터 메모리의 최대 4분의 1이 필요하지 않은 CPU에 잠겨 있기 때문에 유휴 상태(“고유”)로 남아 있습니다. CXL은 이 용량을 해방합니다.
- 빛 물리학의 속도: CXL 3.0은 PCIe 6.0 PHY 및 PAM-4 신호를 사용하여 64GT/s를 달성하여 원격 메모리를 로컬처럼 느낄 수 있을 만큼 빠르게 만듭니다.
- 마더보드의 종말: 업계는 CPU, RAM, 스토리지가 빛과 구리로 연결된 별도의 기기인 “분리형 컴퓨팅”으로 이동하고 있습니다.
수십 년 동안 “RAM 다운로드 사용량” 밈은 컴퓨터 활용 능력에 대한 최고의 리트머스 테스트였습니다. 하드웨어를 다운로드할 수 없습니다. RAM은 빛의 속도가 너무 느려 다른 곳에 두기에는 너무 느리기 때문에 CPU 바로 옆에 납땜되거나 슬롯에 장착된 실리콘과 커패시터의 물리적 스틱입니다.
하지만 2025년에는 그 농담이 현실이 되고 있다. 업계는 벽에 부딪혔습니다. CPU 코어 수는 폭발적으로 증가하고 있지만 엔지니어가 마더보드에 꽂을 수 있는 메모리 채널 수는 그렇지 않습니다. 프로세서가 부족해지고 있습니다.
Compute Express Link(CXL), 특히 3.0 개정판을 입력합니다. 엔지니어가 기존 서버 아키텍처의 법칙을 깨뜨릴 수 있는 프로토콜입니다. CXL은 CPU에서 메모리를 분리하여 공유 “풀”에 배치함으로써 한 서버가 소프트웨어가 차이를 구분할 수 없을 정도로 로컬 DRAM에 가까운 속도로 다른 서랍(또는 다른 랙)에 물리적으로 위치한 메모리에 액세스할 수 있도록 해줍니다.
이는 “무한 RAM” 결함이 발생할 수 있는 가장 가까운 데이터 센터입니다. 지난 10년간 가장 중요한 하드웨어 변화 뒤에 숨은 물리학, 경제학, 엔지니어링은 다음과 같습니다.
배경: “좌초된 기억” 위기
CXL을 이해하려면 현대 하이퍼스케일러(예: Google, AWS, Azure)의 경제적 악몽을 이해해야 합니다.
25% 세금
기존 서버에서는 CPU를 구입하고 슬롯을 RAM으로 채웁니다. 해당 서버가 CPU는 100% 사용하고 RAM은 10%만 사용하는 계산량이 많은 작업을 실행하는 경우 해당 RAM의 90%가 낭비됩니다. “좌초”되어 있습니다. 메모리 부족으로 인해 다운되는 옆 서버에는 빌려줄 수 없습니다.
Microsoft와 Marvell의 연구에 따르면 특정 순간에 모든 데이터 센터 메모리의 약 25%가 좌초됩니다.
서버 DRAM 매출은 2028년까지 400억 달러에 달할 것으로 예상되며, 이는 80억 달러의 연간 손실입니다. AI 모델의 크기가 몇 달마다 두 배로 늘어나는 시대에 그 정도의 용량을 테이블 위에 남겨두는 것은 용납될 수 없습니다.
CXL 3.0 이해: 부정행위의 물리학
CXL은 새로운 케이블이 아닙니다. 이는 PCIe 전기 인터페이스 위에 탑재되는 프로토콜입니다. PCIe가 도로라면 CXL은 자동차(데이터)가 충돌 없이 페라리 속도로 주행할 수 있게 해주는 교통규칙이다.
작동 방식: “일관성” 생성
CXL의 마법은 캐시 일관성입니다.
일반적으로 장치(예: GPU 또는 SSD)가 메모리에 쓰는 경우 CPU는 이에 대해 즉시 알지 못합니다. CPU는 L1/L2 캐시에 해당 데이터의 이전 복사본을 보관하고 있을 수 있습니다. 이 불일치로 인해 버그가 발생합니다. CXL은 이 문제를 해결하기 위해 세 가지 프로토콜을 도입합니다.
- CXL.io: 검색 및 구성(기본 PCIe 항목).
- CXL.cache: 장치가 CPU 캐시를 스누핑할 수 있도록 허용합니다.
- CXL.mem: CPU가 장치의 메모리를 시스템 RAM인 것처럼 읽고 쓸 수 있도록 합니다.
CXL 3.0은 메모리 풀링을 통해 이를 한 단계 더 발전시켰습니다.
대역폭 수학
CXL 3.0은 일반적으로 PCIe 6.0 물리적 계층을 사용합니다. 이는 PAM-4(Pulse Amplitude Modulation 4-level) 신호에 의존합니다. 0과 1(NRZ)을 보내는 대신 4개의 전압 레벨(00, 01, 10, 11)을 보내 클럭당 처리량을 효과적으로 두 배로 늘립니다.
이는 가장 빠른 로컬 DDR5(여러 채널에서 200GB/s 이상을 푸시할 수 있음)보다 느리지만 로컬 할당이 가득 찼을 때 사용되는 RAM 계층인 “확장 메모리”에 대해서는 충분히 빠릅니다.
진화: CXL 3.0이 “결함”인 이유
CXL 3.0이 혁명인 이유를 이해하려면 이전 버전을 살펴봐야 합니다.
- CXL 1.0/1.1은 단순한 지점 간 연결이었습니다. 메모리 확장 카드를 서버에 삽입할 수 있게 되었고 CPU는 이를 인식하게 되었습니다. 유용하지만 정적입니다. “메모리 용량” 문제는 해결되었지만 “스트랜디드 메모리” 문제는 해결되지 않았습니다.
- CXL 2.0에는 전환이 도입되었습니다. 네트워크 스위치와 마찬가지로 엔지니어는 여러 장치를 단일 호스트에 연결하거나 호스트 간에 장치를 분할할 수 있습니다. 이것이 풀링의 탄생이었지만 단일 “팬아웃” 계층 구조로 제한되었습니다.
- CXL 3.0은 물리학이 흥미로워지는 버전입니다. “패브릭”을 소개합니다. 단순한 트리 구조 대신에 장치는 P2P 메시로 서로 통신할 수 있습니다. GPU는 CPU를 깨우지 않고도 CXL 메모리 스틱과 직접 통신할 수 있습니다. 이는 대기 시간을 줄이고 지역화된 클러스터의 “무한 RAM” 동작을 모방합니다. 전체 데이터 센터를 하나의 거대한 마더보드로 전환합니다.
심층 분석: 분해 및 조작
이는 단순히 돈을 절약하는 것 이상의 의미를 갖습니다. 서버 구축 방식이 변경됩니다.
마더보드의 죽음
전통적으로 마더보드는 CPU 소켓 2개, DIMM 슬롯 32개로 엄격하게 구성됩니다. 당신은 그 지도에 살고 죽는다. CXL을 사용하면 “마더보드”가 “백플레인”이 됩니다.
- 서랍 1: CPU만(컴퓨팅).
- 서랍 2: RAM만(메모리 풀).
- 서랍 3: GPU(가속기)만.
CXL 스위치를 통해 연결됩니다. 현재 대규모 데이터베이스 컴파일을 위해 서버 A에 1TB의 RAM이 필요한 경우 스위치가 이를 할당합니다. 내일 32GB만 필요한 경우 스위치는 해당 RAM을 회수하여 AI 교육을 위해 서버 B에 제공합니다.
다중 논리 장치(MLD)
CXL 3.0에는 MLD가 도입되어 단일 CXL 메모리 스틱을 분할하여 최대 16개의 호스트에서 동시에 공유할 수 있습니다. 메모리 컨트롤러 내에서 **채널 관리 장치(CHMU)**라는 장치는 트래픽 경찰 역할을 하여 호스트 A가 주소 0x100에 쓸 때 동일한 물리적 주소에 있는 호스트 B의 데이터를 덮어쓰지 않도록 보장합니다(CXL도 지원하는 데이터를 의도적으로 공유하지 않는 한).
업계에 미치는 영향
AI 훈련에 미치는 영향
AI 훈련은 메모리에 묶여 있습니다. H100 및 B200 GPU는 괴물이지만 종종 데이터가 부족합니다. CXL을 사용하면 “근거리 메모리”에 훨씬 더 큰 모델 가중치를 유지할 수 있어 느린 NVMe SSD에서 데이터를 가져올 필요성이 줄어듭니다.
클라우드 가격에 미치는 영향
이러한 효율성은 “스팟 RAM” 인스턴스로 이어질 가능성이 높습니다. AWS에서 스팟 EC2 인스턴스를 구매할 수 있는 것처럼, 곧 옆에 있는 랙의 남은 용량을 사용하여 적은 비용으로 RAM 용량을 동적으로 확장할 수 있습니다.
과제 및 한계
- 지연 시간 페널티: 물리학은 완고합니다. 스위치와 몇 피트의 케이블을 추가하면 나노초가 추가됩니다. CXL 메모리는 로컬 DRAM의 80~100ns에 비해 약 170~250ns의 지연 시간을 갖습니다. SSD보다 빠르지만 로컬 RAM보다 느린 “계층 2” 메모리입니다.
- 신호 무결성: PAM-4 신호는 취약합니다. 64GT/s에서는 단 몇 인치의 PCB 트레이스 후에 신호가 저하됩니다. 복잡한 리타이머와 고품질 케이블링이 필요하므로 초기 비용이 증가합니다.
- 소프트웨어 지원: 운영 체제는 “CXL을 인식”해야 합니다. OS 커널은 “핫” 데이터를 로컬 RAM에 배치하고 “웜” 데이터를 CXL RAM(계층화)에 배치할 수 있을 만큼 똑똑해야 합니다.
미래 예측 분석: 5년 전망
단기: 하이브리드 시대(2025~2026)
시장에서는 SSD처럼 보이지만 RAM을 포함하는 추가 카드인 “CXL 확장기”를 보게 될 것입니다. 이는 표준 서버에 연결되어 512GB 또는 1TB의 저렴한 용량을 추가합니다.
중기: 랙 규모 아키텍처(2027+)
서버 섀시가 사라집니다. 하이퍼스케일러는 “컴퓨팅 브릭”과 “메모리 브릭”을 구매할 것입니다. 데이터 센터는 줄지어 늘어선 피자 상자라기보다는 분산된 리소스가 모여 있는 액체 냉각식 대규모 벌집처럼 보일 것입니다.
“무한한 기억”의 지평선
결국 애플리케이션은 메모리가 어디에 있는지 알 수 없게 됩니다. 애플리케이션은 100TB의 RAM을 요청할 수 있으며, CXL 패브릭은 전체 데이터 센터 층에 걸쳐 고립된 용량에서 이를 하나로 연결합니다.
결론
CXL은 핀과 와이어에 대한 무어의 법칙이 끝났음을 업계가 인정하는 것입니다. 엔지니어는 CPU 소켓에 더 많은 전선을 집어넣을 수 없습니다. 그래서 제조업체들은 파이프를 더 크게 만들려는 노력을 중단하고 대신 더 스마트한 배관 시스템을 구축했습니다.
일반 사용자의 경우 이는 더 저렴하고 빠른 클라우드 서비스를 의미합니다. 엔지니어에게 이는 “메모리 부족” 오류가 종료되었음을 의미합니다. RAM은 무한하지는 않지만 역사상 처음으로 마침내 유동적입니다.
출처 (4)
- computeexpresslink.org CXL 3.0 Specification
- marvell.com 5 Ways CXL Will Transform Computing
- h3platform.com CXL 3.0 Explained
- usenix.org Microsoft Azure: Stranded Memory Stat
🦋 Bluesky 토론
Bluesky에서 토론하기