Vera Rubin NVL72: 토큰/MW 10배, 비용 10분의 1의 조건
Vera Rubin NVL72의 첫 성적표는 3.6EFLOPS가 아니라 토큰/MW로 나왔다. CoreWeave는 실제 Vera Rubin NVL72에서 DeepSeek-R1을 실행해 Grace Blackwell NVL72보다 메가와트당 토큰 처리량이 최대 10배 높았다고 발표했다. NVIDIA가 함께 내세운 비용 10분의 1은 별도의 비교다. Kimi-K2-Thinking을 입력 32K·출력 8K로 실행한 조건에서 GB200 NVL72와 비교한 값이다.
두 결과 모두 절대 처리량과 전체 설정은 공개되지 않았다. NVIDIA와 파트너가 공개한 초기 결과라는 한계도 있다. 그래도 새 GPU의 첫 성능 지표가 FLOPS가 아니라 토큰/MW였다는 사실은 중요하다. 전력 한도가 AI 인프라의 실제 생산량을 결정하기 시작했다는 뜻이다.
GPU가 아니라 랙이 하나의 제품이다
Vera Rubin NVL72는 Rubin GPU만 바꾼 서버가 아니다. GPU, CPU, NVLink, 네트워크와 냉각을 한 랙 단위로 설계한 시스템이다.
랙 하나에는 Rubin GPU 72개와 Vera CPU 36개가 들어간다. GPU 메모리는 모두 20.7TB이며 HBM4 대역폭은 초당 최대 1,580TB다. 72개 GPU는 NVLink 6으로 연결된다. 랙 전체 NVLink 대역폭은 260TB/s이며 각 GPU는 다른 GPU와 초당 3.6TB로 통신한다.
NVFP4 추론 성능은 최대 3,600PFLOPS, 즉 3.6EFLOPS다. 다만 NVIDIA는 이 값을 변경될 수 있는 예비 사양으로 표시한다.
| 항목 | GB200 NVL72 | Vera Rubin NVL72 |
|---|---|---|
| GPU | 72개 | 72개 |
| GPU 메모리 | 약 13.5TB HBM3E | 20.7TB HBM4 |
| 랙 NVLink 대역폭 | 130TB/s | 260TB/s |
| GPU당 NVLink | 1.8TB/s | 3.6TB/s |
| 냉각 | 액체·공기 혼합 | 100% 액체냉각 |
| 랙 전력 | 약 120kW | 200kW 이상 분석 |
랙 전력은 NVIDIA 공식 정격이 아니라 공개 설명과 업계 분석을 바탕으로 한 참고값이다. 실제 전력은 구성과 운전 조건에 따라 달라진다.
추론 성능은 연산기만으로 만들지 못한다
Rubin GPU 한 개에는 288GB HBM4와 초당 최대 22TB의 메모리 대역폭이 제공된다. 생성형 AI의 decode 단계에서는 GPU가 토큰을 만들 때마다 모델 가중치와 KV 캐시를 메모리에서 읽는다. 연산기가 빨라도 메모리 공급이 늦으면 토큰 생성 속도는 높아지지 않는다.
Rubin은 메모리 대역폭과 NVLink를 모두 전 세대보다 두 배 이상 높여 이 병목을 줄였다. DeepSeek-R1처럼 expert 간 통신이 많은 MoE 모델에서는 260TB/s NVLink가 특히 중요하다.
NVFP4 성능도 조건을 나눠 봐야 한다. Rubin GPU의 밀집 NVFP4 학습 성능은 35PFLOPS이며, 적응형 압축이 적용되는 추론에서는 최대 50PFLOPS를 제시한다.
팬과 케이블이 사라진 이유
NVIDIA는 Vera Rubin의 컴퓨트 트레이에서 내부 케이블, 냉각 호스와 팬을 없앴으며 조립시간을 수 시간에서 약 1분으로 줄였다고 밝혔다. 컴퓨트 트레이와 NVLink 스위치 트레이까지 액체로 식히기 때문에 서버 내부에서 냉각을 위해 공기를 움직일 필요가 줄었다.
고열유속 GPU뿐 아니라 네트워크와 전력 부품까지 액체로 식히도록 랙 전체의 냉각 경로를 다시 설계했다. Vera Rubin에서는 냉각이 서버에 덧붙이는 설비가 아니라 랙을 구성하는 핵심 부품이 됐다.
200kW가 넘는 랙을 어떻게 식힐까
NVIDIA는 Vera Rubin을 200kW가 넘는 랙으로 설명한다. 공식 제품 페이지에는 아직 전체 랙 정격이 없으며, SemiAnalysis는 Max-Q 약 190kW와 Max-P 약 230kW로 분석한다.
기존 120~140kW급 NVL72 시설에 Vera Rubin을 그대로 넣을 수 있다는 뜻은 아니다. 랙을 주문하기 전에 전력 인입, 버스웨이, CDU 용량, 냉각수 유량과 건물의 열 방출 능력을 함께 확인해야 한다.
전력 공급이 제한된 시설에서는 최고 성능보다 와트당 처리량을 우선하는 운전 조건도 검토해야 한다. 다만 Max-Q와 Max-P의 실제 성능 차이는 워크로드로 확인해야 한다.
45°C 냉각수는 칠러를 없앨 수 있을까
Vera Rubin은 최대 45°C의 냉각수 공급 온도를 지원한다. NVIDIA의 공개 예시에서는 45°C로 들어온 냉각수가 약 55°C로 나가며 칩의 열을 옮긴다.
외기가 충분히 낮은 지역에서는 드라이쿨러만으로 열을 방출해 칠러 운전시간과 물 사용량을 줄일 수 있다. 더운 지역이나 외기 조건이 나쁜 날에는 보조 냉동기가 필요할 수 있다. 45°C라는 숫자만으로 연중 무칠러 운전을 보장할 수는 없다.
필요한 유량은 랙의 발열량과 공급·회수 온도 차로 결정된다. 같은 온도 차에서 230kW를 처리하려면 120kW 랙보다 더 큰 유량과 CDU 용량이 필요하다.
45°C 냉각수의 장점은 열이 줄어드는 데 있지 않다. 더 높은 온도의 열을 건물 밖으로 내보낼 수 있어 냉동기에 쓰는 전력과 물을 줄일 수 있다는 데 있다.
토큰/MW가 사업 지표가 된 이유
GPU 성능 경쟁에 토큰/MW라는 사업 지표가 추가됐다. 전력 1MW를 추가로 확보하기 어려운 데이터센터에서는 GPU 한 개의 FLOPS보다 같은 전력으로 몇 개의 토큰을 판매할 수 있는지가 매출에 더 직접적으로 연결된다.
비용 10분의 1도 GPU 구매가격만 비교한 수치가 아니다. 모델, 입력·출력 길이, 지연시간 목표와 전력비를 포함한 특정 추론 조건에서 계산한 값이다. 따라서 도입 검토자는 “이 GPU가 몇 PFLOPS인가”와 함께 “우리 모델과 응답시간 조건에서 MW당 토큰이 얼마나 나오는가”를 물어야 한다.
Vera Rubin을 도입하기 전에 먼저 볼 것
Vera Rubin이 요구하는 순서는 분명하다. GPU 견적보다 먼저 랙당 전력, CDU 용량, 공급 가능한 냉각수 온도와 건물의 열 방출 능력을 확인해야 한다.
매니코어소프트는 2017년부터 45°C 냉각수 조건을 고려한 액체냉각 서버를 개발해 왔다. 콜드플레이트와 서버, 매니폴드, CDU까지 냉각수가 지나는 전체 경로를 직접 설계한다.
HGX 또는 NVL72 도입을 검토한다면 GPU 시스템과 냉각 장비를 따로 조달할 필요가 없다. 매니코어소프트는 공식 파트너사를 통해 HGX와 NVL72 시스템을 공급하고, 필요한 액체냉각 장비와 전력·네트워크 인프라까지 하나의 시스템으로 구축한다.
목표 GPU 수와 랙 전력, 현재 시설의 냉각 조건을 알려 주면 장비 구성부터 CDU 용량과 시설 연계, 설치와 운영까지 턴키 구축 범위를 함께 정할 수 있다.