inblog logo
|
deep gadget by ManyCoreSoft
  • 딥가젯 바로가기↗️
AI 동향AI인프라 상식

Vera Rubin NVL72: 토큰/MW 10배, 비용 10분의 1의 조건

CoreWeave가 공개한 Vera Rubin NVL72의 첫 실측은 Grace Blackwell NVL72 대비 토큰/MW 최대 10배였다. NVIDIA의 비용 10분의 1 비교는 별도의 Kimi-K2-Thinking 조건이다. 두 수치의 의미와 200kW가 넘는 랙, 45°C 액체냉각이 데이터센터 설계에 미치는 영향을 살펴본다.
MANYCORESOFT's avatar
MANYCORESOFT
Jul 23, 2026
Vera Rubin NVL72: 토큰/MW 10배, 비용 10분의 1의 조건
Contents
GPU가 아니라 랙이 하나의 제품이다추론 성능은 연산기만으로 만들지 못한다팬과 케이블이 사라진 이유200kW가 넘는 랙을 어떻게 식힐까45°C 냉각수는 칠러를 없앨 수 있을까토큰/MW가 사업 지표가 된 이유Vera Rubin을 도입하기 전에 먼저 볼 것참고자료

Vera Rubin NVL72의 첫 성적표는 3.6EFLOPS가 아니라 토큰/MW로 나왔다. CoreWeave는 실제 Vera Rubin NVL72에서 DeepSeek-R1을 실행해 Grace Blackwell NVL72보다 메가와트당 토큰 처리량이 최대 10배 높았다고 발표했다. NVIDIA가 함께 내세운 비용 10분의 1은 별도의 비교다. Kimi-K2-Thinking을 입력 32K·출력 8K로 실행한 조건에서 GB200 NVL72와 비교한 값이다.

두 결과 모두 절대 처리량과 전체 설정은 공개되지 않았다. NVIDIA와 파트너가 공개한 초기 결과라는 한계도 있다. 그래도 새 GPU의 첫 성능 지표가 FLOPS가 아니라 토큰/MW였다는 사실은 중요하다. 전력 한도가 AI 인프라의 실제 생산량을 결정하기 시작했다는 뜻이다.

Kimi-K2-Thinking 입력 32K 출력 8K 조건에서 Vera Rubin NVL72와 Blackwell NVL72의 사용자당 토큰 속도와 메가와트당 처리량을 비교한 NVIDIA 그래프
Kimi-K2-Thinking 32K/8K 조건에서 Vera Rubin NVL72가 메가와트당 토큰 처리량을 최대 10배 높였다고 NVIDIA가 제시한 비교. 출처: NVIDIA Technical Blog

GPU가 아니라 랙이 하나의 제품이다

Vera Rubin NVL72는 Rubin GPU만 바꾼 서버가 아니다. GPU, CPU, NVLink, 네트워크와 냉각을 한 랙 단위로 설계한 시스템이다.

랙 하나에는 Rubin GPU 72개와 Vera CPU 36개가 들어간다. GPU 메모리는 모두 20.7TB이며 HBM4 대역폭은 초당 최대 1,580TB다. 72개 GPU는 NVLink 6으로 연결된다. 랙 전체 NVLink 대역폭은 260TB/s이며 각 GPU는 다른 GPU와 초당 3.6TB로 통신한다.

NVFP4 추론 성능은 최대 3,600PFLOPS, 즉 3.6EFLOPS다. 다만 NVIDIA는 이 값을 변경될 수 있는 예비 사양으로 표시한다.

항목GB200 NVL72Vera Rubin NVL72
GPU72개72개
GPU 메모리약 13.5TB HBM3E20.7TB HBM4
랙 NVLink 대역폭130TB/s260TB/s
GPU당 NVLink1.8TB/s3.6TB/s
냉각액체·공기 혼합100% 액체냉각
랙 전력약 120kW200kW 이상 분석

랙 전력은 NVIDIA 공식 정격이 아니라 공개 설명과 업계 분석을 바탕으로 한 참고값이다. 실제 전력은 구성과 운전 조건에 따라 달라진다.

NVIDIA Vera Rubin NVL72 랙과 NVFP4 추론 성능 3.6EFLOPS, HBM4 20.7TB, 메모리 대역폭 1.6PB/s, scale-up 대역폭 260TB/s를 보여주는 공식 사양 이미지
Vera Rubin NVL72 랙의 주요 사양. 출처: NVIDIA Technical Blog

추론 성능은 연산기만으로 만들지 못한다

Rubin GPU 한 개에는 288GB HBM4와 초당 최대 22TB의 메모리 대역폭이 제공된다. 생성형 AI의 decode 단계에서는 GPU가 토큰을 만들 때마다 모델 가중치와 KV 캐시를 메모리에서 읽는다. 연산기가 빨라도 메모리 공급이 늦으면 토큰 생성 속도는 높아지지 않는다.

Rubin은 메모리 대역폭과 NVLink를 모두 전 세대보다 두 배 이상 높여 이 병목을 줄였다. DeepSeek-R1처럼 expert 간 통신이 많은 MoE 모델에서는 260TB/s NVLink가 특히 중요하다.

NVFP4 성능도 조건을 나눠 봐야 한다. Rubin GPU의 밀집 NVFP4 학습 성능은 35PFLOPS이며, 적응형 압축이 적용되는 추론에서는 최대 50PFLOPS를 제시한다.

Rubin GPU의 224개 SM, 288GB HBM4, 최대 22TB/s 메모리 대역폭과 GPU당 3.6TB/s NVLink 6를 보여주는 NVIDIA 공식 구조도
Rubin GPU는 288GB HBM4, 최대 22TB/s 메모리 대역폭과 GPU당 3.6TB/s NVLink 6를 제공한다. 출처: NVIDIA

팬과 케이블이 사라진 이유

NVIDIA는 Vera Rubin의 컴퓨트 트레이에서 내부 케이블, 냉각 호스와 팬을 없앴으며 조립시간을 수 시간에서 약 1분으로 줄였다고 밝혔다. 컴퓨트 트레이와 NVLink 스위치 트레이까지 액체로 식히기 때문에 서버 내부에서 냉각을 위해 공기를 움직일 필요가 줄었다.

고열유속 GPU뿐 아니라 네트워크와 전력 부품까지 액체로 식히도록 랙 전체의 냉각 경로를 다시 설계했다. Vera Rubin에서는 냉각이 서버에 덧붙이는 설비가 아니라 랙을 구성하는 핵심 부품이 됐다.

200kW가 넘는 랙을 어떻게 식힐까

NVIDIA는 Vera Rubin을 200kW가 넘는 랙으로 설명한다. 공식 제품 페이지에는 아직 전체 랙 정격이 없으며, SemiAnalysis는 Max-Q 약 190kW와 Max-P 약 230kW로 분석한다.

GB200 NVL72 약 120kW, GB300 NVL72 약 140kW, Vera Rubin NVL72 약 190~230kW의 업계 분석값을 비교한 막대그래프
NVL72 세대별 랙 전력 분석. Vera Rubin의 190~230kW는 공식 정격이 아닌 SemiAnalysis 분석 범위다.

기존 120~140kW급 NVL72 시설에 Vera Rubin을 그대로 넣을 수 있다는 뜻은 아니다. 랙을 주문하기 전에 전력 인입, 버스웨이, CDU 용량, 냉각수 유량과 건물의 열 방출 능력을 함께 확인해야 한다.

전력 공급이 제한된 시설에서는 최고 성능보다 와트당 처리량을 우선하는 운전 조건도 검토해야 한다. 다만 Max-Q와 Max-P의 실제 성능 차이는 워크로드로 확인해야 한다.

45°C 냉각수는 칠러를 없앨 수 있을까

Vera Rubin은 최대 45°C의 냉각수 공급 온도를 지원한다. NVIDIA의 공개 예시에서는 45°C로 들어온 냉각수가 약 55°C로 나가며 칩의 열을 옮긴다.

Vera Rubin NVL72와 CDU, 드라이쿨러를 기술 냉각 루프와 시설 냉각 루프로 연결하고 공급 45도와 회수 약 55도를 표시한 구성도
45°C 냉각수와 CDU, 드라이쿨러의 연결. 회수 약 55°C는 NVIDIA가 공개한 예시이며 실제 값은 시스템 조건에 따라 달라진다.

외기가 충분히 낮은 지역에서는 드라이쿨러만으로 열을 방출해 칠러 운전시간과 물 사용량을 줄일 수 있다. 더운 지역이나 외기 조건이 나쁜 날에는 보조 냉동기가 필요할 수 있다. 45°C라는 숫자만으로 연중 무칠러 운전을 보장할 수는 없다.

필요한 유량은 랙의 발열량과 공급·회수 온도 차로 결정된다. 같은 온도 차에서 230kW를 처리하려면 120kW 랙보다 더 큰 유량과 CDU 용량이 필요하다.

45°C 냉각수의 장점은 열이 줄어드는 데 있지 않다. 더 높은 온도의 열을 건물 밖으로 내보낼 수 있어 냉동기에 쓰는 전력과 물을 줄일 수 있다는 데 있다.

토큰/MW가 사업 지표가 된 이유

GPU 성능 경쟁에 토큰/MW라는 사업 지표가 추가됐다. 전력 1MW를 추가로 확보하기 어려운 데이터센터에서는 GPU 한 개의 FLOPS보다 같은 전력으로 몇 개의 토큰을 판매할 수 있는지가 매출에 더 직접적으로 연결된다.

비용 10분의 1도 GPU 구매가격만 비교한 수치가 아니다. 모델, 입력·출력 길이, 지연시간 목표와 전력비를 포함한 특정 추론 조건에서 계산한 값이다. 따라서 도입 검토자는 “이 GPU가 몇 PFLOPS인가”와 함께 “우리 모델과 응답시간 조건에서 MW당 토큰이 얼마나 나오는가”를 물어야 한다.

Vera Rubin을 도입하기 전에 먼저 볼 것

Vera Rubin이 요구하는 순서는 분명하다. GPU 견적보다 먼저 랙당 전력, CDU 용량, 공급 가능한 냉각수 온도와 건물의 열 방출 능력을 확인해야 한다.

매니코어소프트는 2017년부터 45°C 냉각수 조건을 고려한 액체냉각 서버를 개발해 왔다. 콜드플레이트와 서버, 매니폴드, CDU까지 냉각수가 지나는 전체 경로를 직접 설계한다.

HGX 또는 NVL72 도입을 검토한다면 GPU 시스템과 냉각 장비를 따로 조달할 필요가 없다. 매니코어소프트는 공식 파트너사를 통해 HGX와 NVL72 시스템을 공급하고, 필요한 액체냉각 장비와 전력·네트워크 인프라까지 하나의 시스템으로 구축한다.

목표 GPU 수와 랙 전력, 현재 시설의 냉각 조건을 알려 주면 장비 구성부터 CDU 용량과 시설 연계, 설치와 운영까지 턴키 구축 범위를 함께 정할 수 있다.

참고자료

  • NVIDIA, Vera Rubin 가동과 파트너 실측 발표
  • CoreWeave, Vera Rubin NVL72 bring-up and validation
  • NVIDIA Vera Rubin NVL72 공식 사양
  • NVIDIA Technical Blog, Inside the Vera Rubin Platform
  • NVIDIA, 45°C 액체냉각 설계
  • SemiAnalysis, Vera Rubin Extreme Co-Design
Share article
Contents
GPU가 아니라 랙이 하나의 제품이다추론 성능은 연산기만으로 만들지 못한다팬과 케이블이 사라진 이유200kW가 넘는 랙을 어떻게 식힐까45°C 냉각수는 칠러를 없앨 수 있을까토큰/MW가 사업 지표가 된 이유Vera Rubin을 도입하기 전에 먼저 볼 것참고자료

deep gadget by ManyCoreSoft

RSS·Powered by Inblog