inblog logo
|
deep gadget by ManyCoreSoft
  • 딥가젯 바로가기↗️
성능·구축기딥가젯 뉴스

CPU 2,500코어급 CFD 성능을 6U에: STAR-CCM+로 확인한 dg5R

CAD-IT Korea가 dg5R의 RTX PRO 6000 Blackwell GPU 2·4·8장으로 STAR-CCM+ 약 8천만 격자 문제를 측정했다. GPU 8장은 50회 반복 계산을 35.2초에 마쳤다. 6U 액체냉각 서버 한 대에 담긴 성능과 CPU 2,500코어급 환산의 의미를 살펴본다.
MANYCORESOFT's avatar
MANYCORESOFT
Jul 24, 2026
CPU 2,500코어급 CFD 성능을 6U에: STAR-CCM+로 확인한 dg5R
Contents
약 8천만 격자를 어떻게 측정했나GPU를 네 배 늘리자 시간은 4분의 1로 줄었다GPU 8장을 6U 서버 한 대에 담았다CPU 2,500코어급이라는 말의 의미10억 원짜리 CPU 클러스터와 비교하면8장의 GPU를 조용하고 안정적으로 식히려면대형 CFD 계산을 서버 한 대로 옮길 수 있을까참고자료

35.2초. 약 8천만 개의 격자로 구성된 STAR-CCM+ 유동 해석에서 GPU 8장이 기록한 시간이다. CAD-IT Korea는 RTX PRO 6000 Blackwell Server Edition을 탑재한 딥가젯 dg5R에서 GPU 병렬 성능을 측정했다. GPU를 2장에서 8장으로 늘리자 50회 반복 계산에 걸린 시간은 131.4초에서 35.2초로 줄었다. 2장 대비 3.73배 빨라진 결과로, 이상적인 4배 가속의 약 93%에 해당한다. 눈여겨볼 대목은 이 성능이 대형 클러스터가 아니라 6U 서버 한 대에서 나왔다는 점이다.

약 8천만 격자를 어떻게 측정했나

측정 대상은 약 8천만 개의 격자로 구성된 유동 해석 문제였다. STAR-CCM+의 Segregated Solver를 사용하고 10번째부터 60번째까지, 모두 50회 반복 계산에 걸린 시간을 쟀다.

GPU 한 장은 96GB 메모리로도 문제를 실행하지 못했다. 이 규모부터는 여러 GPU의 메모리와 연산 성능이 함께 필요했다.

항목조건
소프트웨어Simcenter STAR-CCM+
SolverSegregated Solver
격자약 8천만 개
GPURTX PRO 6000 Blackwell Server Edition 96GB
구성GPU 2장·4장·8장
측정 구간10~60번째, 50회 반복 계산
GPU 1장메모리 부족으로 실행하지 못함

GPU를 네 배 늘리자 시간은 4분의 1로 줄었다

결과는 GPU 2장 131.4초, 4장 68.4초, 8장 35.2초였다. GPU를 두 배씩 늘릴 때마다 실행시간도 거의 절반으로 줄었다.

STAR-CCM+ 약 8천만 격자 문제에서 GPU 2장 131.4초, 4장 68.4초, 8장 35.2초를 기록한 막대그래프
약 8천만 격자 STAR-CCM+ 해석의 GPU 수별 실행시간. 자료: CAD-IT Korea

실제로 실행된 GPU 2장을 기준으로 계산하면 4장은 1.92배, 8장은 3.73배 빨랐다. 2장에서 8장으로 GPU를 네 배 늘렸을 때 이상적인 가속은 4배다. 실제 가속은 3.73배였으므로 병렬 효율은 약 93%다.

GPU 8장까지 성능이 비교적 고르게 늘었다는 뜻이다. 대규모 CFD 문제에서 GPU를 추가한 만큼 계산시간을 줄일 가능성을 확인했다.

GPU 8장을 6U 서버 한 대에 담았다

dg5R의 매력은 성능 숫자만이 아니다. GPU 8장과 액체냉각 시스템을 6U 섀시 한 대에 담는다.

고성능 GPU와 액체냉각 시스템을 통합한 딥가젯 dg5R 6U 서버 전면
6U 섀시에 고성능 GPU와 액체냉각 시스템을 통합한 dg5R

여러 CPU 서버로 같은 규모의 인프라를 구성하면 서버뿐 아니라 랙, 스위치, 케이블과 관리 지점도 늘어난다. dg5R은 고성능 GPU를 한 섀시에 집약해 이 구성을 단순하게 만든다. 해석 성능을 높이면서 설치 공간과 운영 복잡도까지 함께 줄일 수 있다는 뜻이다.

dg5R은 GPU를 최대 10장까지 탑재한다. 이번 측정은 8장까지만 진행했으므로 10장 구성의 성능은 별도로 확인해야 하지만, 장비를 교체하지 않고 GPU 구성을 확장할 여지는 남아 있다.

CPU 2,500코어급이라는 말의 의미

GPU 8장의 성능을 CPU 규모로 표현하면 제품의 집적도를 더 쉽게 가늠할 수 있다. Siemens는 STAR-CCM+ 2022.1 자료에서 NVIDIA A100 8장의 실행시간을 CPU 2,120코어와 비슷한 수준으로 제시했다. CAD-IT Korea는 기존 해석 인프라 구축 경험을 바탕으로 이번 dg5R 구성을 CPU 약 2,500코어급으로 추산했다.

두 수치는 이번 시험에서 같은 문제를 CPU로 직접 측정한 결과는 아니다. GPU 8장의 성능이 어느 정도 규모의 CPU 인프라에 해당하는지 보여주는 참고값이다.

48코어 CPU 두 개를 탑재한 96코어 서버로 단순 환산하면 2,120~2,500코어는 약 22~26대다. 6U 한 대에 담긴 계산 밀도가 얼마나 높은지 보여주는 비교다.

10억 원짜리 CPU 클러스터와 비교하면

CAD-IT Korea는 CPU 2,500코어급 클러스터의 구축비를 메모리 가격 인상 전 기준 약 10억 원으로 추산했다. 정식 견적은 CPU와 메모리 구성, 라이선스, 네트워크와 스토리지 조건에 따라 달라진다. 그래도 비교가 보여주는 방향은 분명하다.

고성능 GPU를 한 서버에 집약하면 장비 수뿐 아니라 랙 공간, 네트워크 구성과 유지보수 대상을 함께 줄일 수 있다. CFD 인프라를 새로 구축하거나 증설할 때 dg5R을 검토할 이유는 GPU 가격만이 아니라 전체 시스템의 규모가 작아지는 데 있다.

8장의 GPU를 조용하고 안정적으로 식히려면

고성능 GPU 8장을 6U에 넣으려면 연산 성능만큼 냉각 설계가 중요하다. dg5R은 매니코어소프트가 설계한 콜드플레이트로 GPU뿐 아니라 CPU, 메모리와 NIC까지 식힌다.

제품 사양상 소음은 구성과 부하에 따라 30~62dB다. 고성능 공랭 GPU 서버보다 설치 장소의 선택지가 넓어진다. dg5R의 L2A 구성은 시설수 배관 없이도 사용할 수 있다. 다만 서버에서 나온 열은 실내로 배출되므로 공간의 냉방 용량은 확인해야 한다.

장점은 냉각이 사라지는 데 있지 않다. 서버와 액체냉각을 하나의 시스템으로 설계해 고밀도 GPU를 운영하기 쉽게 만드는 데 있다.

대형 CFD 계산을 서버 한 대로 옮길 수 있을까

이번 결과는 약 8천만 격자 문제를 dg5R 한 대에서 실행하고, GPU 2장에서 8장까지 성능이 고르게 늘어나는 것을 확인한 사례다.

모든 STAR-CCM+ 모델이 같은 성능을 내는 것은 아니다. Solver와 격자 구성, 메모리 사용량에 따라 결과가 달라지므로 실제 도입 전에는 대표 모델로 확인하는 편이 정확하다.

매니코어소프트는 대표 해석 모델을 기준으로 필요한 GPU 수와 메모리를 검토하고, dg5R의 서버와 액체냉각 시스템을 함께 구성한다. CFD 계산을 기다리는 시간이 길어지고 CPU 클러스터 증설이 부담스럽다면, dg5R 한 대에 어느 정도까지 담을 수 있는지부터 확인해 볼 수 있다.

참고자료

  • CAD-IT Korea
  • Siemens Simcenter STAR-CCM+ 2022.1
  • Siemens GPU acceleration for CFD simulation
  • NVIDIA RTX PRO 6000 Blackwell Server Edition
  • 딥가젯 dg5R
Share article
Contents
약 8천만 격자를 어떻게 측정했나GPU를 네 배 늘리자 시간은 4분의 1로 줄었다GPU 8장을 6U 서버 한 대에 담았다CPU 2,500코어급이라는 말의 의미10억 원짜리 CPU 클러스터와 비교하면8장의 GPU를 조용하고 안정적으로 식히려면대형 CFD 계산을 서버 한 대로 옮길 수 있을까참고자료

deep gadget by ManyCoreSoft

RSS·Powered by Inblog