AMD Helios: GPU 72개와 31TB HBM4로 NVIDIA Rubin에 도전하다
AMD가 Instinct MI455X GPU 72개와 HBM4 31TB를 한 랙에 담은 Helios를 공개했습니다. Vera Rubin NVL72와 비교해 메모리와 네트워크의 차이, AMD가 제시한 FP4·tokens/$ 수치의 조건, 국내 AI 인프라에 주는 의미를 살펴봅니다.
DeepSeek V4 Flash 0731 분석: 284B 모델이 304B로 표시되는 이유
DeepSeek V4 Flash의 7월 31일 공개본은 284B 모델 본체와 DSpark 가중치를 합쳐 약 304B입니다. 13B 활성 파라미터의 의미와 에이전트 성능, DSpark의 원리, 다중 GPU 서빙 조건을 공식 자료로 정리했습니다.
Kimi K3 가중치 공개: 1.56TB 모델 서빙 방법
Kimi K3 96개 safetensors의 실제 용량과 정밀도 구성을 확인하고 104.2B 활성 파라미터, KDA·MLA 캐시와 현실적인 서빙 조건을 분석했습니다.
AI 오케스트레이터란? GPU 클러스터 운영의 2026년 흐름
AI 인프라 오케스트레이션을 인프라, GPU 자원·워크로드, ML 워크플로와 추론으로 나눠 설명합니다. Kubernetes DRA, Kueue, llm-d 등 2026년 동향과 오픈소스·상용제품 선택 기준을 정리했습니다.