AMD는 역대 최대 규모의 AI 기술 혁신 행사(Advancing AI event)를 개최하고 확장성을 핵심 테마로 강조했습니다. 이 행사에서 AMD는 Instinct MI455X GPU, 72개 GPU로 구성된 Helios 랙, 그리고 6세대 EPYC Venice CPU를 공개했습니다. MI455X는 432GB의 HBM4 메모리를 탑재했는데, 이는 NVIDIA의 B300이나 Rubin보다 50% 증가한 용량입니다. 또한 23.3TB/s의 메모리 대역폭과 최대 40.26 PFLOPS의 MXFP4 연산 성능을 제공합니다. Helios 랙은 이러한 성능을 72개 GPU로 확장하여 2.9 exaFLOPS의 FP4 연산 성능, 31TB의 HBM4 메모리, 1.7PB/s의 메모리 대역폭, 260TB/s의 확장성, 그리고 43TB/s의 확장 대역폭을 데이터센터에 제공합니다. AMD는 모든 지표에서 업계를 선도하는 것을 목표로 하고 있습니다. 이 글에서는 MI455X와 Helios에 대해 자세히 살펴보고, Venice 출시에 대한 분석은 별도로 다룹니다.
또 다른 핵심 테마는 개방성으로, 인터커넥트부터 시작하여 모든 계층에 적용됩니다. 랙 내부에서는 72개의 GPU가 모두 UALink를 통해 메모리를 공유합니다. UALink는 AMD가 이더넷에서 UALink-over-Ethernet(UALoE)으로 실행하는 개방형 컨소시엄 패브릭입니다. 랙을 벗어나는 트래픽은 Ultra Ethernet Consortium의 개방형 스케일아웃 표준인 Ultra Ethernet을 통해 전송됩니다. 동일한 Instinct 아키텍처가 스택 전체에 적용됩니다. 저정밀 연산은 OCP의 개방형 MXFP4, MXFP6, MXFP8 데이터 형식을 사용하며, 이 모든 것을 수용하는 랙은 Open Compute Project의 Open Rack Wide 설계에 따라 구축되었습니다. 소프트웨어 또한 개방형으로 개발되어 ROCm의 컴파일러, 런타임 및 라이브러리 모두 소스 코드로 제공됩니다.
현재 스택의 모든 사양이 공개되어 다운로드 가능하기 때문에 하이퍼스케일러는 Helios를 청사진으로 활용하여 네트워킹, 전력 공급 또는 관리 기능을 자체 시설 및 워크로드에 맞게 조정한 맞춤형 버전을 구축할 수 있습니다. 즉, 이 글에서 다루는 모든 내용은 AMD가 공개한 레퍼런스 디자인을 기반으로 하며, 고객이 배포하는 실제 제품은 상당히 다를 수 있습니다. AMD에 따르면 OpenAI, Meta, Anthropic, Microsoft , Oracle 등 여러 기업이 이미 Helios를 도입할 예정입니다.
AMD Instinct MI455X: CDNA 5 플래그십
MI455X는 3200억 개의 트랜지스터로 구성된 최초의 CDNA 5 가속기입니다. MI455X는 TSMC의 N2 노드에서 제작된 8개의 가속기 복합 다이(XCD)와 N3 노드에서 제작된 2개의 I/O 다이, 2개의 패브릭 및 캐시 다이, 그리고 12개의 HBM4 스택을 특징으로 합니다. 이는 TSMC의 CoWoS-L 패키징으로 제작된 칩 중 가장 큰 규모입니다.
메모리는 주요 특징 중 하나입니다. 12개의 HBM4 스택은 총 432GB 용량에 23.3TB/s의 처리 속도를 제공하며, HBM4는 스택당 인터페이스를 2,048비트로 두 배로 늘렸습니다. 또한 두 개의 패브릭 및 캐시 다이는 54TB/s의 속도로 작동하는 192MB L2 캐시를 추가합니다.
MI455X는 I/O 성능에서도 부족함이 없습니다. 3.6TB/s의 양방향 확장 대역폭을 제공하는 72레인의 UALoE를 탑재하여 랙 내 다른 장치들과의 연결을 지원하고, 호스트 CPU와의 양방향 연결에는 256GB/s의 Infinity Fabric을 제공하며, 확장성을 위해 두 개의 PCIe Gen6 x16 링크 또는 세 개의 AMD AI-NIC 중에서 선택할 수 있습니다.
MI455X는 기존 칩 및 NVIDIA 제품과 비교했을 때 모든 면에서 우위를 점합니다.
| 스펙 | AMD MI455X | 엔비디아 루빈 | AMD MI355X | 엔비디아 B300 |
|---|---|---|---|---|
| 아키텍처 | 씨디엔에이 5 | 루빈 | 씨디엔에이 4 | 블랙웰 울트라 |
| 트랜지스터 | 320B | 336B | 185B | 208B |
| HBM 용량 | 432GB HBM4 | 288GB HBM4 | 288GB HBM3E | 288GB HBM3E |
| HBM 대역폭 | 23.3TB/초 | 22TB/초 | 8TB/초 | 8TB/초 |
| GPU별 확장 | 3.6TB/초 | 3.6TB/초 | 1.08TB/초 | 1.8TB/초 |
| GPU별 스케일아웃 | 2,400 Gb / s | 1,600 Gb / s | 400 Gb / s | 800 Gb / s |
| CPU-GPU 링크 | 256GB/s 인피니티 패브릭 | 1.8TB/s C2C (1:2) | PCIe 5 | 900GB/s C2C (1:2) |
먼저 AMD의 강점부터 살펴보겠습니다. MI455X는 432GB의 HBM 메모리를 탑재하여 MI355X, B300, Rubin(모두 최대 288GB)보다 50% 더 많은 용량을 자랑합니다. 또한 23.3TB/s의 메모리 대역폭 역시 동급 최고 수준입니다. 스케일아웃 성능에서도 우위를 점합니다. GPU당 2,400Gbit/s의 네트워크 대역폭을 제공하는 MI455X는 Rubin(1,600Gbit/s)과 B300(800Gbit/s)을 크게 앞섭니다. 모든 MI455X는 경쟁 제품보다 50% 더 높은 네트워크 대역폭을 제공합니다.
AMD는 마침내 스케일업에서도 NVIDIA를 따라잡았습니다. NVLink는 수년간 GPU 패브릭 분야에서 선두를 달렸고, 두 세대 동안 WideEP를 지원하는 MoE 모델에서 최고 성능을 구현하는 유일한 방법이었습니다. UALoE는 단 한 세대 만에 그 격차를 좁혔습니다. MI455X는 3.6TB/s의 속도로 Rubin의 NVLink 6와 동등한 성능을 제공합니다. 하지만 호스트 링크에서는 NVIDIA가 여전히 확실한 우위를 점하고 있습니다. Vera CPU 하나는 1.8TB/s의 C2C 연결을 통해 두 개의 Rubin GPU에 데이터를 공급하는 반면, 각 MI455X는 256GB/s의 Infinity Fabric 링크를 통해 Venice 호스트와 통신합니다. 이러한 차이는 이 글 후반부에서 두 랙 아키텍처의 차이점을 설명하는 데 중요한 역할을 합니다.
순수 연산 능력 면에서 MI455X는 전반적으로 우위를 점하지만, 한 가지 유의할 점은 AMD의 OCP MX 포맷과 NVIDIA의 NVFP4 포맷은 확장성이 다르므로 이러한 수치는 광고된 최대 성능으로 간주해야 하며, 실제 성능은 별개의 문제라는 것입니다.
| 옵션 | AMD MI455X | 엔비디아 루빈 | AMD MI355X | 엔비디아 B300 |
|---|---|---|---|---|
| MXFP4 / NVFP4 | 40.26PF | 35PF | 10.1PF | 15PF |
| MXFP6 / FP6 | 20.13PF | 17.5PF | 10.1PF | 5PF |
| MXFP8 / FP8 | 20.13PF | 17.5PF | 5PF | 5PF |
| FP16 / BF16 | 5.03PF | 4PF | 2.5PF | 2.5PF |
| FP32 | 315 TF | 130 TF | 157.3 TF | 75 TF |
MI355X 대비 MI455X는 MXFP4 및 MXFP8 처리량은 4배, FP16/BF16 및 FP32 처리량은 2배 더 높습니다. NVIDIA와의 비교는 두 부분으로 나눌 수 있습니다. B300과 비교했을 때 MI455X는 FP4 처리량이 2.7배, FP6 및 FP8 처리량은 4배 더 높습니다. Rubin 벤치마크에서 MI455X는 FP4에서 15%, FP6 및 FP8에서 15%, FP16/BF16에서 26%의 일관된 우위를 보입니다. 가장 큰 격차는 FP32에서 나타나는데, MI455X의 315 TF는 Rubin의 130 TF보다 약 2.4배, B300의 75 TF보다 4배 이상 높습니다. 해당 수치는 Instinct의 HPC 계열에서 나온 것이며, 마스터 가중치, 고정밀 누적 및 과학적 워크로드가 저비트 형식보다 높은 해상도에서 계속 실행되기 때문에 AI 작업에 여전히 중요합니다.
CDNA 5 내부
이제 아키텍처를 자세히 살펴보고 이 업계 최고 수준의 성능을 가능하게 하는 요소가 무엇인지 알아보겠습니다.
XCD에서 SIMD로
패키지부터 아래로 계층 구조를 살펴보면 CDNA 4가 컴퓨트 다이를 완전히 다른 방식으로 구성했기 때문에 얼마나 많은 부분이 재구축되었는지 알 수 있습니다. MI355X에서는 각 XCD에 32개의 활성 컴퓨트 유닛과 인피니티 패브릭에 도달하기 전에 다이의 트래픽을 통합하는 4MB의 전용 L2 캐시가 있었습니다. CDNA 5는 8개의 XCD는 유지하지만 내부 구성은 AMD의 RDNA 그래픽 라인에서 구조와 용어를 차용하여 재구축했습니다. 이제 각 MI455X XCD는 두 개의 셰이더 엔진으로 나뉩니다. 각 셰이더 엔진은 물리적으로 17개의 워크 그룹 프로세서를 가지며, 이 중 16개는 활성화되고 하나는 수율 향상을 위한 예비 부품입니다. XCD별 L2 캐시는 완전히 사라지고 컴퓨트 다이에서 분리되어 아래쪽 베이스 다이로 이동했으며, 메모리 섹션은 다시 베이스 다이로 돌아갑니다.
중요한 것은 변하지 않은 부분입니다. XCD는 여전히 32개의 활성 유닛을 제공하고, GPU는 MI355X와 동일한 256개의 컴퓨팅 유닛을 보유하고 있습니다. 저정밀도 처리량의 4배 향상은 실행 유닛 추가 때문이 아니라, 각 WGP가 사이클당 더 많은 작업을 처리하기 때문이며, 이번 재설계의 핵심은 바로 이 WGP에 있습니다.
WGP는 32레인 SIMD 유닛 4개와 상수 캐시를 공유하는 스칼라 유닛 4개로 구성됩니다. 가장 큰 변화는 스레드 처리 방식, 즉 Wave64에서 Wave32로의 전환입니다. 웨이브는 SIMD가 동기화되어 실행되는 스레드 묶음입니다. CDNA 4는 Wave64를 사용하여 64개의 스레드로 이루어진 웨이브를 16레인 SIMD를 통해 4클럭 사이클에 걸쳐 처리했습니다. CDNA 5는 Instinct 아키텍처 중 최초로 Wave64 지원을 완전히 중단하고 Wave32를 네이티브로 실행합니다. 32개의 스레드로 이루어진 웨이브는 WGP의 32레인 SIMD 유닛 4개 각각에 1:1로 매핑되어 단일 사이클에 명령을 실행하고, 모든 SIMD가 매 클럭마다 새로운 명령어를 시작할 수 있도록 합니다.
더 좁고 빠른 웨이브는 머신에서 작업이 이동하는 방식을 변화시킵니다. 웨이브가 더 빨리 완료되므로 명령어 지연 시간이 줄어듭니다. 분기 분기 시 발생하는 비용이 감소하는데, 분기 실행 여부에 따라 최대 32개의 스레드만 지연되기 때문입니다(이전에는 64개 스레드에서 감소). 레지스터 부하가 완화되어 더 많은 웨이브가 상주하게 되며, WGP당 최대 64개까지 상주 가능합니다(이전에는 절반 수준). 이를 통해 스케줄러는 메모리 지연 시간을 숨길 수 있는 더 작고 독립적인 작업 단위를 더 많이 확보할 수 있습니다. 또한 Wave32는 텐서 연산에 대해 다양한 타일 크기를 하드웨어에 매핑하는 것을 더 쉽게 만들어 커널 개발을 간소화합니다.
Single-cycle issue is only the start of the throughput story. The SIMDs co-execute, starting new instructions while earlier multi-cycle operations drain underneath, and packed vector instructions carry 64 threads' worth of work in a single issue, details AMD's architects confirmed in the post-briefing Q&A. The vector pipeline also gains native BF16 support and a set of new data-conversion instructions for moving tensors between formats. The transcendental units double their throughput over the MI355X and add a native tanh instruction, so the softmax and activation math inside attention keeps pace with the tensor hardware around it. That path is becoming a habit: CDNA 4 doubled the transcendental rates to accelerate attention, and CDNA 5 doubles them again.
메모리 계층 구조
실행 장치 뒤에는 위에서 아래로 재구축된 계층 구조가 있으며, 이를 가장 명확하게 확인하는 방법은 MI355X와 비교하여 단계별로 살펴보는 것입니다.
| 레벨 | MI455X (CDNA 5) | MI355X (CDNA 4) |
|---|---|---|
| 벡터 레지스터 | SIMD당 128KB, 스레드당 1,024KB, 대역폭 2배 | SIMD당 128KB, 스레드당 256KB |
| WGP/CU 지역 매장 | 384KB (320KB LDS + 64KB 벡터 캐시); 대역폭 2배 | 192KB (LDS 160KB + L1 32KB) |
| 명령어/상수 캐시 | 64KB + WGP당 16KB | CU 두 개당 64KB 공유 + 16KB |
| L2 | FCD에 2 × 96MB, 54TB/s | 8 × 4MB, XCD당 하나씩 |
| 메모리 측 캐시 | 탈락 | 256MB 인피니티 캐시 |
| HBM | 432GB HBM4; 12 × 2,048비트 스택; 23.3TB/s | 288GB HBM3E; 8 × 1,024비트 스택; 8TB/s |
캐시 행은 아키텍처의 형태가 바뀐 부분입니다. CDNA 4는 3단계 설계를 사용했습니다. 각 XCD의 전용 4MB L2 캐시는 해당 다이의 트래픽을 인피니티 패브릭에 도달하기 전에 통합했고, I/O 다이에 있는 공유 256MB 인피니티 캐시는 HBM 컨트롤러 앞의 메모리 쪽에 위치했습니다. CDNA 5는 이 두 계층을 모두 제거하고 패브릭 다이와 캐시 다이 각각에 하나씩, 총 두 개의 독립적인 96MB L2 캐시로 대체했습니다. 각 캐시는 1MB 블록 96개로 구성됩니다. 레이아웃은 수직형입니다. 4개의 XCD(8개의 셰이더 엔진)가 각 FCD 위에 하이브리드 본딩 방식으로 결합되어 있으며, FCD에는 12개의 HBM4 사이트 중 6개가 포함됩니다. 두 개의 FCD는 패키지 중앙의 인피니티 패브릭에서 만나고, I/O 다이가 양쪽 끝을 덮습니다. 두 L2 캐시 모두 GPU 메모리의 임의의 주소를 저장할 수 있으며, 인피니티 패브릭은 두 캐시 쌍의 일관성을 유지합니다. AMD가 밝힌 이유는 대역폭입니다. 이 캐시 하나만으로 MI355X의 전체 인피니티 캐시보다 1.5배 높은 대역폭을 제공하고, 두 개를 함께 사용하면 3배 높은 대역폭을 제공하며, 이러한 트래픽은 기존 레이아웃의 한계였던 다이 간 대역폭 분할을 거치지 않아도 됩니다.
캐시는 새로운 역할도 수행합니다. 이전에는 패브릭 외부에서 실행되던 디바이스 범위의 원자 연산은 이제 L2 캐시 내부에서 훨씬 빠른 속도로 실행되며, 시스템 범위의 원자 연산은 이전처럼 인피니티 패브릭에 유지됩니다. 새로운 브로드캐스트 아비터가 추가되어 동일한 행렬을 사용하는 모든 WGP에 텐서 타일을 멀티캐스팅합니다. 따라서 한 번만 가져온 가중치로 모든 WGP를 처리할 수 있으므로 유효 읽기 대역폭이 최대 4배까지 향상됩니다.
위의 레벨들은 이에 맞춰 확장됩니다. WGP별 로컬 스토리지는 384KB로 두 배가 되며, 320KB의 LDS와 64KB의 벡터 데이터 캐시로 나뉘어지고 읽기 대역폭도 두 배가 됩니다. 이를 통해 FlashAttention은 전체 어텐션 매트릭스를 칩에 기록하는 대신 쿼리, 키, 값 및 부분 축소 값을 칩에 저장할 수 있습니다. 또한 라우팅 상태와 누산기를 상주 상태로 유지하는 융합 MoE 커널을 지원합니다. 벡터 레지스터 파일은 SIMD당 128KB 용량을 유지하지만 Wave32에 맞게 재구성됩니다. 결과적으로 웨이브 수가 두 배로 늘어나고, 단일 스레드가 256개가 아닌 1,024개의 레지스터를 처리할 수 있으며, 레지스터 대역폭이 두 배로 증가하여 더 넓은 SIMD와 해당 공동 실행 장치에 데이터를 공급할 수 있습니다.
스칼라 측은 웨이브당 128개의 스칼라 레지스터와 WGP당 32KB로 재구축되었습니다. 기본적으로 HBM4는 8개의 1,024비트 스택에서 12개의 2,048비트 스택으로 변경되어 용량이 50% 증가한 432GB, 대역폭은 2.9배 증가한 23.3TB/s를 192채널 인터페이스에서 제공합니다.
이 모든 것을 지원하는 것은 WGP당 하나씩 탑재된 새로운 텐서 데이터 무버(Tensor Data Mover)입니다. 이 무버는 최대 5차원의 텐서 타일링 방식을 이해하고, 중간 레지스터 스테이징 없이 DRAM과 로컬 스토어 간에 타일을 비동기적으로 스트리밍합니다. 전송은 스칼라 레지스터에서 로드된 디스크립터로 설명되며, 보안을 위해 하드웨어에서 경계 검사를 수행합니다. 멀티캐스트 로드가 지원되므로 SIMD 장치는 복사를 기다리거나 레지스터를 스테이징하는 동안 멈추지 않습니다. 이는 최근 NVIDIA 부품의 텐서 메모리 가속기에 대한 CDNA 5의 해답입니다. 다양한 활용 기능들이 시스템의 프런트엔드를 완성합니다. 워크그룹 클러스터는 데이터 공유 워크로드에 대한 배치 및 동시성을 커널이 명시적으로 제어할 수 있도록 하고, 분할 및 명명된 배리어는 생산자가 완료를 알리고 소비자의 응답을 기다리지 않고 다음 단계로 넘어갈 수 있도록 하며, 계층 구조의 각 레벨에 있는 프리페처는 데이터를 소비 지점으로 스테이징하고, 재설계된 명령 프런트엔드는 추론을 주로 하는 짧은 커널의 커널 시작 및 디스패치 지연 시간을 단축합니다.
DMA 시스템은 동일한 철학을 기반으로 재구축되었습니다. 소프트웨어는 DMA 프런트 엔드를 대상으로 전송 스케줄링을 수행하고, UALoE 링크 옆에 위치한 물리적으로 연결된 백 엔드는 각 작업 항목을 분할하고, 사용 가능한 모든 링크에 걸쳐 로드 밸런싱하며, 데이터를 칩을 거쳐 멀리 떨어진 엔진으로 전송하는 대신 메모리에서 버퍼를 직접 가져옵니다. 또한 백 엔드는 확장되는 네트워크에서 발생하는 혼잡 압력에 반응하여 부하가 걸린 경로를 우회하므로, 통신 라이브러리는 기본 토폴로지를 이해하지 않고도 균형 잡힌 패브릭 트래픽을 얻을 수 있습니다.
GPU 성능 분석: NPS 및 SR-IOV
두 개의 L2 캐시를 사용하는 물리적 레이아웃은 GPU 분할 방식에서도 두 번째 이점을 제공합니다. NPS1에서는 칩 전체가 하나의 NUMA 도메인으로 구성되어 주소가 12개의 HBM 스택과 양쪽 절반에 걸쳐 분산되어 균일한 대역폭을 제공하고, 이식성을 높이며, 액세스 패턴을 고르게 분산시킵니다. NPS2에서는 GPU가 두 개의 NUMA 도메인으로 분할되며, 각 도메인은 6개의 HBM 스택, 하나의 패브릭 및 캐시 다이, 그리고 그 위에 쌓인 XCD를 소유합니다. 따라서 모든 메모리 참조는 각 도메인 내에 유지되며, 각 도메인은 사실상 96MB의 전용 L2 캐시를 갖게 됩니다. 이는 물리적 경로를 단축하는 것 이상의 효과를 가져옵니다. 양쪽 절반 사이에 캐시 라인을 공유하지 않으므로 두 L2 캐시 간의 인피니티 패브릭 일관성 트래픽이 크게 줄어들고, AMD는 이를 통해 NUMA를 인식하는 애플리케이션에서 지연 시간이 단축되고 효율성이 향상된다고 설명합니다. CDNA 4는 NPS2를 통해 트래픽을 하나의 I/O 다이 내에 유지하는 방식으로 전반적인 트레이드오프를 제공했지만, CDNA 5는 이제 메모리 측 버퍼의 일부가 아닌 전체 L2 캐시를 로컬화함으로써 이를 더욱 정교하게 다듬었습니다.
컴퓨팅 파티셔닝 스택이 그 위에 구축됩니다. 8개의 XCD를 통해 GPU는 1개, 2개, 4개 또는 8개의 공간 파티션으로 부팅할 수 있으며, 432GB의 HBM을 432GB, 216GB, 108GB 또는 54GB의 균등한 조각으로 나누고 각 조각을 8개의 XCD로 백업합니다. 파티션을 NUMA 도메인과 연결하면 런타임이 작업을 공간적으로 분배하고 할당을 배치할 수 있으므로 작업은 메모리에 가장 가까운 XCD에 할당됩니다. SR-IOV는 파티션을 최대 8개의 하드웨어 격리된 가상 머신으로 가상화하며, 격리는 실행 중인 NUMA 모드와 관계없이 메모리 시스템 자체에서 적용됩니다. MI355X도 동일한 1~8개의 파티션 옵션을 제공했으므로 이러한 세분화는 새로운 것이 아닙니다. CDNA 5에서 추가된 것은 그 아래에 있는 프라이빗 L2 동작과 그 위에 있는 Helios 섹션에서 다루는 랙 수준의 가상 포드입니다.
AMD 헬리오스
MI455X 단일 프로세서도 빠르지만, 이번 출시로 AMD는 랙 스케일 및 대규모 확장 분야에 진출하게 되었습니다.
물리적으로, 헬리오스는 기존의 19인치 및 21인치 랙 대신 AMD가 OCP에서 메타와 함께 개발한 오픈 랙 와이드(Open Rack Wide) 포맷을 채택했습니다. 이 포맷은 너비 1.2미터, 깊이 1.3미터의 캐비닛으로, 수직 공간은 44 OU입니다. 내부에는 72개의 GPU가 9개의 컴퓨팅 트레이로 구성된 두 개의 뱅크에 배치되고, 그 사이에 6개의 스위치 트레이가 쌓입니다. 모든 GPU-스위치 연결은 후면의 4개 블라인드 메이트 케이블 카트리지를 통해 구리선으로 연결되어 있어, 트레이를 쉽게 빼낼 수 있고 케이블을 손으로 뽑을 필요가 없습니다.
전체 랙은 작업 부하에 따라 225~245kW의 전력을 소비하며, 50V 액체 냉각 버스바를 통해 전력이 공급됩니다. 후면 매니폴드는 설비 순환 시스템에서 분당 약 385리터의 냉각수를 공급합니다. 트레이 자체는 상당한 무게를 자랑하는 하드웨어입니다. 각 트레이의 무게는 약 170파운드(약 77kg)이며, 1,728개의 차동 쌍 연결부를 트레이에 장착하려면 약 690파운드(약 316kg)의 삽입력이 필요합니다. 이러한 이유로 캠 핸들은 트레이의 거의 전체 너비에 걸쳐 있습니다.
빌딩 블록
컴퓨팅 트레이
레퍼런스 디자인에서 각 컴퓨팅 트레이는 4개의 MI455X 모듈과 최대 5GHz로 부스트되는 고주파수 96코어 Venice SP7 CPU를 중심으로 구축된 독립형 노드입니다. 16개의 DIMM 소켓에는 16개의 64GB DDR5 ECC RDIMM을 장착하여 총 1TB의 DRAM을 저장할 수 있으며, CPU에는 5개의 E1.S NVMe 슬롯이 있습니다. 이 플랫폼은 훨씬 더 높은 성능을 지원합니다. Venice의 16개 메모리 채널은 최대 1.6TB/s의 대역폭을 지원하며, 현재 DDR5 제품군 중 최고 사양인 256GB RDIMM을 사용할 경우, 채널당 1개의 DIMM을 장착한 16채널 소켓은 최대 4TB까지 확장 가능합니다.
NVIDIA의 방식을 따라, CPU는 일반 PCIe 호스트처럼 GPU 뒤에 위치하는 대신 Infinity Fabric을 통해 일관된 메모리 도메인에 직접 참여합니다. AMD는 1:4의 CPU 대 GPU 비율을 의도적으로 채택했다고 주장합니다. 코어 자체의 성능이 경쟁 제품을 능가하며, AMD의 동일 조건 비교 추정치에 따르면 5GHz Zen 6 코어는 코어당 성능에서 NVIDIA Vera보다 약 20% 앞서 있습니다. 또한 소켓이 표준 SP7이기 때문에 더 많은 호스트 컴퓨팅 성능을 원하는 고객은 최대 256코어 플래그십 모델까지 모든 Venice SKU를 장착할 수 있습니다. Venice 소켓 하나는 LPDDR 호스트 설계보다 훨씬 더 많은 DDR5 메모리 용량을 제공하며, 메모리 대역폭은 Infinity Fabric 링크를 통해 4개의 GPU 모두에 최대치로 공급됩니다.
인피니티 패브릭 링크는 좀 더 자세히 살펴볼 가치가 있습니다. 칩스 앤 치즈(Chips and Cheese) 의 조지 코즈마와 베니스(Venice)와 MI455X 연결에 대해 이야기를 나누던 중 , 그는 코히런트 링크가 CPU의 PCIe 레인을 활용한다고 제안했습니다. 이는 EPYC가 수년 동안 xGMI 소켓 링크를 PCIe PHY를 통해 전송해 온 방식과 유사합니다. 수치상으로도 이 이론이 뒷받침됩니다. PCIe 6세대 신호는 레인당 64Gb/s이며, 이 속도의 x16 링크는 양방향으로 128GB/s에 해당합니다. 이는 AMD가 GPU당 제시한 양방향 256GB/s와 정확히 일치합니다. CDNA 5 백서의 블록 다이어그램에서도 호스트 인피니티 패브릭 인터페이스는 레인당 64Gb/s로 표시되어 있는데, 이는 정확한 6세대 신호 속도입니다. 이 이론은 또한 모든 베니스 SKU가 호환되는 이유를 설명합니다. 4개의 GPU가 CPU의 128개 6세대 레인 중 64개를 사용하고, 나머지 레인은 DPU, 스토리지 및 기타 시스템 요구 사항에 사용할 수 있도록 남겨두기 때문입니다.
각 컴퓨팅 트레이에는 세 개의 개별 네트워크가 통과하며, 각 네트워크는 서로 다른 작업을 위해 존재합니다. 가장 일반적인 것은 프런트 엔드입니다. 단일 Pensando Salina 400G DPU가 노드를 일반 데이터센터 네트워크에 연결하며, 이에 대해서는 나중에 더 자세히 살펴보겠습니다.
두 번째는 스케일아웃, 즉 랙들을 클러스터로 연결하는 네트워크인데, 이를 가장 명확하게 이해하는 방법은 CountSerDess를 이용하는 것입니다. MI455X의 스케일아웃은 레인당 64Gb/s의 PCIe Gen 6 또는 128Gb/s의 UALink128을 사용할 수 있으며, Vulcano 800 NIC는 800GbE 포트를 안정적으로 유지하기 위해 양방향으로 약 128Gb/s의 연결 속도가 필요합니다. Gen 6 속도에서는 NIC당 x16 링크가 필요하므로 GPU는 2개의 NIC를 지원합니다. UALink128의 두 배 빠른 신호 전송 속도에서는 x8 링크 하나로 절반의 SerDes에서 동일한 작업을 수행할 수 있으므로 GPU는 3개의 NIC를 지원하며, 이것이 Helios에 기본으로 제공되는 구성입니다. 어느 경우든 UALink128 홉은 GPU와 NIC 사이의 전용 회선일 뿐이며, 실제 네트워크는 Vulcano에서 시작됩니다. 각 NIC는 OpenAI가 AMD 및 기타 파트너와 함께 개발한 멀티패스 프로토콜인 MRC를 포함하여 UEC 호환 전송을 실행하는 800GbE 포트를 구동합니다. 물리적으로 NIC는 트레이당 2개의 맞춤형 보드에 장착되며, 각 보드에는 4개 또는 6개의 Vulcano ASIC이 탑재되어 GPU당 2개 또는 3개의 구성에 맞춰집니다. 최대 구성 시 트레이당 12개의 NIC가 장착되고 GPU당 2,400Gb/s의 확장 대역폭을 제공합니다. 또한 NIC가 GPU에 직접 연결되고 경로에 CPU가 전혀 없으므로 랙 간 트래픽은 호스트 링크를 거치지 않습니다.
세 번째는 확장성으로, 헬리오스를 진정한 랙 스케일 시스템으로 만들어주는 핵심 요소입니다. 각 GPU는 ESUN 이더넷을 통해 UALink의 메모리 시맨틱스를 실행하는 36개의 UALoE 링크를 지원하며, 각 링크는 400Gb/s의 속도를 제공하여 GPU당 최대 3.6TB/s의 양방향 대역폭을 제공합니다. 이러한 링크는 트레이 후면의 스위치 트레이 방향으로 연결되어 72개의 GPU를 하나의 공유 메모리 포드로 통합하는 로드-스토어 트래픽을 처리합니다.
스위치 트레이
다음으로 스위치 트레이를 살펴보겠습니다. 가장 눈에 띄는 점은 트레이에 사용된 실리콘 칩이 매우 평범하다는 것입니다. 6개의 트레이 각각에는 브로드컴 토마호크 6 ASIC이 2개씩 탑재되어 있는데, 이는 하이퍼스케일러들이 리프-스파인 네트워크에 사용하는 것과 동일한 상용 이더넷 스위치 칩으로, 각각 200G 속도의 512개 레인을 지원합니다.
각 GPU는 12개의 스위치 각각에 3개의 UALoE 링크(각 UALoE 링크는 200G 레인 2개)를 전송하며, 각 컴퓨팅 트레이에서 후면 케이블 카트리지를 통해 144개의 링크가 출력됩니다. 따라서 각 Tomahawk 스위치는 400Gb/s 속도로 216개의 링크를 처리하여 21.6TB/s의 양방향 대역폭을 전송하는 반면, 각 GPU는 36개의 링크(200G 레인 72개)와 3.6TB/s의 대역폭을 모두 유지합니다. 스위치는 이러한 구성을 구현하기 위해 특별한 기술을 필요로 하지 않습니다. UALoE의 캡슐화는 일반 L2 프로토콜을 사용하고, 포워딩은 이더넷 칩셋이 20년 동안 제공해 온 정적 MAC 프로그래밍을 기반으로 하며, 흐름 제어는 표준 우선순위 흐름 제어를 사용합니다.
단일 계층 구조에서는 데이터센터 혼잡 문제의 여러 유형이 발생하지 않습니다. 다중 계층 인캐스트가 없고, 모든 GPU가 다른 모든 GPU와 정확히 고정 지연 시간 거리만큼 떨어져 있기 때문입니다. 직접 메시 구성과 비교했을 때, 스위칭 방식은 워크로드가 필요로 할 때 단일 흐름이 전체 경로의 대역폭을 사용할 수 있도록 하며, 모든 GPU를 동일한 거리에 유지합니다. 따라서 스케줄링 시 지역성을 고려할 필요가 없으며, 모든 링크에 동일한 장애 보호 기능을 제공합니다.
결함 허용
Helios는 하드웨어 오류를 설계 요소로 간주합니다. 이 정도 규모에서는 항상 문제가 발생할 수 있습니다. 불안정한 케이블, 패킷 손실, 펌웨어 업데이트를 위한 스위치 점검, 완전히 고장난 컴퓨팅 트레이 등 다양한 문제가 발생할 수 있습니다. Helios 패브릭은 이러한 어떤 이벤트도 작업을 중단시키지 않도록 설계되었습니다. 손실된 패킷은 재전송을 통해 복구되며, 링크, 케이블 또는 스위치에 장애가 발생하면 잠시 중단 후 트래픽이 자동으로 우회되어 남은 대역폭을 사용하여 작업이 계속 진행됩니다. 체크포인트에서 다시 시작하는 대신 작업이 중단되지 않습니다.
12개 평면으로 구성된 토폴로지는 성능 저하를 완화하는 핵심 요소이며, 3방향 스트라이핑은 성능 저하 단계 크기를 결정합니다. GPU가 스위치에 연결하는 3개의 링크 중 하나가 끊어지더라도 해당 평면은 대역폭의 3분의 2를 유지합니다. 토마호크 스위치 하나가 완전히 고장 나더라도 모든 GPU는 확장 대역폭의 1/12만 손실되지만, 나머지 11개 평면에서는 모든 GPU 간 연결이 계속 유지됩니다. 심지어 스위치 트레이 전체(12개 스위치 중 2개)가 고장 나더라도 각 GPU는 연결이 끊어지지 않고 대역폭의 6분의 1만 손실됩니다. 어떤 GPU도 다른 GPU에 연결하기 위해 특정 스위치에 의존하지 않기 때문입니다. 비교하자면, 베라 루빈 NVL72는 각 GPU를 9개의 트레이에 있는 36개의 NVSwitch 6 ASIC에 분산시키기 때문에 스위치 트레이 하나가 고장 나면 대역폭 손실이 9분의 1에 가깝습니다. NVIDIA는 3배 더 많은 스위치 ASIC을 사용하여 성능 저하 단계를 줄였지만, AMD는 12개의 고차 스위치를 사용하면 애초에 고장 날 수 있는 부품, 케이블, 커넥터의 수가 줄어든다고 반박합니다. 몇 주 단위로 진행되는 교육 기간 동안, 패브릭 대역폭의 6분의 1을 잃는 것과 작업이 중단되는 것의 차이는 랙의 전체 경제성에 직결됩니다.
가상 포드
장애 발생 시 패브릭을 분할하는 데 사용되는 동일한 메커니즘을 의도적으로 분할하는 데에도 사용할 수 있습니다. AMD는 이러한 구조를 가상 포드(vPod)라고 부르며, 단위는 컴퓨팅 노드입니다. 랙에 있는 18개의 4-GPU 노드 중 어떤 조합이든 격리된 포드로 구성할 수 있으며, 소규모 테넌트를 위한 1개의 노드부터 대규모 학습 작업을 위한 랙의 대부분 노드까지 다양하게 활용할 수 있습니다. 이러한 격리는 스케줄러의 결정보다 하위 단계인 패브릭 하드웨어에서 적용됩니다. vPod는 해당 테넌트에 종속되며, 다른 포드는 해당 vPod의 메모리나 트래픽에 접근할 수 없습니다. 또한 모든 UALoE 링크에서 회선 속도의 AES-256-GCM 암호화를 사용하고 고객 소유 클러스터 키를 지원하여 한 테넌트의 텐서를 다른 테넌트에서 접근할 수 없도록 합니다. 여러 GPU에 걸쳐 있는 게스트 VM은 호스트 OS를 신뢰할 필요 없이 보안 도메인이 GPU 전체에 투명하게 확장됩니다. NVIDIA는 NVLink 도메인을 파티션으로 분할하고 IMEX 서비스를 통해 노드 간 메모리 내보내기 및 가져오기를 중개함으로써 NVL72 랙에서 동일한 문제를 해결합니다. vPod는 UALoE 환경에서 이와 유사한 개념이므로 GB200 또는 GB300 제품군을 사용해 본 경험이 있는 운영자는 이 개념이 익숙할 것입니다.
컴퓨팅 트레이에 장애가 발생하면 영향 범위는 해당 vPod에 국한됩니다. 해당 워크로드는 체크포인트에서 다시 시작되고 다른 모든 Pod는 영향을 받지 않고 계속 실행되므로 테넌트 경계가 장애 경계 역할을 합니다. 파티셔닝은 계층 구조까지 확장되어 단일 MI455X를 최대 8개의 SR-IOV 가상 머신으로 분할할 수 있으므로 동일한 랙에서 한 고객이 72개의 GPU를 모두 사용하는 단일 Pod부터 최대 576개의 GPU 슬라이스 테넌트까지 지원할 수 있으며, 계층 구조의 모든 수준에서 하드웨어 격리가 적용됩니다.
관리 계획
이 모든 것을 구동하는 것은 하드웨어와 동일한 개방성 원칙을 따르는 전용 소프트웨어 스택입니다. AMD Fabric Manager(AFM)는 제어 플레인 역할을 하며, 제로 터치 부팅으로 72개의 GPU 패브릭을 검색하고 프로비저닝합니다. 즉, 랙 전원을 켜는 것만으로 72개의 GPU가 모두 활성화됩니다. 그런 다음 케이블 카트리지 배선의 조립 오류를 검증하고, 랙을 vPod로 분할하고, 위에서 설명한 재라우팅 및 복구를 조정합니다. 별도의 관리 트레이는 없습니다. AFM은 스위치 트레이 자체의 관리 프로세서에서 3개의 이중화 인스턴스로 실행되며, 6개의 트레이에 분산되어 있고 분산 데이터베이스를 사용합니다. 따라서 스위치 트레이에 장애가 발생해도 제어 플레인에는 아무런 영향을 미치지 않으며, 북쪽 방향 REST API를 통해 여러 랙을 관리하는 클러스터 컨트롤러에서 패브릭에 접근할 수 있습니다.
AFM은 내부적으로 클라우드 네이티브 환경에서 사용되는 인프라를 차용하여, 각 트레이에 에이전트가 설치된 표준 Kubernetes 스타일 컨트롤러를 기반으로 구축되었습니다. 또한, UALink가 각 GPU를 식별하는 데 사용하는 가속기 ID 할당과 같은 사용자가 볼 필요가 없는 패브릭 세부 정보를 관리합니다. AFM은 랙의 관찰 계층 역할도 수행합니다. 단일 대시보드에서 GPU 및 패브릭 사용률, 링크 상태, 장애 이벤트를 추적할 수 있으며, 문제가 발생하면 진행 중인 복구 작업을 표시하고 운영자가 자체 도구에 연결할 수 있는 알림을 발생시킵니다. 위 스크린샷은 AMD 연구소에서 Helios 클러스터를 모니터링하는 AFM의 모습입니다. 관리는 인밴드 또는 아웃밴드 방식으로 이루어지므로 진단 및 구성 작업은 실행 중인 워크로드에 영향을 주지 않습니다. AFM 아래의 스위치는 오픈 소스 네트워크 운영 체제(NOS)인 SONiC 기반의 네트워크 OS를 실행하며, AMD는 UALoE 관련 기능을 업스트림에 통합하여 표준 gNMI API를 통해 제공할 예정이라고 밝혔습니다. 랙 위에는 랙 인프라 관리자가 노드 및 스위치 수명 주기, 전원 및 누전 감지를 관리하고, 클러스터 컨트롤러가 Helios를 Kubernetes 및 Slurm에 연결하여 스케줄링을 수행합니다.
Helios vs. NVIDIA Vera Rubin NVL72
그럼 이 제품이 시장에서 실제로 경쟁하게 될 NVIDIA의 Helios 제품인 Vera Rubin NVL72와 어떻게 다른지 살펴보겠습니다.
| 랙 측정 | AMD 헬리오스 | 베라 루빈 NVL72 |
|---|---|---|
| GPU | 72 MI455X | 72 루빈 |
| CPU | 18 베니스 | 36 베라 |
| HBM 용량 | 31TB | 20.7TB |
| HBM 대역폭 | 1.7PB/s | 1.58PB/s |
| GPU별 확장 | 3.6TB/초 | 3.6TB/초 |
| 랙 스케일업 | 260TB/초 | 260TB/초 |
| GPU별 스케일아웃 | 2,400 Gb / s | 1,600 Gb / s |
| 확장 스위치 | 12 토마호크 6 | 36 NVSwitch 6 |
| 랙 형식 | 더블 와이드 ORW | 싱글 와이드 MGX |
표면적으로 보면 AMD가 유리합니다. HBM 용량은 50% 더 많고, 스위치 ASIC 개수는 3분의 1로 줄이면서도 GPU당 3.6TB/s의 확장성을 유지하며, GPU당 확장 대역폭도 50% 더 높습니다. AMD의 자체 테스트에서는 이러한 사양을 성능으로 전환하여 Kimi K2 Thinking 아키텍처에서 GPU당 초당 토큰 처리량이 10~15% 더 높고, 달러당 토큰 처리량은 최대 30% 더 높다고 주장합니다. 이 수치는 NVIDIA가 발표한 수치와 AMD가 자체적으로 비교한 결과이며, 독립적인 측정 결과는 아니지만 AMD가 스스로를 평가하는 기준이 될 것입니다. 더 흥미로운 차이점은 각 설계가 GPU를 외부 네트워크와 연결하는 방식에 있습니다.
스케일아웃부터 살펴보겠습니다. MI455X의 NIC는 GPU에 직접 연결됩니다. SemiAnalysis에 따르면 Rubin 패키지는 그렇지 않습니다. 해당 패키지에는 두 개의 ConnectX-9 NIC에 필요한 PCIe 슬롯이 없기 때문에 NIC가 Vera CPU에 연결되고, GPU 트래픽은 Rubin에서 NVLink-C2C, Vera, PCIe, ConnectX-9를 거쳐 우회하게 됩니다. 이 우회 경로로 인해 지연 시간이 발생하고 C2C 링크가 이중으로 작동하게 됩니다. 컴퓨팅, 호스트 트래픽, 네트워크 부하가 모두 동시에 증가하면 Vera의 C2C 대역폭 일부가 NIC 페이로드 전송에 사용되어 GPU가 실제로 사용하는 호스트 대역폭은 광고에서 제시한 1.8TB/s보다 낮아집니다.
대역폭 계산은 이를 더욱 복잡하게 만듭니다. 각 MI455X는 Rubin의 1,600Gbit/s에 비해 2,400Gbit/s의 스케일아웃 성능을 제공하므로 Helios는 FLOP당 더 많은 네트워크 처리 능력을 갖습니다. AMD의 8,000개 GPU를 사용한 학습 실행 시뮬레이션에 따르면 세 번째 NIC 덕분에 작업 완료 속도가 약 13% 향상되었습니다.
Rubin은 스토리지 부분에서 반격을 가했는데, 그 이유는 다시 한번 NIC의 위치 때문입니다. ConnectX-9에는 PCIe 스위치가 내장되어 있어 NVMe를 NIC에 직접 연결할 수 있고, GPU는 CPU를 거치지 않고 GPUDirect 스토리지를 통해 데이터를 가져올 수 있습니다. MI455X에는 이와 같은 기능이 없습니다. 스토리지가 Venice 호스트에 연결되어 있으므로 GPUDirect를 사용하는 모든 작업은 CPU를 거쳐 Infinity Fabric 링크를 통해 다시 돌아와야 합니다. AMD는 네트워크 경로를 최적화하는 대신 스토리지 경로에 비용을 투자했고, NVIDIA는 그 반대로 했습니다. 어떤 방식이 더 중요한지는 워크로드가 GPU 간 활성화 이동에 중점을 두는지, 아니면 디스크에서 데이터를 스트리밍하는지에 따라 달라집니다.
고객이 변경할 수 있는 사항
요약하자면, 위에 언급된 모든 내용은 AMD의 레퍼런스 디자인을 설명하며, 여러 수치는 고객이 원하는 대로 구성할 수 있는 최소 사양입니다. 가장 대표적인 예가 호스트 CPU입니다. Rubin의 Vera는 하나의 고정된 구성으로 제공되며, Helios 트레이에 포함된 Venice는 표준 SP7 소켓 부품입니다. AMD는 모든 Venice SKU가 Helios 전용 커스터마이징 없이 바로 사용 가능하다고 확인했습니다. 레퍼런스 트레이는 GPU에 충분한 부하를 제공하기 위해 싱글 스레드 속도가 중요한 96코어 5GHz 프로세서를 사용합니다. 하지만 고객은 256코어 플래그십 모델이나, 캐시 사용량이 많은 전처리 작업을 위해 1,152MB의 스택형 L3 캐시를 탑재한 Venice-X로 자신만의 버전을 구성할 수도 있습니다.
메모리와 네트워킹은 동일한 소켓-슬롯 방식을 따릅니다. 레퍼런스 1TB DRAM은 64GB RDIMM 16개로 구성되며, 더 높은 용량의 DIMM을 사용하면 트레이 하나로 최대 4TB까지 확장할 수 있고, MRDIMM-12800을 사용하면 Venice의 최대 1.6TB/s 대역폭을 활용할 수 있습니다. 네트워크 측면에서는 GPU당 NIC를 3개에서 2개로 줄일 수 있으며, 일반 PCIe Gen 6를 사용합니다. 각 Vulcano 포트는 Tomahawk 5 또는 Tomahawk 6 패브릭에 대해 1x800G, 2x400G, 4x200G 또는 8x100G 구성으로 작동할 수 있습니다. P4 파이프라인은 전송 프로토콜(RoCEv2, MRC 또는 독자적인 방식)을 운영자가 선택할 수 있도록 합니다. 스위치의 NOS가 오픈 소스 SONiC 기반이고 AFM이 북쪽 API를 통해 전체 패브릭에 노출되므로 관리 평면 또한 교체 가능합니다.
전력 예산은 소켓에 따라 달라집니다. NVIDIA의 슈퍼칩들은 모두 동일한 전력 제한을 가지고 있는데, Vera는 450W 용량의 칩으로 전력 사용량이 제한되어 있으며, 최근 세대 칩들은 부하가 걸리면 GPU로 전력을 집중시키는 방식을 채택하고 있습니다. AMD는 레퍼런스 디자인이 호스트 전력을 제한하는지 또는 분산시키는지에 대해 언급하지 않았지만, AMD의 설계 방식에서는 고객이 직접 시스템을 구성하여 전력 사용량을 높이더라도 전력 분산 현상이 발생하지 않도록 할 수 있습니다.
컴퓨팅 트레이 섹션에서 자세히 살펴보면 호스트 링크의 PCIe 기반 구조는 마지막으로 추측에 불과한 가능성을 열어줍니다. 베니스(Venice)는 2P 구성을 지원하며, 일부 AI 호스트 플랫폼은 소켓 간 xGMI 대역폭을 I/O 대역폭으로 교환하는 방식으로 최대 160개의 사용 가능한 PCIe 레인을 사용하여 2P 구성을 실행할 수 있습니다. 고객은 NVIDIA의 1:2 CPU-GPU 비율에 맞춰 2소켓 트레이를 구축하거나, xGMI 링크를 재조정하여 CPU-GPU 대역폭을 높일 수 있습니다. 하지만 현재 누군가가 그렇게 구축하고 있다는 징후는 없으며, 이 모든 것이 1.8TB/s의 NVLink-C2C와의 격차를 좁히는 것은 아닙니다. 핵심은 누가 결정권을 쥐고 있느냐는 것입니다. 헬리오스(Helios)에서는 호스트, 메모리, 전력, 그리고 잠재적으로 토폴로지까지 고객이 결정해야 하지만, NVIDIA의 슈퍼칩은 고객에게 어떠한 결정권도 주지 않습니다.
살리나 DPU
이제 앞서 미뤄두었던 프런트엔드 네트워크로 돌아가 보겠습니다. AMD의 3세대 Pensando DPU인 Salina는 완전한 P4 프로그래밍 가능 데이터 경로를 갖춘 400G 카드입니다. 즉, 새로운 캡슐화, 텔레메트리 후크 또는 전송 방식은 펌웨어 업데이트만으로 적용되어 트래픽 손실 없이 실시간으로 사용할 수 있습니다. 이미 제공되는 서비스는 프런트엔드 체크리스트를 모두 충족합니다. VXLAN 또는 NVGRE를 지원하는 SDN, 수백만 개의 규칙으로 확장 가능한 스테이트풀 방화벽, 회선 속도 IPsec, PSP, DTLS 또는 사용자 지정 암호화, NAT 및 로드 밸런싱을 지원합니다. 또한 Salina는 랙에서 가장 검증된 실리콘 중 하나입니다. Pensando DPU는 2019년부터 하이퍼스케일러에 사용되어 왔으며, 현재 Microsoft, Oracle, IBM에서 Salina를 프런트엔드로 활용하고 있습니다. Oracle은 Salina를 통해 SDN 성능이 5배 향상되었다고 밝혔으며, 한 하이퍼스케일러는 I/O를 Salina로 오프로드하여 서버당 22개의 CPU 코어를 확보했습니다.
스토리지는 두 번째 핵심 요소입니다. Salina는 NVMe-over-Fabrics 장치를 호스트에 노출하여 TCP 또는 RDMA를 통해 원격 SSD 풀을 가상화하고, 암호화, 다이제스트 및 압축을 카드 자체에서 처리합니다. Helios에서는 에이전트 기반 아키텍처 시대의 기술이 적용되어 컨텍스트 메모리 엔진이 에뮬레이션된 KV 장치를 제공합니다. 따라서 KV 캐시가 넘치면 CPU DRAM, 로컬 SSD 또는 원격 스토리지로 스필된 후 HBM으로 라인 속도로 다시 스트리밍되어 재계산되지 않습니다. Rubin 비교에서 언급했듯이 MI455X에는 GPUDirect Storage가 없으므로, 이 KV 오프로드는 AMD가 트래픽 처리에 가장 중요한 부분에 대한 부분적인 해결책입니다.
바로 이 부분에서 저희의 우려가 제기됩니다. 대역폭 격차는 명백합니다. Salina는 400G 카드인 반면, Vera Rubin 랙에 탑재되는 BlueField-4는 64코어 Grace CPU와 ConnectX-9를 함께 패키징하여 800G로 두 배의 대역폭을 제공합니다. 소프트웨어 격차는 논란의 여지가 있지만 분명히 존재합니다. NVIDIA의 DOCA는 개발자에게 일반 C 및 C++로 프로그래밍할 수 있는 컨테이너화된 사전 구축 서비스를 제공하는 반면, P4는 대부분의 팀이 접해본 적 없는 특수 데이터 플레인 언어입니다. Salina는 주요 서비스를 완벽하게 제공하며, 이를 사용하는 하이퍼스케일러들이 P4를 선택한 이유 중 하나는 P4가 MRC와 같은 새로운 프로토콜을 다른 실리콘 개발 주기보다 먼저 펌웨어에 통합할 수 있도록 해주기 때문에, 이 비교를 "DOCA 카탈로그 대 P4"라고 단정짓기는 어렵습니다. 진정한 차이점은 프로그래밍 가능성이 누구에게 유리한가에 있습니다. Salina의 유연성은 AMD와 P4에 능숙한 하이퍼스케일 팀에게 강력한 무기가 되는 반면, DOCA는 일반 기업 개발자도 쉽게 사용할 수 있는 툴킷입니다. 일반 시장에서는 NVIDIA의 소프트웨어 도입이 더 쉽고, AMD도 이를 잘 알고 있습니다.
ROCm.AI
소프트웨어 이야기를 해보자면, AMD는 이번 발표에서 가장 중요한 기술 중 하나를 GPU 스택 자체에 적용했습니다. 8월에 출시될 ROCm.AI는 AMD가 GPU 플랫폼을 처음부터 에이전트 기반으로 설계하려는 시도입니다. AI 스킬은 개발자들이 이미 사용하고 있는 코딩 에이전트인 Claude, Codex, Cursor, Gemini에 ROCm을 통합하여 Instinct에 설치, 실행, 디버깅을 간편하게 수행할 수 있도록 합니다. 더욱 혁신적인 기술은 Hyperloom입니다. Hyperloom은 사람이 개입하지 않고 워크로드를 프로파일링하고, 실행 구성을 최적화하고, GPU 커널을 재작성하고, 운영자가 작업을 수행하는 동안 결과를 검증하는 완전 자동화 최적화 도구입니다. AMD는 현재 약 14,000개의 모델을 지속적으로 최적화하고 있으며, 라이브 데모에서는 MiniMax M3에서 38%의 처리량 향상을 보여주었습니다. 에이전트 기반 기술인 FlyDSL은 파이썬에 어셈블리 언어에 가까운 제어 기능을 제공하고, ROCm은 6주 고정 출시 주기로 전환했으며, AMD는 ROCm.AI가 동일한 하드웨어에서 ROCm 7 대비 평균 3.3배의 추론 성능 향상과 2.4배의 학습 성능 향상을 제공한다고 주장합니다. ROCm 7은 이미 상당한 개선을 보여주었지만, 이제 AMD는 AI를 통해 이러한 개선 속도를 더욱 가속화하고자 합니다.
소프트웨어 세션에서 가장 중요한 슬라이드는 단연 하드웨어에 관한 것이었습니다. AMD는 모든 수치가 측정된 것이라고 강조했는데, 이는 MI455X 칩이 ROCm 벤치마크에서 현재 정상적으로 작동하며 빠른 속도를 보여주고 있음을 암시하는 것이었습니다. 구체적인 수치는 FP8 MLA 디코딩 20TB/s, FP4 연산 20 PFLOPS, 스케일업 대역폭 3.2TB/s, 스케일아웃 대역폭 190GB/s였습니다. 질의응답 시간에 AMD는 FP4 결과가 최대 달성 가능한 MAMF(Mat-Achievable Matmul-FLOPS) 측정값이며, 이러한 벤치마크에서 일반적으로 사용되는 방식대로 디바이스 성능을 최대한 끌어내는 행렬 형태로 측정되었다고 밝혔습니다. 이는 또한 대담한 공개이기도 한데, AMD는 MI455X가 40.26 PFLOPS의 최대 MXFP4 성능 중 약 50%를 지속적으로 유지한다고 공개적으로 인정했기 때문입니다. 대부분의 벤더들이 이러한 수치를 공개하지 않으려 할 것입니다.
AMD는 이 제품이 시중의 모든 가속기 중 가장 뛰어난 연산 성능을 보여준다고 주장하지만, 이 부분은 다소 의심스럽습니다. AMD의 FP4는 OCP MXFP4이고, NVIDIA는 NVFP4입니다. 두 제품은 서로 다른 방식을 사용합니다. NVFP4는 16개 요소 블록마다 소수점 단위의 FP8 스케일링을 적용하고 그 위에 텐서 수준의 스케일링을 추가하는 반면, 기본 MXFP4는 32개 요소당 2의 거듭제곱 단위의 더 거친 스케일링을 사용합니다. 따라서 NVFP4 FLOP은 MXFP4 FLOP보다 더 많은 작업을 처리합니다. CDNA 5 또한 MXFP4에 소수점 스케일링을 적용할 수 있지만, AMD는 측정에 어떤 방식을 사용했는지 명시하지 않았습니다. Rubin MAMF 실행과 MI455X MAMF 실행은 동일한 연산을 측정하는 것이 아니므로, 제조사별 FP4 비교는 동일한 정확도에서 초당 토큰 처리량이라는 응용 프로그램 수준에서만 가능합니다. 측정 결과는 예상치를 상회하지만, 이 수치는 AMD의 이전 세대 제품과 비교했을 때 가장 정확하게 해석될 수 있습니다. 이전 세대 제품에서는 3~4배의 성능 향상이 명확하게 드러났기 때문입니다.
AMD에게 유리한 반론도 있습니다. 이는 완전히 새로운 실리콘에서 얻은 초기 ROCm.AI 결과이므로, 수동 튜닝을 거친 실제 생산 환경에서 달성할 성능을 과소평가한 것일 수 있습니다. 진정한 평가는 이러한 랙이 하이퍼스케일링 환경에 배포되었을 때 나올 것입니다.
생각을 폐쇄
Helios는 AMD가 지금까지 출시한 시스템 중 가장 완벽한 시스템이며, 칩 단위가 아닌 랙 규모에서 NVIDIA와 정면 승부를 펼치는 최초의 시스템입니다. 오늘날 AI 용량을 결정하는 핵심 요소들에서 AMD가 우위를 점하고 있습니다. GPU당 50% 더 많은 HBM 메모리, Rubin과 동등한 확장성, 50% 더 높은 스케일아웃 대역폭, 그리고 AMD 자체 모델링에 따르면 달러당 최대 30% 더 많은 토큰을 제공합니다. 이러한 성과를 달성한 방식 또한 중요합니다. 상용 Tomahawk 스위치, 숫자 형식부터 캐비닛까지 개방형 표준, 그리고 최종 구성을 고객에게 맡기는 소켓형 호스트를 채택했습니다. NVIDIA는 C2C 호스트 링크, DPU, 그리고 소프트웨어 온램프에서 여전히 강점을 가지고 있지만, 하드웨어 측면에서 AMD가 우위를 점하는 것은 이번이 처음입니다.
구매자들도 이에 동의합니다. AMD에 따르면 OpenAI, Meta, Anthropic, Microsoft, Oracle 등이 Helios를 도입하고 있으며, AMD는 현재 Helios 랙이 생산 중이라고 강조했습니다. NVIDIA의 행보를 따라 AMD는 이제 연간 단위로 로드맵을 발표합니다. CDNA 6 기반의 MI500 시리즈는 차세대 HBM과 구리 및 광 인터커넥트를 탑재하여 2027년에 출시될 예정이며, MI600 시리즈는 2028년 출시를 목표로 이미 개발에 들어갔습니다.
이제 소프트웨어만 남았는데, 수년 만에 처음으로 AMD GPU에 대한 이야기를 소프트웨어적인 측면에서만 마무리 짓지는 않겠습니다. ROCm 7은 실질적인 격차를 해소했고, ROCm.AI는 8월에 출시되어 더욱 향상된 성능을 제공할 예정이며, 출시 주기 또한 6주로 고정되었습니다. 구매자가 누구인지도 중요합니다. 이러한 계약을 체결하는 연구소와 하이퍼스케일러는 AMD와 공동으로 설계하고, 발생하는 모든 문제를 해결할 수 있는 충분한 엔지니어를 보유하고 있습니다. 턴키 방식의 스택을 필요로 하는 기업은 상황이 다르며, 그 시장은 현재로서는 NVIDIA의 영역입니다. 하지만 Helios는 하이퍼스케일러와 AI 연구소를 위해 설계되었으며, 이들을 위해 하드웨어는 준비되어 있고, 소프트웨어는 그에 맞춰 발전하고 있으며, 제품 출하도 순조롭게 진행되고 있습니다. AMD는 그 어느 때보다 강력한 입지를 확보하고 있습니다.





아마존