NVIDIA는 자사의 코패키징 광학(CPO) 이더넷 스위치 플랫폼인 Spectrum-X Ethernet Photonics의 양산에 돌입했습니다. NVIDIA는 이 기술을 통해 레이저 개수는 4배 줄고, 전력 소비는 5배 낮아지며, 평균 무사고 시간(MTBC)은 10배 향상되었다고 밝혔으며, 공급망의 각 단계에서 스위치를 생산하는 5개 제조 파트너사를 공개했습니다. 이번 성과는 Spectrum-X Ethernet Photonics가 네트워크로 연결되도록 설계된 Vera Rubin 컴퓨팅 플랫폼이 올 가을 양산 출하를 앞두고 있는 시점에 이루어졌습니다.
코패키징된 광 스위치 내부
기존 스위치는 플러그형 광 트랜시버, 즉 각각 자체 레이저를 탑재하고 스위치 전면 패널에 꽂는 개별 모듈에 의존합니다. 반면 Spectrum-X Ethernet Photonics는 200Gb/s SerDes와 함께 패키징된 광학 장치를 기반으로 스위칭 실리콘에 광 엔진을 직접 통합합니다. 플러그형 계층을 제거함으로써 레이저 개수를 4분의 1로 줄일 수 있으며, 레이저 개수가 줄어들면 수십만 개의 링크로 구성될 수 있는 네트워크 환경에서 고장 발생 가능성이 있는 개별 부품의 수도 줄어듭니다.
이러한 장애 지점 때문에 대부분의 통신 사업자에게는 전력 소모량보다 신뢰성 수치가 더 중요합니다. NVIDIA의 10배 높은 평균 무사고 시간(MTBI)은 광 경로상의 문제로 링크가 다운되는 빈도를 나타내는 것이지, 순수 처리량과는 무관합니다. 네트워킹 계층의 열 및 전기적 부담을 줄이면 데이터 센터 내에서 가속기 컴퓨팅을 위한 전력 여유 공간을 확보할 수 있으며, 이는 NVIDIA의 800VDC 전력 아키텍처를 설계하게 된 배경 이기도 합니다. NVIDIA는 이 플랫폼을 처음 공개했을 때 기존 트랜시버를 사용하는 네트워크 대비 5배 더 나은 전력 효율성, 5배 더 긴 AI 가동 시간, 1.3배 더 빠른 구축 시간이라는 장점을 강조했습니다.
CPO 공급망, 단계별 명칭
더욱 이례적인 공개는 NVIDIA가 단계별로 밝힌 제조 체인 자체입니다. TSMC는 실리콘 포토닉스 제조를 담당하고, SPIL은 칩 스케일 패키징 및 테스트를 수행합니다. Lumentum은 레이저 칩을 제조하고, TFC Communication은 레이저 모듈 서브어셈블리를 제작합니다. Foxconn은 최종 스위치 시스템 조립을 담당합니다. 코패키징 광학 기술은 수년간 시연에서는 유망해 보였지만 대량 생산에는 어려움이 많았던 기술이었기에, 이렇게 다섯 개 업체가 참여하는 생산 체인이 가동되고 있다는 것은 기술이 상당히 성숙했음을 보여주는 구체적인 신호입니다.
CoreWeave, Lambda, Oracle Cloud Infrastructure, Microsoft Azure, IBM Cloud, Nebius를 포함한 클라우드 제공업체들이 CPO 패브릭을 통합하는 초기 도입 업체에 속합니다.
베라 루빈, 네트워크화되는 플랫폼
이 스위치는 NVIDIA가 5월 말 타이베이 GTC에서 본격적인 생산에 돌입했으며 올가을부터 생산 출하를 시작할 예정이라고 발표한 Vera Rubin 에 데이터를 공급하기 위해 존재합니다. NVIDIA MGX 랙 스케일 설계의 3세대 플랫폼인 Vera Rubin은 이전 세대 Grace Blackwell 아키텍처 대비 최대 10배 높은 에이전트형 AI 처리량을 대규모 환경에서 제공하도록 설계되었습니다. 시스템 제조에는 Dell Technologies, HPE, Lenovo, Supermicro를 비롯하여 ASUS, ASRock Rack, Compal, Foxconn, GIGABYTE, Inventec, MSI, Pegatron, Quanta Cloud Technology, Wistron, Wiwynn 등 주요 서버 공급업체가 참여합니다. 스토리지 및 인프라 소프트웨어 측면에서는 Cloudian, DDN, Hitachi Vantara, IBM, MinIO, NetApp, Nutanix, VAST Data, WEKA 등이 이 플랫폼에서 본격적인 생산에 참여하고 있습니다.
랙 레벨에서 Vera Rubin NVL72는 Vera CPU, Rubin GPU 및 6세대 NVLink 네트워킹을 통합된 컴퓨팅 환경으로 제공합니다. 멀티테넌트 규정 준수 및 엔터프라이즈 데이터 보호를 위해 이 아키텍처는 NVIDIA 기밀 컴퓨팅(Confidential Computing)의 전체 스택을 통합합니다. 이 구현은 하드웨어 수준의 인증과 고속 인터커넥트를 통한 종단 간 회선 속도 암호화를 특징으로 하는 랙 규모의 신뢰 실행 환경(TEE)을 구축하여 물리적 및 펌웨어 수준의 변조를 방지합니다.
엔비디아의 창립자 겸 CEO인 젠슨 황은 “에이전트 AI는 새로운 유형의 워크로드입니다. 단 하나의 프롬프트로 추론, 검색, 도구 사용 및 응답 생성에 이르는 수천 단계의 여정이 시작될 수 있습니다.”라고 말했습니다. 그는 “베라 루빈은 바로 이러한 시대를 위해 설계되었습니다.”라고 덧붙이며, “차세대 산업 혁명을 이끌어갈 성능, 효율성 및 보안을 갖춘 대규모 인텔리전스를 제공하는 AI 팩토리 엔진”이라고 설명했습니다.
다중 테넌트 격리를 위한 BlueField-4 DPU 통합
베라 루빈 아키텍처는 NVIDIA BlueField-4 데이터 처리 장치(DPU)를 통합하여 주 호스트 프로세서의 인프라 워크로드를 분산 처리합니다. 최대 800Gb/s의 소프트웨어 정의 네트워킹 회선 속도로 작동하는 BlueField-4는 하드웨어로 격리된 멀티테넌트 네트워킹, 원격 측정 및 스토리지 가상화를 제공합니다. BlueField-4 고급 보안 신뢰 리소스 아키텍처를 활용하여 클러스터 운영자는 세분화된 트래픽 격리를 적용하고, 정책 시행을 자동화하며, 대규모 분산 배포 전반에 걸쳐 제어 평면을 관리할 수 있습니다.
광학 부품의 대량 생산이 시작되고 루빈 제품의 출하가 이번 가을에 시작될 예정이므로, 실질적인 문제는 하드웨어의 실효성 여부에서 운영자들이 얼마나 빨리 이를 대비할 수 있는지로 바뀝니다.




아마존