StorageReview.com

AWS와 NVIDIA, NVLink Fusion, Blackwell 및 AI 공장 협력 확대

AI  ◇  기업

AWS re:Invent에서 NVIDIA와 Amazon Web Services는 상호 연결 기술, 클라우드 인프라, 개방형 모델, 그리고 물리적 AI에 중점을 둔 강화된 파트너십을 발표했습니다. 이번 협력을 통해 NVIDIA는 맞춤형 실리콘, 네트워킹, AI 소프트웨어, 그리고 로봇 시뮬레이션을 아우르는 AWS 스택과의 통합을 더욱 강화할 것입니다. 특히 프로덕션 규모의 AI와 소버린 클라우드(Sovereign Cloud)에 대한 요구 사항에 중점을 두고 있습니다.

AWS 맞춤형 실리콘 및 차세대 AI 인프라를 위한 NVLink Fusion

이번 발표의 핵심은 AWS가 NVIDIA NVLink Fusion을 지원한다는 것입니다. AWS는 맞춤형 AI 인프라 구축을 위해 NVLink Fusion에 대한 라이선스를 제공할 예정입니다. AWS는 자사의 광범위한 맞춤형 실리콘 제품군에 NVLink Fusion 기술을 추가할 계획입니다. 여기에는 추론 작업 및 에이전트 기반 AI 모델 학습을 위한 차세대 Trainium4 가속기가 포함됩니다. AWS는 NVIDIA NVLink Fusion을 활용하여 NVIDIA NVLink 스케일업 인터커넥트를 NVIDIA MGX 랙 아키텍처 및 맞춤형 실리콘과 연결합니다. 이를 통해 차세대 클라우드 규모 AI 플랫폼의 성능을 향상시키고, 시스템 설계를 간소화하며, 시장 진출을 가속화하는 것이 목표입니다.

AWS는 랙, 섀시, 전력 공급 및 냉각 서브시스템을 포함한 완전한 랙 스케일 솔루션을 제공하는 NVLink Fusion 공급업체 생태계의 이점을 누릴 수 있습니다. 이 생태계는 AWS가 고밀도 AI 최적화 인프라를 구축할 때 조달 및 통합을 더욱 용이하게 합니다. Trainium4는 NVLink 및 NVIDIA MGX와 원활하게 작동하도록 설계되었습니다. 이는 NVIDIA와 AWS 간의 다세대 NVLink Fusion 협업의 첫 단계입니다. AWS는 이미 NVIDIA GPU를 사용하여 NVIDIA MGX 랙을 대규모로 구축했습니다. NVLink Fusion을 통합함으로써 AWS 실리콘과 NVIDIA 하드웨어를 혼합하여 다양한 플랫폼에서 배포 및 시스템 관리를 표준화하고 간소화하는 것을 목표로 합니다.

또한 AWS는 다양한 범용 및 클라우드 네이티브 워크로드를 처리하는 다양한 Graviton CPU를 사용합니다. AWS Nitro System은 가상화, 보안 및 데이터 플레인 오프로드를 지원하여 AWS 서비스의 전반적인 성능과 보안을 향상시키는 데 필수적인 역할을 합니다.

엔비디아 설립자 겸 CEO 젠슨 황은 이번 협력을 더욱 강력한 AI 모델과 기업 도입 확대로 인해 증가하는 GPU 컴퓨팅 수요에 대한 대응으로 정의했습니다. 그는 NVLink Fusion과 AWS Trainium4의 통합을 통해 엔비디아의 스케일업 아키텍처와 AWS의 맞춤형 실리콘을 결합하여 차세대 가속 플랫폼을 구축하고, 이를 통해 AI 산업 혁명을 가속화할 것이라고 설명했습니다. 황 CEO는 이러한 협력의 목표가 고급 AI 접근성을 높이고 글로벌 인프라를 광범위한 지능화로 전환하는 것이라고 밝혔습니다.

AWS CEO 맷 가먼은 양사 간 15년간의 긴밀한 협력 관계를 강조하며, 이번 협력이 대규모 AI 인프라를 발전시킬 것이라고 언급했습니다. 그는 더 높은 성능, 더 나은 효율성, 그리고 확장성 향상을 포함한 고객 성과에 대해서도 언급했습니다. 가먼은 Trainium, Graviton, Nitro에서 NVIDIA NVLink Fusion을 지원하여 AWS 고객의 새로운 기술 역량을 확보하고 혁신 속도를 높일 것이라고 강조했습니다.

AWS의 NVIDIA Vera Rubin 아키텍처

네트워킹 측면에서 AWS 기반 NVIDIA Vera Rubin 아키텍처는 AWS Elastic Fabric Adapter와 Nitro 시스템을 지원합니다. 이러한 설계는 고객에게 유연하고 강력한 네트워킹 옵션을 제공하는 동시에 AWS의 기존 클라우드 인프라와의 완벽한 호환성을 보장하고 새로운 AI 서비스 제공을 가속화합니다.

Blackwell 및 AWS AI 팩토리를 통한 규모와 주권의 융합

AWS는 NVIDIA HGX B300 시스템과 대규모 학습 및 추론 클러스터를 위한 NVIDIA GB300 NVL72 GPU를 포함한 NVIDIA Blackwell 아키텍처를 추가하여 가속 컴퓨팅 포트폴리오를 확장하고 있습니다. 또한 시각 및 그래픽 집약적인 애플리케이션에 최적화된 NVIDIA RTX PRO 6000 Blackwell 서버 에디션 GPU도 곧 AWS에서 사용할 수 있게 될 예정입니다.

이 GPU는 AWS AI 팩토리의 인프라 백본을 구성합니다. 이 새로운 AI 클라우드 서비스는 AWS에서 관리하는 자체 데이터 센터에 전용 AI 인프라를 필요로 하는 고객을 위한 것입니다. 이 모델은 고객이 직접 관리하는 시설 내에서 클라우드급 AI 인프라를 제공합니다. 이를 통해 기업은 자체 환경 내 AI 리소스에 대한 감독 및 보안을 유지할 수 있습니다.

또한 로컬 데이터 상주 요건을 충족하여 데이터 제어에 중점을 둡니다. 이를 통해 민감한 정보가 지정된 지리적 범위 내에 유지되어 규제 기준을 충족하는 동시에 원활한 운영이 가능합니다. 이 모델은 대규모 고급 학습 및 추론 플랫폼에 대한 액세스를 제공하여 사용자가 대규모 데이터 세트에서 복잡한 AI 솔루션을 효율적으로 개발, 배포 및 관리할 수 있도록 지원합니다.

글로벌 약속

NVIDIA와 AWS는 전 세계에 독립형 AI 클라우드를 구축하고 엄격한 독립형 AI 정책을 준수해야 하는 지역에 고급 AI 기능을 제공하기 위해 최선을 다하고 있습니다. AWS AI 팩토리를 통해 양사는 증가하는 규제 및 데이터 주권 요건을 충족하는 동시에 탁월한 컴퓨팅 용량을 제공하는 안전하고 독립형 AI 인프라를 제공할 계획입니다.

AWS는 공공 부문 기관에 있어 AI 팩토리가 연방 슈퍼컴퓨팅 및 AI 전략의 중요한 전환점이라고 보고 있습니다. 고객은 AWS의 안정적이고 안전하며 확장 가능한 클라우드 인프라를 NVIDIA Blackwell GPU 및 NVIDIA Spectrum-X 이더넷 스위치를 포함한 NVIDIA 가속 컴퓨팅 스택 전체와 결합하여 사용할 수 있습니다.

목표는 고객이 고급 AI 서비스와 기능에 접근하여 대규모 모델을 대규모로 학습하고 배포할 수 있도록 하는 통합 시스템을 구축하는 것입니다. 또한, 기업은 현지 규정을 준수하는 독점 데이터에 대한 엄격한 통제권을 유지합니다.

AWS 기반 NVIDIA 소프트웨어: 개발자 및 데이터 경험 간소화

NVIDIA와 AWS는 또한 비정형 데이터 처리를 가속화하고 에이전트 수명 주기를 관리하기 위해 소프트웨어 및 데이터 계층 분야에서 협력하고 있습니다.

Amazon OpenSearch Service는 이제 GPU 가속 벡터 검색 및 클러스터링을 위한 오픈소스 라이브러리인 NVIDIA cuVS를 기반으로 하는 벡터 인덱스 구축을 위한 서버리스 GPU 가속 기능을 제공합니다. 이러한 통합을 통해 GPU가 벡터 중심의 비정형 데이터 워크로드의 기본 엔진으로 자리매김하게 됩니다.

얼리 어답터들은 워크플로우가 크게 개선되었다고 보고하며, 벡터 인덱싱 속도가 최대 10배 빨라져 효율성이 크게 향상되었다고 말합니다. 또한, 이 새로운 접근 방식은 기존 방식보다 약 4분의 1의 비용으로 상당한 비용 절감 효과를 제공합니다. 이러한 발전은 사용자에게 속도와 경제적 이점을 모두 제공하는 획기적인 기술로 평가됩니다.

이러한 성능 및 비용 향상은 검색 지연 시간을 줄이고, 쓰기 경로를 가속화하며, 빠른 벡터 인덱싱이 필수적인 검색 증강 생성과 같은 동적 AI 패턴의 처리량을 향상시키는 데 도움이 됩니다. AWS는 NVIDIA GPU 기반 서버리스 벡터 인덱싱을 제공하는 최초의 주요 클라우드 제공업체입니다.

AI 에이전트를 개념 증명 단계에서 실제 운영 단계로 전환하려면 고객은 성능 데이터, 최적화 도구, 확장 가능한 관리 기능을 확인해야 합니다.

NVIDIA와 AWS는 여러 핵심 구성 요소를 통합하여 완벽한 엔드 투 엔드 솔루션을 구축하기 위해 협력하고 있습니다. 이번 협력은 양사 플랫폼 전반의 에이전트 개발, 관리 및 최적화 프로세스를 간소화하는 것을 목표로 합니다.

이 이니셔티브의 핵심은 에이전트 생성 및 관리를 지원하도록 설계된 Strands Agents입니다. 이를 보완하는 NVIDIA NeMo Agent Toolkit은 심층 프로파일링, 성능 튜닝 및 최적화를 위한 고급 도구를 제공하여 효율적인 배포를 보장합니다. 한편, Amazon Bedrock의 AgentCore는 AWS 환경 내 에이전트를 위한 안전하고 확장 가능한 인프라를 제공하여 애플리케이션 전반에서 안정적인 운영을 지원합니다. 이러한 요소들이 결합되어 프로토타입 빌드에서 프로덕션에 바로 적용 가능하고 관찰 가능하며 확장 가능한 AI 에이전트로의 원활한 전환을 보장합니다.

이 확장된 소프트웨어 파트너십은 음성 처리용 NVIDIA Riva, 과학 워크로드용 NVIDIA BioNeMo와 같은 NVIDIA NIM 마이크로서비스 및 프레임워크를 포함하여 AWS 상의 기존 NVIDIA 통합을 기반으로 합니다. 이러한 기능은 Amazon SageMaker 및 Amazon Bedrock에서의 모델 개발 및 배포와 결합되어 익숙한 AWS 서비스를 사용하면서 에이전트 AI, 음성 AI 및 과학 애플리케이션의 배포를 가속화하도록 설계되었습니다.

AWS에서 물리적 AI 및 로봇 공학 가속화

이러한 협업은 물리적 AI와 로봇공학에도 확대되었는데, 로봇 모델의 훈련과 배포는 고품질 데이터 세트와 강력한 시뮬레이션 프레임워크에 달려 있습니다.

NVIDIA Cosmos 월드 파운데이션 모델(WFM)이 이제 Amazon EKS에서 NVIDIA NIM 마이크로서비스로 제공됩니다. 이를 통해 고객은 안정성과 유연성을 보장하는 클라우드 네이티브 쿠버네티스 기반 환경에서 실시간 로봇 제어 및 시뮬레이션 워크로드를 실행할 수 있습니다.

대규모 합성 데이터 생성과 같은 배치 지향 및 오프라인 작업의 경우, Cosmos WFM은 AWS Batch에서 컨테이너 형태로도 제공됩니다. 이를 통해 다양한 월드 상태 및 시나리오를 대규모로 생성하는 고처리량 워크플로를 지원합니다.

코스모스에서 생성된 세계 상태는 NVIDIA Isaac Sim 및 Isaac Lab과 같은 오픈소스 시뮬레이션 및 학습 프레임워크에서 로봇 행동을 훈련하고 검증하는 데 사용될 수 있습니다. 이 프로세스는 다양한 개발 및 테스트 단계를 지원하는 완전한 파이프라인을 생성합니다. 코스모스 WFM은 초기에 구조화되고 다양한 환경을 생성하여 광범위한 평가 시나리오를 제공합니다.

다음으로, Isaac Sim과 Isaac Lab은 이러한 환경 내에서 로봇 시스템과 정책을 시뮬레이션합니다. 이 시뮬레이션 단계에서는 통제된 환경에서 로봇 동작을 철저히 테스트하고 개선할 수 있습니다. 마지막으로, 실제 로봇에 배포하기 전에 시뮬레이션을 통해 모델을 검증합니다. 이러한 접근 방식은 반복 테스트와 관련된 위험을 최소화하고 비용을 절감하여 더욱 안정적이고 효율적인 개발 주기를 보장합니다.

다양한 로봇 회사들이 로봇 개발 라이프사이클 전반에 걸쳐 AWS 기반 NVIDIA Isaac 플랫폼을 이미 활용하고 있습니다. Agility Robotics, Agile Robots, ANYbotics, Diligent Robotics, Dyna Robotics, Field AI, Haply Robotics, Lightwheel, RIVR, Skild AI 등이 여기에 포함됩니다. 이들의 활용 사례는 로봇 생성 데이터 수집, 저장 및 처리부터 실제 애플리케이션 확장에 필요한 훈련 및 시뮬레이션 작업까지 다양합니다.

장기 협력 및 산업 포지셔닝

이번 발표 확대는 AWS와 NVIDIA의 오랜 협력 관계를 더욱 강화합니다. 최근 NVIDIA는 AWS 글로벌 GenAI 인프라 및 데이터 파트너상(AWS Global GenAI Infrastructure and Data Partner of the Year)을 수상했습니다. 이 상은 AWS Generative AI Competency를 보유한 기술 파트너를 인정하는 것으로, 벡터 임베딩, 데이터 저장 및 관리, 그리고 다양한 데이터 형식에 걸친 합성 데이터 생성을 지원하는 파트너를 선정합니다.

이번 협력 확대를 통해 AWS와 NVIDIA는 긴밀하게 통합된 클라우드 규모의 AI 플랫폼을 제공할 수 있게 되었습니다. 이러한 플랫폼은 성능 및 주권(sovereignty) 요구를 모두 충족하는 동시에 기업이 실험적 AI 프로젝트에서 대규모 프로덕션 배포까지 더욱 간편하게 진행할 수 있도록 지원합니다.

StorageReview에 참여

뉴스레터 | 유튜브 | 팟캐스트 ( 아이튠즈 / 스포티파이) | 인스타그램 | 트위터 | 틱톡 | RSS 피드

해롤드 프리츠

저는 IBM이 Selectric을 만든 이후로 기술 산업에 종사해 왔습니다. 하지만 내 배경은 글쓰기입니다. 그래서 저는 프리세일즈 사업에서 벗어나 제 뿌리로 돌아가서 약간의 글을 쓰지만 여전히 기술 분야에 참여하기로 결정했습니다.