StorageReview.com

AWS와 NVIDIA는 2027~2028년에 2만 개의 GPU를 추가로 배포하여 Trainium에 Vera CPU와 맞춤형 NVHBM을 제공할 예정입니다.

클라우드  ◇  기업

아마존 웹 서비스(AWS)와 엔비디아(NVIDIA)는 공동 인프라 구축 사업을 대폭 확장한다고 발표했습니다. 2027년에서 2028년 사이에 AWS 데이터 센터에 2만 개의 NVIDIA GPU를 추가로 배포할 계획입니다. 16년간의 엔지니어링 협력 관계를 기반으로 하는 이번 확장된 협력은 가속기 용량, 호스트 CPU 아키텍처, 고대역폭 인터커넥트, 정부 기관 대상 구축, 데이터 처리 가속 파이프라인 등 AI 인프라의 엔드투엔드 확장을 목표로 합니다.

AWS의 CEO인 맷 가먼은 “고객은 AI 워크로드에 가장 적합한 도구를 자유롭게 선택할 수 있기를 원하며, 모든 것이 원활하게 연동된다는 확신을 갖고 싶어합니다.”라고 말했습니다. NVIDIA의 창립자 겸 CEO인 젠슨 황은 두 회사가 “AI 시대의 가장 강력한 성장 동력 중 하나를 구축했으며, 수요가 모든 예측을 뛰어넘고 있다”고 언급하며, GPU, CPU, 네트워킹, 오픈 소스 모델, 그리고 에이전트형 및 물리적 AI를 대규모로 구현하는 소프트웨어에 이르기까지 사업 확장을 강조했습니다.

AWS와 NVIDIA 로고는 AWS 인프라에 2만 개의 GPU가 추가되는 확장된 파트너십을 나타냅니다.

확장형 GPU 배포 및 EC2 G7 인스턴스

수년에 걸쳐 진행될 이번 배포를 통해 2만 개의 NVIDIA Blackwell Ultra, Rubin 및 Rubin Ultra GPU가 AWS 글로벌 인프라에 통합될 예정이며, 이는 분산 학습, 과학 시뮬레이션, 기업 자동화 및 에이전트 기반 워크플로를 처리하는 대규모 AI 팩토리를 지원하도록 특별히 설계되었습니다.

NVIDIA가 공개한 AWS EC2 G7 인스턴스에 탑재될 예정인 패시브 쿨링 방식의 RTX PRO Blackwell Server Edition GPU 렌더링 이미지입니다.

AWS는 Amazon EC2 G7 인스턴스에 NVIDIA RTX PRO 4500 Blackwell Server Edition GPU를 도입하여 현세대 Blackwell 제품군을 확장하고 있습니다. AWS는 RTX PRO 4500으로 가속되는 인스턴스를 제공하는 최초의 주요 클라우드 제공업체로, 이전 세대 EC2 G6 인스턴스 대비 최대 4.6배 높은 AI 추론 성능과 2.1배 높은 그래픽 처리량을 제공합니다. 이러한 고밀도 노드 전반에 걸쳐 클러스터 처리량과 낮은 지연 시간을 유지하기 위해 양사는 대규모 GPU 학습 클러스터에 최적화된 NVIDIA Spectrum 네트워킹 기술 개발에 협력하고 있습니다.

NVIDIA Vera CPU 및 맞춤형 HBM을 탑재한 NVLink Fusion

AWS와 NVIDIA는 다단계 에이전트형 AI 워크로드의 컴퓨팅 요구 사항을 충족하기 위해 NVIDIA Vera CPU 기반 인프라를 AWS에 제공하기 위해 협력하고 있습니다. NVIDIA는 Vera가 차세대 AI를 위해 특별히 설계되었으며, AWS 고객에게 고성능 CPU 옵션과 가속 인프라를 제공하여 자체 맞춤형 실리콘부터 파트너 CPU 및 가속기에 이르기까지 가능한 한 가장 폭넓은 컴퓨팅 선택권을 제공하려는 AWS의 전략을 보완한다고 설명합니다.

NVIDIA Vera CPU 모듈은 메모리 패키지로 둘러싸인 두 개의 컴퓨팅 다이로 렌더링됩니다.

NVIDIA와 아마존의 Annapurna Labs는 인터커넥트 및 메모리 영역에서 NVIDIA NVLink Fusion을 중심으로 파트너십을 확장하고 있습니다. 차세대 AWS Trainium 프로세서를 위해 처음 도입된 NVLink Fusion은 이제 메모리 공급업체와의 협력을 통해 NVIDIA의 맞춤형 고대역폭 메모리(NVHBM) 기술 과 결합됩니다. NVIDIA는 이러한 결합을 통해 Trainium이 더 빠르고 전력 효율이 높은 메모리를 사용할 수 있게 되어 Annapurna Labs가 Trainium 실리콘과 NVIDIA GPU를 공유형 확장형 랙 아키텍처 내에서 결합할 수 있다고 밝혔습니다.

연방 및 국가 안보 업무량을 위한 전용 AI 공장

정부 부문 요구사항을 충족하기 위해 AWS와 NVIDIA는 100,000만 개의 GPU를 탑재한 전용 AI 팩토리를 공동 개발하고 있으며, 이 팩토리는 격리되고 안전한 AWS 인프라에 배포됩니다. 이 환경은 민감한 연방 기관 및 국방 관련 워크로드를 지원하도록 설계되었으며, 영향 등급 6(IL6) 이상의 기밀 등급에 대한 규정 준수 및 운영 보안을 제공합니다.

핵심 플랫폼 통합: Nitro, 데이터 처리 및 로봇 공학

확대된 제휴는 AWS 스택 전반에 걸쳐 기존의 핵심 기술 통합을 계속 활용합니다.

  • AWS Nitro 시스템 및 EFA: 모든 NVIDIA GPU 및 Trainium 기반 EC2 인스턴스는 오프로드된 가상화 및 하드웨어 보안을 위해 AWS Nitro 시스템을 사용하며, 회선 속도와 낮은 지연 시간을 갖춘 확장형 상호 연결성을 제공하기 위해 Elastic Fabric Adapter(EFA) 네트워킹과 결합됩니다.
  • 관리형 개방형 모델: NVIDIA Nemotron 오픈 모델 제품군은 AWS에 기본적으로 통합되어 있으며, Amazon Bedrock에서는 완전 관리형 서버리스 엔드포인트로, Amazon SageMaker에서는 사용자 정의 가능한 파운데이션 모델로 제공됩니다.
  • 하드웨어 가속 분석 및 검색: Amazon EMR은 Amazon EC2 G7 인스턴스와 NVIDIA cuDF 라이브러리를 활용하여 표준 CPU 구성 대비 최대 3.7배 빠른 데이터 처리 속도와 30% 향상된 가격 대비 성능을 제공합니다. 또한 Amazon OpenSearch Service는 NVIDIA CUDA-X cuVS 라이브러리를 통해 전용 GPU를 활용하여 벡터 인덱싱을 수행함으로써 관리형 및 서버리스 배포 환경 모두에서 인프라 비용을 약 1/4로 줄이면서 인덱스 구축 시간을 최대 9배까지 단축합니다.
  • 물리적 AI 및 로봇 자동화: Amazon Robotics는 NVIDIA Jetson 엣지 컴퓨팅 모듈, Omniverse 시뮬레이션 라이브러리, Isaac 로봇 플랫폼을 포함하는 NVIDIA의 물리적 AI 포트폴리오를 통합하고 있습니다. GPU 가속 EC2 인스턴스에서 실행되는 이 파이프라인은 자동화된 창고 시스템을 위한 대규모 합성 데이터 생성, 시뮬레이션, 로봇 교육, 경로 최적화, 기능 안전 및 실제와 시뮬레이션 간의 검증을 지원합니다.

StorageReview에 참여

뉴스레터 | 유튜브 | 팟캐스트 ( 아이튠즈 / 스포티파이) | 인스타그램 | 트위터 | 틱톡 | RSS 피드

해롤드 프리츠

저는 IBM이 Selectric을 만든 이후로 기술 산업에 종사해 왔습니다. 하지만 내 배경은 글쓰기입니다. 그래서 저는 프리세일즈 사업에서 벗어나 제 뿌리로 돌아가서 약간의 글을 쓰지만 여전히 기술 분야에 참여하기로 결정했습니다.