在 AWS re:Invent 大會上,NVIDIA 和亞馬遜雲端服務 (AWS) 宣布加強合作夥伴關係,重點關注互連技術、雲端基礎設施、開放模式和實體人工智慧。此次合作深化了 NVIDIA 與 AWS 技術棧的集成,涵蓋客製化晶片、網路、人工智慧軟體和機器人模擬等領域。合作重點在於生產級人工智慧和自主雲的需求。
針對 AWS 客製化晶片和下一代 AI 基礎架構的 NVLink Fusion
此次公告的重點在於AWS對NVIDIA NVLink Fusion的支援。 AWS將獲得NVLink Fusion的授權,用於建立客製化的AI基礎設施。 AWS計畫將NVLink Fusion技術添加到其廣泛的客製化晶片產品線中,其中包括面向推理任務和智能體AI模型訓練的下一代Trainium4加速器。透過使用NVIDIA NVLink Fusion,AWS將把NVIDIA NVLink縱向擴展互連技術與NVIDIA MGX機架架構及其客製化晶片連接起來。此舉旨在提升效能、簡化系統設計,並加速下一代雲端規模AI平台的市場化進程。
AWS 也受惠於 NVLink Fusion 供應商生態系統,該生態系統提供完整的機架級解決方案,包括機架、機箱、電源供應和冷卻子系統。此生態系統簡化了 AWS 建置高密度、AI 優化基礎設施時的採購和整合流程。 Trainium4 旨在與 NVLink 和 NVIDIA MGX 無縫合作。這標誌著 NVIDIA 和 AWS 之間多代 NVLink Fusion 合作的第一階段。 AWS 已大規模部署了搭載 NVIDIA GPU 的 NVIDIA MGX 機架;整合式 NVLink Fusion 旨在標準化和簡化跨不同平台(混合使用 AWS 晶片和 NVIDIA 硬體)的部署和系統管理。
此外,AWS 還使用各種 Graviton CPU 來處理一系列通用和雲端原生工作負載。 AWS Nitro 系統透過支援虛擬化、安全性和資料平面卸載發揮至關重要的作用,從而提升 AWS 服務的整體效能和安全性。
NVIDIA創辦人兼執行長黃仁勳將此次合作定義為對日益增長的GPU運算需求的回應,而這種需求是由更強大的AI模型和更廣泛的企業應用所驅動的。他將NVLink Fusion與AWS Trainium4的整合描述為將NVIDIA的可擴展架構與AWS的客製化晶片結合,從而打造下一代加速平台,推動他所謂的AI產業革命。黃仁勳表示,其目標是讓先進的AI更易於獲取,並推動全球基礎設施朝向廣泛智慧化方向發展。
AWS 執行長 Matt Garman 強調了兩家公司長達 15 年的深厚合作關係,並指出此次合作將推動大規模 AI 基礎設施的發展。他提到了客戶所獲得的成果,包括更高的效能、更佳的效率和更強的可擴充性。 Garman 也強調了 Trainium、Graviton 和 Nitro 對 NVIDIA NVLink Fusion 的支持,旨在為 AWS 客戶解鎖新的技術功能,並促進更快的創新。
NVIDIA Vera Rubin架構在AWS上的應用
在網路方面,基於 AWS 的 NVIDIA Vera Rubin 架構將支援 AWS Elastic Fabric Adapter 和 Nitro 系統。該設計為客戶提供靈活、強大的網路選項,同時確保與 AWS 現有雲端基礎設施的完全相容性,並加速新型 AI 服務的交付。
Blackwell 與 AWS AI Factory 實現規模與主權的融合
AWS 正在擴展其加速運算產品組合,新增了 NVIDIA Blackwell 架構,包括用於大規模訓練和推理叢集的 NVIDIA HGX B300 系統和 NVIDIA GB300 NVL72 GPU。此外,專為視覺和圖形密集型應用設計的NVIDIA RTX PRO 6000 Blackwell 伺服器版 GPU也預計很快就會在 AWS 上推出。
這些GPU是AWS AI Factory基礎架構的核心組成部分。這項全新的AI雲端服務面向需要在自有資料中心部署專用AI基礎架構並由AWS管理的客戶。此模式可在客戶可控的設施內提供雲端級AI基礎設施,確保企業對其自身環境中的AI資源擁有監管權和安全保障。
它還注重資料控制,滿足本地資料駐留要求。這樣,敏感資訊就能保留在指定的地理範圍內,既符合監管標準,又能確保系統順暢運作。該模型提供對大規模高級訓練和推理平台的訪問,使用戶能夠有效地開發、部署和管理跨大型資料集的複雜人工智慧解決方案。
全球承諾
NVIDIA 和 AWS 承諾在全球部署自主 AI 雲,並將先進的 AI 功能帶到需要遵守嚴格自主 AI 政策的地區。透過 AWS AI Factory,兩家公司計劃提供安全、自主的 AI 基礎設施,在滿足日益嚴格的監管和資料主權要求的同時,提供無與倫比的運算能力。
對於公共部門機構而言,AWS 將 AI Factory 視為聯邦政府超級運算和人工智慧策略的重大轉變。客戶可以將 AWS 可靠、安全且可擴展的雲端基礎架構與 NVIDIA Blackwell GPU 和完整的 NVIDIA 加速運算堆疊(包括NVIDIA Spectrum-X乙太網路交換器)結合。
目標是創建一個統一的系統,使客戶能夠存取先進的人工智慧服務和功能,從而大規模地訓練和部署超大型模型。此外,各組織對符合當地法規的專有資料保持嚴格控制。
NVIDIA 軟體在 AWS 上的應用:簡化開發者和資料體驗
NVIDIA 和 AWS 也在軟體和資料層方面合作,以加速非結構化資料的處理並管理代理程式生命週期。
Amazon OpenSearch Service 現已支援無伺服器 GPU 加速,用於建立向量索引,該加速由 NVIDIA cuVS 提供支援。 cuVS 是 GPU 加速向量搜尋和聚類的開源函式庫。此次整合標誌著 GPU 正逐漸成為處理大量向量資料和非結構化資料工作負載的預設引擎。
早期用戶報告稱,他們的工作流程得到了顯著改善,向量索引速度提升高達十倍,效率大幅提高。此外,這種新方法的成本僅為傳統方法的四分之一左右,從而節省了大量資金。這些進步被視為一項突破,為使用者帶來了速度和經濟效益。
這些效能和成本方面的提升有助於降低搜尋延遲、加快寫入速度並提高動態 AI 模式(例如檢索增強生成)的吞吐量,在這些模式中,快速向量索引至關重要。 AWS 是第一家提供由 NVIDIA GPU 支援的無伺服器向量索引的主流雲端服務供應商。
要將 AI 代理從概念驗證過渡到生產,客戶需要看到效能資料、最佳化工具和可擴展的管理。
NVIDIA 和 AWS 正在攜手合作,透過整合多個關鍵元件,打造完整的端對端解決方案。此次合作旨在簡化雙方平台上的代理商開發、管理和最佳化流程。
該計劃的核心是 Strands Agents,旨在幫助用戶建立和管理代理程式。與之相輔相成的是 NVIDIA NeMo Agent Toolkit,它提供了用於深度分析、效能調優和最佳化的高級工具,確保高效部署。同時,Amazon Bedrock 的 AgentCore 為 AWS 環境中的代理提供安全、可擴展的基礎架構,從而實現跨應用程式的可靠運作。這些要素共同確保從原型建構到可用於生產環境、可觀測且可擴展的 AI 代理的平穩過渡。
此次擴展的軟體合作夥伴關係建立在NVIDIA現有AWS整合的基礎上,包括NVIDIA NIM微服務和框架,例如用於語音處理的NVIDIA Riva和用於科學工作負載的NVIDIA BioNeMo。這些功能與Amazon SageMaker和Amazon Bedrock上的模型開發和部署相結合,旨在加速智能體AI、語音AI和科學應用的部署,同時利用用戶熟悉的AWS服務。
在 AWS 上加速實體人工智慧和機器人技術
此次合作也延伸至實體人工智慧和機器人領域,其中機器人模型的訓練和部署依賴高品質的資料集和強大的模擬框架。
NVIDIA Cosmos 世界基礎模型 (WFM) 現已作為 NVIDIA NIM 微服務在 Amazon EKS 上提供。這為客戶提供了一種在雲端原生、基於 Kubernetes 的環境中運行即時機器人控制和模擬工作負載的方法,從而確保可靠性和靈活性。
對於批次處理和離線任務,例如大規模合成資料生成,Cosmos WFM 也以容器的形式部署在 AWS Batch 上。這支援高吞吐量的工作流程,可以大規模產生各種世界狀態和場景。
Cosmos產生的世界狀態可用於在NVIDIA Isaac Sim和Isaac Lab等開源模擬和學習框架中訓練和驗證機器人行為。此過程創建了一個完整的流程,有助於各個開發和測試階段。最初,Cosmos WFM生成結構化且多樣化的環境,從而提供廣泛的評估場景。
接下來,Isaac Sim 和 Isaac Lab 在這些環境中模擬機器人系統和策略。這一模擬階段能夠在受控環境下對機器人行為進行全面測試和改進。最後,在將模型部署到真實機器人之前,會透過模擬進行驗證。這種方法最大限度地降低了風險,並減少了與迭代測試相關的成本,從而確保了更可靠、更有效率的開發週期。
多家機器人公司已在AWS上部署NVIDIA Isaac平台,並將其應用於機器人開發生命週期的各個階段。這些公司包括Agility Robotics、Agile Robots、ANYbotics、Diligent Robotics、Dyna Robotics、Field AI、Haply Robotics、Lightwheel、RIVR和Skild AI。他們的應用場景涵蓋了從收集、儲存和處理機器人產生的數據,到擴展實際應用所需的訓練和模擬任務。
長期合作與產業定位
這些擴展公告建立在AWS和NVIDIA長期合作關係的基礎上。近期,NVIDIA榮獲AWS全球年度最佳GenAI基礎架構與資料合作夥伴獎。該獎項旨在表彰具備AWS生成式人工智慧能力認證的技術合作夥伴,重點關注那些支援向量嵌入、資料儲存和管理以及跨多種資料形式和格式的合成資料生成的合作夥伴。
此次深化合作使AWS和NVIDIA能夠提供緊密整合、雲端規模的AI平台。這些平台旨在滿足效能和主權方面的需求,同時為企業提供一條更直接的路徑,從實驗性AI專案過渡到大規模生產部署。




Amazon