StorageReview.com

AWS och NVIDIA utökar samarbetet kring NVLink Fusion, Blackwell och AI-fabriker

AI  ◇  Företag

På AWS re:Invent tillkännagav NVIDIA och Amazon Web Services ett förstärkt partnerskap med fokus på sammankopplingsteknik, molninfrastruktur, öppna modeller och fysisk AI. Detta samarbete fördjupar NVIDIAs integration med AWS-stacken och omfattar anpassad kisel, nätverk, AI-programvara och robotsimulering. Fokus ligger på AI i produktionsskala och krav för suveräna moln.

NVLink Fusion för AWS Custom Silicon och nästa generations AI-infrastruktur

En viktig punkt i tillkännagivandet är AWS stöd för NVIDIA NVLink Fusion. AWS skulle licensiera NVLink Fusion för att bygga en anpassad AI-infrastruktur. AWS planerar att lägga till NVLink Fusion-teknik till sitt breda utbud av specialdesignade kisel. Detta inkluderar nästa generations Trainium4-acceleratorer avsedda för inferensuppgifter och agentisk AI-modellträning. Genom att använda NVIDIA NVLink Fusion kommer AWS att länka NVIDIA NVLink-uppskalningskopplingen med NVIDIA MGX-rackarkitekturen och dess anpassade kisel. Målet är att öka prestandan, förenkla systemdesignen och påskynda marknadsberedskapen för nästa generations molnbaserade AI-plattformar.

AWS drar också nytta av leverantörsekosystemet NVLink Fusion, som tillhandahåller en komplett racklösning, inklusive rack-, chassi-, strömförsörjnings- och kylsystem. Detta ekosystem gör upphandling och integration enklare för AWS eftersom de bygger högdensitets-, AI-optimerad infrastruktur. Trainium4 är utformat för att fungera sömlöst med NVLink och NVIDIA MGX. Detta markerar den första fasen i ett flergenerationssamarbete inom NVLink Fusion mellan NVIDIA och AWS. AWS har redan driftsatt NVIDIA MGX-rack i stor skala med NVIDIA GPU:er; integrationen av NVLink Fusion syftar till att standardisera och effektivisera driftsättning och systemhantering över olika plattformar, genom att blanda AWS-kisel och NVIDIA-hårdvara.

Dessutom använder AWS olika Graviton-processorer som hanterar en rad allmänna och molnbaserade arbetsbelastningar. AWS Nitro-systemet spelar en viktig roll genom att stödja virtualisering, säkerhet och dataplansavlastning, vilket förbättrar den övergripande prestandan och skyddet för AWS-tjänster.

NVIDIAs grundare och VD Jensen Huang beskrev samarbetet som ett svar på den växande efterfrågan på GPU-beräkning, driven av mer kapabla AI-modeller och större företagsanvändning. Han beskrev NVLink Fusion-integrationen med AWS Trainium4 som ett sätt att slå samman NVIDIAs uppskalningsarkitektur med AWS anpassade kisel för att skapa nästa generations accelererade plattformar som driver det han kallade en AI-industriell revolution. Huang uppgav att målet är att göra avancerad AI mer tillgänglig och flytta global infrastruktur mot utbredd intelligens.

AWS VD Matt Garman lyfte fram djupet av det 15-åriga samarbetet mellan de två företagen och noterade att samarbetet främjar storskalig AI-infrastruktur. Han nämnde kundresultat, inklusive högre prestanda, bättre effektivitet och ökad skalbarhet. Garman betonade stöd för NVIDIA NVLink Fusion i Trainium, Graviton och Nitro för att låsa upp nya tekniska funktioner och uppmuntra snabbare innovation för AWS-kunder.

NVIDIA Vera Rubin-arkitektur på AWS

Inom nätverk kommer NVIDIA Vera Rubin-arkitekturen på AWS att stödja AWS Elastic Fabric Adapter och Nitro System. Denna design erbjuder kunderna flexibla och robusta nätverksalternativ samtidigt som den säkerställer full kompatibilitet med AWS befintliga molninfrastruktur och accelererar leveransen av nya AI-tjänster.

Konvergens av skala och suveränitet med Blackwell och AWS AI-fabriker

AWS utökar sin portfölj för accelererade databehandlingslösningar genom att lägga till NVIDIA Blackwell-arkitekturen, inklusive NVIDIA HGX B300-system och NVIDIA GB300 NVL72 GPU:er för storskalig träning och inferenskluster. Dessutom förväntas NVIDIA RTX PRO 6000 Blackwell Server Edition GPU :er, designade för visuella och grafikintensiva applikationer, snart bli tillgängliga på AWS.

Dessa GPU:er är en del av infrastrukturens ryggrad för AWS AI Factories. Detta nya AI-molnerbjudande är för kunder som behöver dedikerad AI-infrastruktur i sina egna datacenter, som hanteras av AWS. Modellen levererar AI-infrastruktur i molnklass inom kundstyrda anläggningar. Detta säkerställer att organisationer upprätthåller översikt och säkerhet över sina AI-resurser i sina egna miljöer.

Den fokuserar också på datakontroll genom att uppfylla lokala krav på datalagring. På så sätt håller sig känslig information inom angivna geografiska gränser, vilket uppfyller regelverk samtidigt som det möjliggör smidig drift. Modellen erbjuder tillgång till avancerade utbildnings- och inferensplattformar i stor skala, vilket gör det möjligt för användare att effektivt utveckla, driftsätta och hantera komplexa AI-lösningar över stora datamängder.

Globala åtaganden

NVIDIA och AWS åtar sig att driftsätta suveräna AI-moln över hela världen och att erbjuda avancerade AI-funktioner till regioner som behöver följa strikta AI-policyer. Med AWS AI Factories planerar de två företagen att tillhandahålla säker, suverän AI-infrastruktur som levererar oöverträffad beräkningskapacitet samtidigt som den uppfyller ökande regulatoriska och datasuveränitetskrav.

För offentliga organisationer ser AWS AI-fabriker som ett betydande skifte inom federal superdator- och AI-strategi. Kunder kan kombinera AWS pålitliga, säkra och skalbara molninfrastruktur med NVIDIA Blackwell-grafikprocessorer och den kompletta NVIDIA-accelererade databehandlingsstacken, inklusive NVIDIA Spectrum-X Ethernet-switchar.

Målet är att skapa ett enhetligt system som ger kunder tillgång till avancerade AI-tjänster och -funktioner, vilket gör det möjligt för dem att träna och driftsätta mycket stora modeller i stor skala. Dessutom upprätthåller organisationer strikt kontroll över proprietär data som följer lokala föreskrifter.

NVIDIA-programvara på AWS: Förenkla utvecklar- och dataupplevelsen

NVIDIA och AWS samarbetar också kring mjukvara och datalager för att påskynda bearbetningen av ostrukturerad data och hantera agentlivscykler.

Amazon OpenSearch Service har nu serverlös GPU-acceleration för vektorindexbyggande, driven av NVIDIA cuVS, ett bibliotek med öppen källkod för GPU-accelererad vektorsökning och klustring. Denna integration skiftar mot att GPU:er blir standardmotorn för vektortunga, ostrukturerade dataarbetsbelastningar.

Tidiga användare rapporterar betydande förbättringar i sina arbetsflöden och noterar att vektorindexering är upp till tio gånger snabbare, vilket ökar effektiviteten avsevärt. Dessutom kostar denna nya metod ungefär en fjärdedel så mycket som traditionella metoder, vilket resulterar i betydande besparingar. Dessa framsteg ses som ett genombrott, vilket ger både snabbhet och ekonomiska fördelar för användarna.

Dessa prestanda- och kostnadsförbättringar bidrar till att minska sökfördröjning, accelerera skrivvägar och förbättra dataflödet för dynamiska AI-mönster, såsom hämtningsförstärkt generering, där snabb vektorindexering är avgörande. AWS är den första stora molnleverantören som erbjuder serverlös vektorindexering med stöd av NVIDIA GPU:er.

För att överföra AI-agenter från koncepttest till produktion behöver kunderna se prestandadata, optimeringsverktyg och skalbar hantering.

NVIDIA och AWS samarbetar för att skapa en komplett helhetslösning genom att integrera flera viktiga komponenter. Samarbetet syftar till att förenkla agentutveckling, hantering och optimeringsprocesser över deras plattformar.

I hjärtat av detta initiativ finns Strands Agents, utformade för att underlätta skapande och hantering av agenter. Detta kompletteras av NVIDIA NeMo Agent Toolkit, som tillhandahåller avancerade verktyg för djup profilering, prestandajustering och optimering, vilket säkerställer effektiv distribution. Samtidigt tillhandahåller Amazon Bedrocks AgentCore en säker och skalbar infrastruktur för agenter inom AWS-miljön, vilket möjliggör tillförlitlig drift över olika applikationer. Tillsammans är dessa element utformade för att säkerställa en smidig utveckling från prototypbyggnationer till produktionsklara, observerbara och skalbara AI-agenter.

Detta utökade mjukvarupartnerskap bygger på befintliga NVIDIA-integrationer på AWS, inklusive NVIDIA NIM-mikrotjänster och ramverk som NVIDIA Riva för tal och NVIDIA BioNeMo för vetenskapliga arbetsbelastningar. Dessa funktioner, i kombination med modellutveckling och distribution på Amazon SageMaker och Amazon Bedrock, är utformade för att påskynda distributionen av agentisk AI, tal-AI och vetenskapliga applikationer samtidigt som man använder välkända AWS-tjänster.

Accelererar fysisk AI och robotik på AWS

Samarbetet sträcker sig även till fysisk AI och robotik, där träning och driftsättning av robotmodeller är beroende av högkvalitativa datamängder och starka simuleringsramverk.

NVIDIA Cosmos World Foundation Models (WFM) finns nu tillgängliga som NVIDIA NIM-mikrotjänster på Amazon EKS. Detta ger kunderna ett sätt att köra realtidsarbetsbelastningar för robotstyrning och simulering i en molnbaserad, Kubernetes-baserad miljö som garanterar tillförlitlighet och flexibilitet.

För batchorienterade och offline-uppgifter, såsom storskalig generering av syntetisk data, erbjuds Cosmos WFM:er även som containrar på AWS Batch. Detta stöder högkapacitetsarbetsflöden för att generera olika världstillstånd och scenarier i stor skala.

Cosmos-genererade världstillstånd kan användas för att träna och validera robotbeteenden i öppen källkod för simulering och inlärningsramverk som NVIDIA Isaac Sim och Isaac Lab. Denna process skapar en komplett pipeline som stödjer olika utvecklings- och testfaser. Inledningsvis genererar Cosmos WFM:er strukturerade, mångsidiga miljöer som tillhandahåller ett brett utbud av utvärderingsscenarier.

Därefter simulerar Isaac Sim och Isaac Lab robotsystem och policyer inom dessa miljöer. Denna simuleringsfas möjliggör grundlig testning och förfining av robotbeteenden i en kontrollerad miljö. Slutligen valideras modellerna genom simulering innan de driftsätts på riktiga robotar. Denna metod minimerar risker och minskar kostnader relaterade till iterativ testning, vilket säkerställer en mer tillförlitlig och effektiv utvecklingscykel.

Olika robotföretag använder redan NVIDIA Isaac-plattformen på AWS under hela robotutvecklingscykeln. Denna grupp inkluderar Agility Robotics, Agile Robots, ANYbotics, Diligent Robotics, Dyna Robotics, Field AI, Haply Robotics, Lightwheel, RIVR och Skild AI. Deras användningsområden sträcker sig från att samla in, lagra och bearbeta robotgenererad data till utbildnings- och simuleringsuppgifter som är nödvändiga för att skala verkliga applikationer.

Långsiktigt samarbete och branschpositionering

Dessa utökade tillkännagivanden bygger på AWS och NVIDIAs långvariga samarbete. Nyligen fick NVIDIA utmärkelsen AWS Global GenAI Infrastructure and Data Partner of the Year. Denna utmärkelse uppmärksammar teknikpartners med AWS Generative AI Competency, och lyfter fram de som stöder vektorinbäddningar, datalagring och hantering samt syntetisk datagenerering över flera dataformer och format.

Detta utökade samarbete ger AWS och NVIDIA möjlighet att leverera tätt integrerade AI-plattformar i molnskala. Dessa plattformar syftar till att tillgodose både prestanda- och suveränitetsbehov samtidigt som de erbjuder företag en enklare väg från experimentella AI-projekt till storskaliga produktionsdistributioner.

Engagera dig med StorageReview

Nyhetsbrev | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | RSS-flöde

Harold Fritts

Jag har varit i teknikbranschen sedan IBM skapade Selectric. Min bakgrund är dock att skriva. Så jag bestämde mig för att lämna pre-sales-branschen och återvända till mina rötter, skriva lite men fortfarande vara involverad i teknik.