StorageReview.com

AWS e NVIDIA ampliano la collaborazione su NVLink Fusion, Blackwell e AI Factory

AI  ◇  Impresa

In occasione di AWS re:Invent, NVIDIA e Amazon Web Services hanno annunciato una partnership rafforzata incentrata su tecnologie di interconnessione, infrastrutture cloud, modelli aperti e intelligenza artificiale fisica. Questa collaborazione approfondisce l'integrazione di NVIDIA con lo stack AWS, coprendo silicio personalizzato, networking, software di intelligenza artificiale e simulazione robotica. L'attenzione è rivolta all'intelligenza artificiale su scala produttiva e ai requisiti per il cloud sovrano.

NVLink Fusion per AWS Custom Silicon e infrastruttura AI di nuova generazione

Un punto chiave dell'annuncio è il supporto di AWS per NVIDIA NVLink Fusion. AWS concederà in licenza NVLink Fusion per la creazione di un'infrastruttura di intelligenza artificiale personalizzata. AWS prevede di aggiungere la tecnologia NVLink Fusion alla sua ampia gamma di chip progettati su misura. Tra questi, gli acceleratori Trainium4 di nuova generazione, pensati per attività di inferenza e per l'addestramento di modelli di intelligenza artificiale agentica. Utilizzando NVIDIA NVLink Fusion, AWS collegherà l'interconnessione scale-up NVIDIA NVLink con l'architettura rack NVIDIA MGX e il suo chip personalizzato. L'obiettivo è aumentare le prestazioni, semplificare la progettazione del sistema e accelerare la commercializzazione delle piattaforme di intelligenza artificiale di nuova generazione su scala cloud.

AWS trae vantaggio anche dall'ecosistema di fornitori NVLink Fusion, che fornisce una soluzione completa su scala rack, inclusi rack, chassis, sistemi di alimentazione e sottosistemi di raffreddamento. Questo ecosistema semplifica l'approvvigionamento e l'integrazione per AWS, che realizza infrastrutture ad alta densità e ottimizzate per l'intelligenza artificiale. Trainium4 è progettato per funzionare perfettamente con NVLink e NVIDIA MGX. Questa segna la prima fase di una collaborazione multigenerazionale su NVLink Fusion tra NVIDIA e AWS. AWS ha già implementato rack NVIDIA MGX su larga scala con GPU NVIDIA; l'integrazione di NVLink Fusion mira a standardizzare e semplificare l'implementazione e la gestione dei sistemi su diverse piattaforme, combinando il silicio AWS e l'hardware NVIDIA.

Inoltre, AWS utilizza diverse CPU Graviton che gestiscono una vasta gamma di carichi di lavoro generici e cloud-native. Il sistema AWS Nitro svolge un ruolo essenziale supportando la virtualizzazione, la sicurezza e l'offload del piano dati, migliorando così le prestazioni e la protezione complessive dei servizi AWS.

Il fondatore e CEO di NVIDIA, Jensen Huang, ha definito la collaborazione come una risposta alla crescente domanda di GPU computing, trainata da modelli di intelligenza artificiale più performanti e da una maggiore adozione da parte delle aziende. Ha descritto l'integrazione di NVLink Fusion con AWS Trainium4 come un modo per fondere l'architettura scalabile di NVIDIA con il silicio personalizzato di AWS per creare piattaforme accelerate di nuova generazione che alimentano quella che ha definito una rivoluzione industriale dell'intelligenza artificiale. Huang ha affermato che l'obiettivo è rendere l'intelligenza artificiale avanzata più accessibile e orientare l'infrastruttura globale verso un'intelligenza diffusa.

Il CEO di AWS, Matt Garman, ha sottolineato la solidità del rapporto quindicennale tra le due aziende, sottolineando che la collaborazione contribuisce allo sviluppo di infrastrutture di intelligenza artificiale su larga scala. Ha menzionato i risultati ottenuti dai clienti, tra cui prestazioni più elevate, maggiore efficienza e maggiore scalabilità. Garman ha sottolineato il supporto di NVIDIA NVLink Fusion su Trainium, Graviton e Nitro per sbloccare nuove capacità tecniche e favorire un'innovazione più rapida per i clienti AWS.

Architettura NVIDIA Vera Rubin su AWS

In ambito networking, l'architettura NVIDIA Vera Rubin su AWS supporterà AWS Elastic Fabric Adapter e Nitro System. Questa soluzione offre ai clienti opzioni di networking flessibili e robuste, garantendo al contempo la piena compatibilità con l'infrastruttura cloud esistente di AWS e accelerando l'erogazione di nuovi servizi di intelligenza artificiale.

Convergenza di scala e sovranità con Blackwell e AWS AI Factories

AWS sta ampliando il suo portfolio di calcolo accelerato con l'aggiunta dell'architettura NVIDIA Blackwell, che include i sistemi NVIDIA HGX B300 e le GPU NVIDIA GB300 NVL72 per cluster di training e inferenza su larga scala. Inoltre, le GPU NVIDIA RTX PRO 6000 Blackwell Server Edition , progettate per applicazioni visive e grafiche intensive, saranno presto disponibili su AWS.

Queste GPU fanno parte dell'infrastruttura portante di AWS AI Factory. Questa nuova offerta cloud di intelligenza artificiale è rivolta ai clienti che necessitano di un'infrastruttura di intelligenza artificiale dedicata nei propri data center, gestita da AWS. Il modello fornisce un'infrastruttura di intelligenza artificiale di livello cloud all'interno di strutture controllate dal cliente. Ciò garantisce alle organizzazioni il controllo e la sicurezza delle proprie risorse di intelligenza artificiale all'interno dei propri ambienti.

Si concentra inoltre sul controllo dei dati, soddisfacendo i requisiti locali di residenza dei dati. In questo modo, le informazioni sensibili rimangono entro limiti geografici specifici, soddisfacendo gli standard normativi e consentendo al contempo operazioni fluide. Il modello offre accesso a piattaforme di formazione e inferenza avanzate su larga scala, consentendo agli utenti di sviluppare, implementare e gestire in modo efficiente soluzioni di intelligenza artificiale complesse su grandi set di dati.

Impegno globale

NVIDIA e AWS si impegnano a implementare cloud di intelligenza artificiale sovrani in tutto il mondo e a portare funzionalità di intelligenza artificiale avanzate nelle regioni che necessitano di conformarsi a rigorose policy di intelligenza artificiale sovrana. Con AWS AI Factories, le due aziende intendono fornire un'infrastruttura di intelligenza artificiale sicura e sovrana che offra una capacità di elaborazione senza pari, soddisfacendo al contempo i crescenti requisiti normativi e di sovranità dei dati.

Per le organizzazioni del settore pubblico, AWS considera AI Factories un punto di svolta significativo nella strategia federale per il supercalcolo e l'intelligenza artificiale. I clienti possono combinare l'infrastruttura cloud affidabile, sicura e scalabile di AWS con le GPU NVIDIA Blackwell e l'intera suite di calcolo accelerato NVIDIA, inclusi gli switch Ethernet NVIDIA Spectrum-X .

L'obiettivo è creare un sistema unificato che consenta ai clienti di accedere a servizi e funzionalità di intelligenza artificiale avanzati, consentendo loro di addestrare e distribuire modelli di grandi dimensioni su larga scala. Inoltre, le organizzazioni mantengono uno stretto controllo sui dati proprietari, nel rispetto delle normative locali.

Software NVIDIA su AWS: semplificare l'esperienza degli sviluppatori e dei dati

NVIDIA e AWS stanno collaborando anche sui livelli software e dati per accelerare l'elaborazione dei dati non strutturati e gestire i cicli di vita degli agenti.

Amazon OpenSearch Service offre ora l'accelerazione GPU serverless per la creazione di indici vettoriali, basata su NVIDIA cuVS, una libreria open source per la ricerca e il clustering vettoriali accelerati da GPU. Questa integrazione punta a far sì che le GPU diventino il motore predefinito per carichi di lavoro basati su dati non strutturati e ad alta densità vettoriale.

I primi utilizzatori segnalano miglioramenti significativi nei loro flussi di lavoro, notando che l'indicizzazione vettoriale è fino a dieci volte più veloce, con un conseguente aumento significativo dell'efficienza. Inoltre, questo nuovo approccio costa circa un quarto rispetto ai metodi tradizionali, con conseguenti risparmi significativi. Questi progressi sono considerati una svolta, in quanto offrono agli utenti vantaggi sia in termini di velocità che economici.

Questi miglioramenti in termini di prestazioni e costi contribuiscono a ridurre la latenza di ricerca, accelerare i percorsi di scrittura e migliorare la produttività per modelli di intelligenza artificiale dinamici, come la generazione basata sul recupero, in cui l'indicizzazione vettoriale rapida è fondamentale. AWS è il primo grande fornitore di servizi cloud a offrire l'indicizzazione vettoriale serverless supportata dalle GPU NVIDIA.

Per far passare gli agenti di intelligenza artificiale dalla prova di concetto alla produzione, i clienti hanno bisogno di vedere dati sulle prestazioni, strumenti di ottimizzazione e una gestione scalabile.

NVIDIA e AWS stanno collaborando per creare una soluzione end-to-end completa, integrando diversi componenti chiave. Questa collaborazione mira a semplificare i processi di sviluppo, gestione e ottimizzazione degli agenti sulle loro piattaforme.

Al centro di questa iniziativa ci sono gli agenti Strands, progettati per facilitare la creazione e la gestione degli agenti. A completamento, NVIDIA NeMo Agent Toolkit fornisce strumenti avanzati per la profilazione approfondita, l'ottimizzazione e la messa a punto delle prestazioni, garantendo un'implementazione efficiente. Nel frattempo, AgentCore di Amazon Bedrock fornisce un'infrastruttura sicura e scalabile per gli agenti all'interno dell'ambiente AWS, consentendo operazioni affidabili tra le applicazioni. Insieme, questi elementi sono progettati per garantire una progressione fluida dalle build di prototipo ad agenti di intelligenza artificiale pronti per la produzione, osservabili e scalabili.

Questa partnership software ampliata si basa sulle integrazioni NVIDIA esistenti su AWS, inclusi i microservizi NVIDIA NIM e i framework come NVIDIA Riva per la sintesi vocale e NVIDIA BioNeMo per i carichi di lavoro scientifici. Queste funzionalità, combinate con lo sviluppo e la distribuzione di modelli su Amazon SageMaker e Amazon Bedrock, sono progettate per accelerare la distribuzione di intelligenza artificiale (IA) agentica, IA vocale e applicazioni scientifiche utilizzando i servizi AWS più noti.

Accelerare l'intelligenza artificiale fisica e la robotica su AWS

La collaborazione si estende anche all'intelligenza artificiale fisica e alla robotica, dove l'addestramento e l'implementazione di modelli robotici dipendono da set di dati di alta qualità e da solidi framework di simulazione.

I modelli di base mondiali (WFM) di NVIDIA Cosmos sono ora disponibili come microservizi NVIDIA NIM su Amazon EKS. Questo offre ai clienti la possibilità di eseguire carichi di lavoro di controllo e simulazione robotica in tempo reale in un ambiente cloud-native basato su Kubernetes, che garantisce affidabilità e flessibilità.

Per attività batch e offline, come la generazione di dati sintetici su larga scala, i WFM di Cosmos sono offerti anche come container su AWS Batch. Questo supporta flussi di lavoro ad alta produttività per la generazione di diversi stati e scenari globali su larga scala.

Gli stati del mondo generati da Cosmos possono essere utilizzati per addestrare e convalidare i comportamenti dei robot in framework di simulazione e apprendimento open source come NVIDIA Isaac Sim e Isaac Lab. Questo processo crea una pipeline completa che supporta diverse fasi di sviluppo e test. Inizialmente, i WFM di Cosmos generano ambienti strutturati e diversificati, fornendo un'ampia gamma di scenari di valutazione.

Successivamente, Isaac Sim e Isaac Lab simulano sistemi robotici e policy all'interno di questi ambienti. Questa fase di simulazione consente di testare e perfezionare approfonditamente i comportamenti robotici in un ambiente controllato. Infine, i modelli vengono validati tramite simulazione prima dell'implementazione su robot reali. Questo approccio riduce al minimo i rischi e i costi legati ai test iterativi, garantendo un ciclo di sviluppo più affidabile ed efficiente.

Diverse aziende di robotica utilizzano già la piattaforma NVIDIA Isaac su AWS durante l'intero ciclo di vita dello sviluppo della robotica. Questo gruppo include Agility Robotics, Agile Robots, ANYbotics, Diligent Robotics, Dyna Robotics, Field AI, Haply Robotics, Lightwheel, RIVR e Skild AI. I loro casi d'uso spaziano dalla raccolta, archiviazione ed elaborazione dei dati generati dai robot alle attività di addestramento e simulazione necessarie per scalare le applicazioni del mondo reale.

Collaborazione a lungo termine e posizionamento nel settore

Questi annunci ampliati si basano sulla consolidata collaborazione tra AWS e NVIDIA. Di recente, NVIDIA ha ricevuto il premio AWS Global GenAI Infrastructure and Data Partner of the Year. Questo premio premia i partner tecnologici che vantano la competenza AWS Generative AI, evidenziando quelli che supportano l'integrazione di vettori, l'archiviazione e la gestione dei dati e la generazione di dati sintetici in più formati e formati.

Questa collaborazione ampliata consente ad AWS e NVIDIA di fornire piattaforme di intelligenza artificiale (IA) strettamente integrate e su scala cloud. Queste piattaforme mirano a soddisfare sia le esigenze di prestazioni che di sovranità, offrendo al contempo alle aziende un percorso più semplice per passare dai progetti di IA sperimentali alle implementazioni di produzione su larga scala.

Interagisci con StorageReview

Newsletter | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Feed RSS

Harold Fritt

Lavoro nel settore tecnologico da quando IBM ha creato Selectric. Il mio background, però, è la scrittura. Così ho deciso di uscire dal business delle prevendite e tornare alle mie radici, scrivendo un po’ ma rimanendo comunque coinvolto nella tecnologia.