StorageReview.com

AWS y NVIDIA amplían su colaboración en NVLink Fusion, Blackwell y AI Factories

AI  ◇  Empresa

En AWS re:Invent, NVIDIA y Amazon Web Services anunciaron una colaboración reforzada centrada en la tecnología de interconexión, la infraestructura en la nube, los modelos abiertos y la IA física. Esta colaboración profundiza la integración de NVIDIA con la pila de AWS, abarcando silicio personalizado, redes, software de IA y simulación robótica. El enfoque se centra en la IA a escala de producción y los requisitos para la nube soberana.

NVLink Fusion para silicio personalizado de AWS e infraestructura de IA de próxima generación

Un punto clave del anuncio es el soporte de AWS para NVIDIA NVLink Fusion. AWS licenciará NVLink Fusion para construir una infraestructura de IA personalizada. AWS planea incorporar la tecnología NVLink Fusion a su amplia gama de silicio de diseño personalizado. Esto incluye aceleradores Trainium4 de última generación, diseñados para tareas de inferencia y entrenamiento de modelos de IA con agentes. Mediante NVIDIA NVLink Fusion, AWS conectará la interconexión de escalado vertical de NVIDIA NVLink con la arquitectura de rack NVIDIA MGX y su silicio personalizado. El objetivo es mejorar el rendimiento, simplificar el diseño de sistemas y acelerar la preparación para el mercado de plataformas de IA de próxima generación a escala de la nube.

AWS también se beneficia del ecosistema de proveedores NVLink Fusion, que ofrece una solución completa a escala de rack, que incluye subsistemas de rack, chasis, suministro de energía y refrigeración. Este ecosistema facilita la adquisición e integración de AWS, ya que construye una infraestructura de alta densidad optimizada para IA. Trainium4 está diseñado para funcionar a la perfección con NVLink y NVIDIA MGX. Esto marca la primera fase de una colaboración multigeneracional de NVLink Fusion entre NVIDIA y AWS. AWS ya ha implementado racks NVIDIA MGX a escala con GPU NVIDIA; la integración de NVLink Fusion busca estandarizar y optimizar la implementación y la gestión de sistemas en diversas plataformas, combinando silicio de AWS y hardware de NVIDIA.

Además, AWS utiliza varias CPU Graviton que gestionan diversas cargas de trabajo de propósito general y nativas de la nube. El sistema AWS Nitro desempeña un papel esencial al respaldar la virtualización, la seguridad y la descarga del plano de datos, mejorando así el rendimiento general y la protección de los servicios de AWS.

Jensen Huang, fundador y CEO de NVIDIA, definió la colaboración como una respuesta a la creciente demanda de computación en GPU impulsada por modelos de IA más potentes y una mayor adopción empresarial. Describió la integración de NVLink Fusion con AWS Trainium4 como una forma de fusionar la arquitectura de escalabilidad de NVIDIA con el silicio personalizado de AWS para crear plataformas aceleradas de próxima generación que impulsen lo que denominó una revolución industrial de la IA. Huang afirmó que el objetivo es hacer que la IA avanzada sea más accesible y avanzar hacia una infraestructura global de inteligencia generalizada.

Matt Garman, CEO de AWS, destacó la solidez de la relación de 15 años entre ambas compañías, señalando que esta colaboración impulsa el desarrollo de infraestructuras de IA a gran escala. Mencionó los resultados para los clientes, como un mayor rendimiento, una mayor eficiencia y una mayor escalabilidad. Garman destacó el soporte de NVIDIA NVLink Fusion en Trainium, Graviton y Nitro para impulsar nuevas capacidades técnicas y acelerar la innovación para los clientes de AWS.

Arquitectura de NVIDIA Vera Rubin en AWS

En cuanto a redes, la arquitectura NVIDIA Vera Rubin en AWS será compatible con AWS Elastic Fabric Adapter y el sistema Nitro. Este diseño ofrece a los clientes opciones de red flexibles y robustas, a la vez que garantiza la compatibilidad total con la infraestructura de nube existente de AWS y acelera la entrega de nuevos servicios de IA.

Convergencia de escala y soberanía con Blackwell y AWS AI Factories

AWS está ampliando su cartera de computación acelerada con la incorporación de la arquitectura NVIDIA Blackwell, que incluye los sistemas NVIDIA HGX B300 y las GPU NVIDIA GB300 NVL72 para clústeres de entrenamiento e inferencia a gran escala. Además, se espera que las GPU NVIDIA RTX PRO 6000 Blackwell Server Edition , diseñadas para aplicaciones visuales y gráficas intensivas, estén disponibles próximamente en AWS.

Estas GPU forman parte de la infraestructura principal de AWS AI Factories. Esta nueva oferta de IA en la nube está dirigida a clientes que necesitan una infraestructura de IA dedicada en sus propios centros de datos, gestionada por AWS. El modelo ofrece infraestructura de IA de nivel de nube en instalaciones controladas por el cliente. Esto garantiza que las organizaciones mantengan la supervisión y la seguridad de sus recursos de IA en sus propios entornos.

También se centra en el control de datos mediante el cumplimiento de los requisitos locales de residencia de datos. De esta forma, la información confidencial se mantiene dentro de los límites geográficos especificados, cumpliendo con las normas regulatorias y permitiendo un funcionamiento fluido. El modelo ofrece acceso a plataformas avanzadas de entrenamiento e inferencia a escala, lo que permite a los usuarios desarrollar, implementar y gestionar eficientemente soluciones de IA complejas en grandes conjuntos de datos.

Compromiso Mundial

NVIDIA y AWS se comprometen a implementar nubes de IA soberanas en todo el mundo y a llevar capacidades avanzadas de IA a las regiones que necesitan cumplir con estrictas políticas de IA soberana. Con AWS AI Factories, ambas compañías planean proporcionar una infraestructura de IA segura y soberana que ofrece una capacidad de cómputo inigualable, a la vez que cumple con los crecientes requisitos regulatorios y de soberanía de datos.

Para las organizaciones del sector público, AWS considera que AI Factories representa un cambio significativo en la estrategia federal de supercomputación e inteligencia artificial. Los clientes pueden combinar la infraestructura en la nube confiable, segura y escalable de AWS con las GPU NVIDIA Blackwell y la pila completa de computación acelerada de NVIDIA, incluidos los conmutadores Ethernet NVIDIA Spectrum-X .

El objetivo es crear un sistema unificado que permita a los clientes acceder a servicios y capacidades avanzadas de IA, lo que les permite entrenar e implementar modelos de gran tamaño a gran escala. Además, las organizaciones mantienen un control estricto sobre los datos confidenciales que cumplen con las normativas locales.

Software NVIDIA en AWS: simplificando la experiencia de los desarrolladores y los datos

NVIDIA y AWS también están trabajando juntos en capas de software y datos para acelerar el procesamiento de datos no estructurados y administrar los ciclos de vida de los agentes.

Amazon OpenSearch Service ahora ofrece aceleración de GPU sin servidor para la creación de índices vectoriales, con tecnología de NVIDIA cuVS, una biblioteca de código abierto para búsqueda y agrupación de vectores acelerada por GPU. Esta integración permite que las GPU se conviertan en el motor predeterminado para cargas de trabajo de datos no estructurados con gran cantidad de vectores.

Los primeros usuarios reportan mejoras significativas en sus flujos de trabajo, destacando que la indexación vectorial es hasta diez veces más rápida, lo que aumenta significativamente la eficiencia. Además, este nuevo enfoque cuesta aproximadamente una cuarta parte del precio de los métodos tradicionales, lo que se traduce en ahorros significativos. Estos avances se consideran un gran avance, ya que ofrecen a los usuarios ventajas tanto en velocidad como en economía.

Estas mejoras de rendimiento y costo ayudan a reducir la latencia de búsqueda, acelerar las rutas de escritura y mejorar el rendimiento de patrones de IA dinámicos, como la generación aumentada por recuperación, donde la indexación vectorial rápida es crucial. AWS es el primer proveedor importante de nube en ofrecer indexación vectorial sin servidor con el respaldo de GPU NVIDIA.

Para hacer la transición de los agentes de IA desde la prueba de concepto a la producción, los clientes necesitan ver datos de rendimiento, herramientas de optimización y una gestión escalable.

NVIDIA y AWS se unen para crear una solución integral mediante la integración de varios componentes clave. Esta colaboración busca simplificar los procesos de desarrollo, gestión y optimización de agentes en sus plataformas.

En el centro de esta iniciativa se encuentran los Agentes Strands, diseñados para facilitar la creación y gestión de agentes. Como complemento, se encuentra el Kit de Herramientas de Agentes NVIDIA NeMo, que proporciona herramientas avanzadas para la creación de perfiles, el ajuste del rendimiento y la optimización, garantizando una implementación eficiente. Por otro lado, AgentCore de Amazon Bedrock proporciona una infraestructura segura y escalable para los agentes dentro del entorno de AWS, lo que permite operaciones fiables en todas las aplicaciones. Juntos, estos elementos están configurados para garantizar una transición fluida desde la creación de prototipos hasta agentes de IA observables, escalables y listos para producción.

Esta colaboración de software ampliada se basa en las integraciones existentes de NVIDIA en AWS, incluyendo microservicios NVIDIA NIM y frameworks como NVIDIA Riva para voz y NVIDIA BioNeMo para cargas de trabajo científicas. Estas capacidades, combinadas con el desarrollo e implementación de modelos en Amazon SageMaker y Amazon Bedrock, están diseñadas para acelerar la implementación de IA de agencia, IA de voz y aplicaciones científicas mediante el uso de los servicios de AWS habituales.

Aceleración de la IA física y la robótica en AWS

La colaboración también se extiende a la IA física y la robótica, donde el entrenamiento y la implementación de modelos de robots dependen de conjuntos de datos de alta calidad y marcos de simulación sólidos.

Los modelos de base mundial (WFM) de NVIDIA Cosmos ya están disponibles como microservicios NVIDIA NIM en Amazon EKS. Esto ofrece a los clientes una forma de ejecutar cargas de trabajo de control y simulación robótica en tiempo real en un entorno nativo de la nube basado en Kubernetes que garantiza fiabilidad y flexibilidad.

Para tareas por lotes y sin conexión, como la generación de datos sintéticos a gran escala, los WFM de Cosmos también se ofrecen como contenedores en AWS Batch. Esto facilita flujos de trabajo de alto rendimiento para generar diversos estados y escenarios del mundo a escala.

Los estados del mundo generados por Cosmos pueden utilizarse para entrenar y validar el comportamiento de robots en entornos de simulación y aprendizaje de código abierto como NVIDIA Isaac Sim e Isaac Lab. Este proceso crea un flujo de trabajo completo que facilita las diversas etapas de desarrollo y prueba. Inicialmente, los WFM de Cosmos generan entornos estructurados y diversos, lo que proporciona una amplia gama de escenarios de evaluación.

A continuación, Isaac Sim e Isaac Lab simulan sistemas y políticas robóticas en estos entornos. Esta fase de simulación permite realizar pruebas exhaustivas y perfeccionar el comportamiento robótico en un entorno controlado. Finalmente, los modelos se validan mediante simulación antes de su implementación en robots reales. Este enfoque minimiza el riesgo y reduce los costos relacionados con las pruebas iterativas, garantizando un ciclo de desarrollo más fiable y eficiente.

Varias empresas de robótica ya utilizan la plataforma NVIDIA Isaac en AWS durante todo el ciclo de desarrollo. Este grupo incluye Agility Robotics, Agile Robots, ANYbotics, Diligent Robotics, Dyna Robotics, Field AI, Haply Robotics, Lightwheel, RIVR y Skild AI. Sus casos de uso abarcan desde la recopilación, el almacenamiento y el procesamiento de datos generados por robots hasta las tareas de entrenamiento y simulación necesarias para escalar aplicaciones reales.

Colaboración a largo plazo y posicionamiento en la industria

Estos anuncios ampliados refuerzan la larga relación entre AWS y NVIDIA. Recientemente, NVIDIA recibió el premio AWS Global GenAI Infrastructure and Data Partner of the Year. Este premio reconoce a los socios tecnológicos con la Competencia de IA Generativa de AWS, destacando a aquellos que ofrecen integración de vectores, almacenamiento y gestión de datos, y generación de datos sintéticos en múltiples formatos.

Esta colaboración ampliada permite a AWS y NVIDIA ofrecer plataformas de IA a escala de la nube, estrechamente integradas. Estas plataformas buscan satisfacer las necesidades de rendimiento y soberanía, a la vez que ofrecen a las empresas una ruta más sencilla desde proyectos experimentales de IA hasta implementaciones de producción a gran escala.

Interactuar con StorageReview

Boletín informativo | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Canal RSS

harold fritts

He estado en la industria de la tecnología desde que IBM creó Selectric. Mi experiencia, sin embargo, es la escritura. Así que decidí dejar el negocio de preventa y volver a mis raíces, escribir un poco pero seguir involucrado en tecnología.