StorageReview.com

Meta se asocia con NVIDIA en la supercomputadora de investigación de IA

Cloud  ◇  Empresa

Meta Platforms ha seleccionado el sistema NVIDIA DGX A100 para AI Research SuperCluster (RSC). Cuando esté completamente implementado, se espera que el RSC de Meta sea el sistema NVIDIA DGX A100 más grande. AI Research SuperCluster (RSC) ya está entrenando nuevos modelos para hacer avanzar la IA.

Supercúmulo de metainvestigación

supercúmulo de metainvestigación

AI Research SuperCluster de Meta presenta cientos de sistemas NVIDIA DGX conectados en una red NVIDIA Quantum InfiniBand para acelerar el trabajo de sus equipos de investigación de IA.

Se espera que RSC esté completamente construido a finales de este año y Meta lo usará para entrenar modelos de IA con más de un billón de parámetros. RSC hará avances en campos como el procesamiento del lenguaje natural para trabajos como la identificación de contenido dañino en tiempo real. Además del rendimiento a escala, Meta citó la confiabilidad extrema, la seguridad, la privacidad y la flexibilidad para manejar "una amplia gama de modelos de IA" como sus criterios clave para RSC.

Las supercomputadoras de IA se construyen combinando múltiples GPU en nodos de cómputo, que luego se conectan mediante una red de alto rendimiento para permitir una comunicación rápida entre dichas GPU. Actualmente, RSC cuenta con un total de 760 sistemas NVIDIA DGX A100 como nodos de cómputo, lo que suma un total de 6,080 GPU; cada GPU A100 es más potente que la V100 utilizada en el sistema anterior.

Redes de SuperCluster de Meta Research

Las GPU se comunican mediante una red Clos de dos niveles NVIDIA Quantum InfiniBand de 200 Gb/s que no presenta sobreasignación. El nivel de almacenamiento de RSC cuenta con 175 petabytes de Pure Storage FlashArray, 46 petabytes de almacenamiento en caché en sistemas Penguin Computing Altus y 10 petabytes de Pure Storage FlashBlade.

meta Research SuperCluster almacenamiento puro 1 meta Research SuperCluster almacenamiento puro 2

Los primeros puntos de referencia en RSC, en comparación con la infraestructura de investigación y producción heredada de Meta, han demostrado que ejecuta flujos de trabajo de visión por computadora hasta 20 veces más rápido, ejecuta la Biblioteca de comunicación colectiva de NVIDIA (NCCL) más de nueve veces más rápido y entrena modelos NLP a gran escala. tres veces más rápido. Eso significa que un modelo con decenas de miles de millones de parámetros puede terminar el entrenamiento en tres semanas, en comparación con las nueve semanas anteriores.

Cuando RSC esté completo, la estructura de la red InfiniBand conectará 16,000 16 GPU como puntos finales, lo que la convierte en una de las redes de este tipo más grandes implementadas hasta la fecha. Además, el sistema de almacenamiento y almacenamiento en caché diseñado puede servir 1 TB/s de datos de entrenamiento y escalarlo hasta XNUMX exabyte.

vista de bastidores meta Research SuperCluster

Si bien RSC está funcionando hoy, su desarrollo continúa. Una vez que se complete la fase dos de construcción de RSC, se espera que sea la supercomputadora de IA más rápida del mundo, con un rendimiento de casi 5 exaflops de cómputo de precisión mixta.

El trabajo continuará hasta 2022 para aumentar la cantidad de GPU de 6,080 a 16,000 2.5, aumentando el rendimiento del entrenamiento de IA en más de 16,000 veces. La estructura InfiniBand se expandirá para admitir 16 XNUMX puertos en una topología de dos capas sin exceso de suscripción. El sistema de almacenamiento tendrá un ancho de banda de entrega objetivo de XNUMX TB/s y una capacidad de escala de exabytes para satisfacer la mayor demanda.

Interactuar con StorageReview

Boletín informativo | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Canal RSS

harold fritts

He estado en la industria de la tecnología desde que IBM creó Selectric. Mi experiencia, sin embargo, es la escritura. Así que decidí dejar el negocio de preventa y volver a mis raíces, escribir un poco pero seguir involucrado en tecnología.