A principios de este año, Intel publicó resultados de rendimiento entre Intel Habana Gaudi2 y el líder del mercado de GPU NVIDIA que ilustraron el compromiso de Intel con la IA y demostraron que la IA no es una categoría única para todos. Al mismo tiempo, un desarrollo conjunto entre investigadores de inteligencia artificial de Intel y Microsoft Research creó BridgeTower, un transformador multimodal previamente capacitado que ofrece tareas de visión y lenguaje de última generación. Hugging Face ha integrado este modelo en su biblioteca de código abierto para aprendizaje automático.
Tarjeta Mezzanine Habana Gaudi2 (Crédito: Intel Corporation)
Hugging Face publicó los resultados originales de las pruebas de rendimiento en una entrada de blog en su sitio web y actualizó los resultados de las pruebas de rendimiento de entrenamiento de IA para Habana Gaudi2 y la GPU H100 de NVIDIA. Según estos resultados, Gaudi2 superó a H100 en la obtención del modelo multimodal transformador BridgeTower, pero Gaudi2, utilizando Optimum Habana , logró un rendimiento 2.5 veces superior al de A100. Estos resultados no solo validaron la posición de Gaudi2 en el campo de la IA, sino también en el entrenamiento de visión y lenguaje.
Optimum Habana es la interfaz entre las bibliotecas Transformers y Difusores y el procesador Gaudi (HPU) de Habana. Proporciona herramientas que permiten cargar, entrenar e inferir modelos fácilmente en configuraciones de HPU única y múltiple para diversas tareas posteriores.
Fondo De La Torre Del Puente
Los modelos de lenguaje visual utilizan codificadores unimodales para adquirir representaciones de datos. Luego, los datos se combinan o se ingresan en un codificador multimodal. BridgeTower se distingue por sus capas puente únicas, que vinculan las capas superiores de codificadores unimodales a cada capa del codificador multimodal, lo que permite una combinación eficiente de datos visuales y textuales en diferentes niveles.
BridgeTower, entrenado con solo 4 millones de imágenes, establece nuevos estándares de rendimiento y ofrece una precisión del 78.73 por ciento en la prueba de respuesta visual a preguntas (VQAv2). Esto supera al mejor modelo anterior en un 1.09 por ciento. Al ampliarse, el modelo tiene una precisión aún mayor del 81.15 por ciento, superando a los modelos entrenados en conjuntos de datos mucho más grandes.
Como modelo de lenguaje de visión de primer nivel, el rendimiento de BridgeTower se debe a su capacidad para cargar datos rápidamente utilizando hardware especial. Estos métodos rápidos de carga de datos son beneficiosos para los modelos de visión, que a menudo enfrentan desafíos de carga de datos.
Información sobre hardware
Las pruebas comparativas actualizadas se basaron en el hardware y software más recientes de NVIDIA y Habana Labs. La GPU NVIDIA H100 Tensor Core es la GPU más reciente y rápida de INVIDIA, con un motor Transformer para ejecuciones especializadas y 80 GB de memoria. Utilizando la tercera versión de la tecnología Tensor Core, la GPU Nvidia A100 Tensor Core está ampliamente disponible entre los proveedores de la nube, con 80 GB de memoria para una velocidad superior a su contraparte de 40 GB.
Habana Labs Habana Gaudi2 es el hardware de IA de segunda generación de Habana Labs que puede albergar hasta 8 HPU, cada una con 96 GB de memoria. Se promociona que tiene características fáciles de usar y, combinado con Optimum Habana, facilita la transferencia de códigos basados en Transformers a Gaudí.
Detalles de evaluación comparativa
La prueba implicó ajustar un modelo BridgeTower con 866 millones de parámetros y entrenarlo en inglés utilizando varias técnicas en varios conjuntos de datos. El siguiente paso implicó un mayor ajuste utilizando el conjunto de datos del New Yorker Caption Contest. Todas las plataformas utilizaron la misma configuración y procesaron lotes de 48 muestras cada uno para obtener resultados consistentes.
Un desafío en tales experimentos es la lenta carga de datos de imágenes. De manera óptima, los datos sin procesar deben enviarse directamente a los dispositivos para su decodificación. La atención se centra ahora en optimizar este proceso de carga de datos.
Optimización de la carga de datos
Para una carga de imágenes más rápida en la CPU, puede resultar útil aumentar los subprocesos. Usando los TrainingArguments de Transformers, el argumento dataloader_num_workers=N puede establecer el número de subprocesos de CPU para la carga de datos. La configuración predeterminada es 0, lo que significa que los datos los carga el proceso principal, pero esto puede no ser eficiente. Aumentarlo puede mejorar la velocidad, pero también aumentará el consumo de RAM. La configuración recomendada es la cantidad de núcleos de CPU. Sin embargo, es mejor experimentar primero para determinar la configuración óptima.
Este punto de referencia tuvo tres ejecuciones distintas:
- Una ejecución de precisión mixta en ocho dispositivos, donde la carga de datos comparte el mismo proceso con otras tareas (dataloader_num_workers=0).
- Una ejecución similar pero con un subproceso dedicado para la carga de datos (dataloader_num_workers=1).
- La misma configuración pero con dos subprocesos dedicados (dataloader_num_workers=2).
Carga de datos acelerada por hardware con Optimum Habana
Para mejorar aún más la velocidad, transfiera las tareas de carga de datos de la CPU a dispositivos aceleradores, como HPU en Gaudi2 o GPU en A100/H100, utilizando el canal de medios de Habana. En lugar de procesar imágenes completamente en la CPU, las imágenes codificadas se pueden enviar directamente a los dispositivos para decodificarlas y aumentarlas. Este enfoque maximiza la potencia informática del dispositivo, pero puede aumentar el consumo de memoria del dispositivo.
Dos métodos eficaces para mejorar los flujos de trabajo de capacitación con imágenes son asignar más recursos del cargador de datos y utilizar dispositivos aceleradores para el procesamiento de imágenes. Al entrenar modelos avanzados de lenguaje de visión como BridgeTower, estas optimizaciones hacen que Habana Gaudi2 con Optimum Habana sea sustancialmente más rápido que sus homólogos de NVIDIA. Habana Gaudi2 es fácil de usar y solo se necesitan algunos argumentos de capacitación adicionales.




Amazon