StorageReview.com

Prueba térmica de NVIDIA DGX Spark: Comparación de los diseños de refrigeración OEM

Consumidor  ◇  Puesto de trabajo

Tras una larga espera, el NVIDIA DGX Spark se lanzó el año pasado con la esperanza de impulsar una nueva generación de ingenieros e investigadores de IA. En StorageReview, hemos recibido varios sistemas DGX Spark de diversos socios para su evaluación y estamos desarrollando interesantes proyectos de clústeres. Sin embargo, las características térmicas y de consumo energético de estas distintas implementaciones resultaron demasiado interesantes como para no compartirlas mientras finalizamos nuestros análisis completos.

NVIDIA DGX Spark Thermal

Lo que hace que esta comparación sea particularmente atractiva es la oportunidad de observar cómo diferentes socios OEM han interpretado el diseño de referencia de NVIDIA. Si bien la electrónica principal y la placa base se mantienen constantes en todas las implementaciones, las soluciones de gestión térmica, los diseños de chasis y las estrategias de flujo de aire varían considerablemente. Estas decisiones de ingeniería se manifiestan en diferencias mensurables en las temperaturas de funcionamiento, y comprender estas variaciones proporciona información valiosa para los usuarios finales que buscan DGX Sparks.

En este análisis, presentamos una comparación directa del rendimiento térmico y energético de cinco sistemas DGX Spark: NVIDIA Founders Edition , Gigabyte, Dell, Acer y ASUS.

Metodología de prueba térmica de NVIDIA DGX Spark

Los datos presentados aquí se recopilaron durante la ejecución de pruebas de rendimiento del servidor en línea de vLLM utilizando el modelo GPT-OSS-120B de OpenAI. La prueba de rendimiento comprende tres escenarios de prueba distintos diseñados para evaluar diferentes aspectos del proceso de inferencia.

El escenario de igualdad presenta una carga de trabajo equilibrada con 256 tokens de entrada y 256 de salida, lo que resulta en demandas cortas y simétricas tanto en la fase de prellenado como en la de decodificación. El escenario con prellenado intensivo centra la intensidad computacional en el procesamiento de entrada, con 4096 tokens de entrada que generan 512 tokens de salida. Esta configuración satura los núcleos tensoriales durante la fase de prellenado/codificación rápida, manteniendo demandas de decodificación moderadas, como en los escenarios de finalización de código.

Por el contrario, el escenario con mucha decodificación invierte esta relación, utilizando 512 tokens de entrada para generar 4096 tokens de salida, similar a pedirle a un modelo que escriba una aplicación usando un solo mensaje, lo que crea una presión sostenida en el ancho de banda de memoria durante la fase de generación de tokens autorregresivos.

Cada escenario se probó en lotes de 1, 2, 4, 8, 16, 32, 64 y 128, lo que resultó en un total de 24 etapas de prueba. Se aplicó un periodo de recuperación de 30 segundos entre cada etapa subsiguiente. Estos periodos de recuperación se visualizan en los gráficos como breves interrupciones entre las etapas de prueba, marcadas por líneas discontinuas verticales que separan las regiones sombreadas del escenario.

Alineación de cartas y controles ambientales

Los gráficos presentados utilizan un eje de tiempo alineado por etapas, lo que significa que los datos de todos los sistemas se sincronizan por etapa de prueba, en lugar de por tiempo absoluto. Esta metodología permite la comparación directa del comportamiento del sistema en fases de carga de trabajo idénticas, aunque cada sistema completó las etapas a ritmos ligeramente diferentes debido a su comportamiento de estrangulamiento térmico y sus características de rendimiento sostenido.

Los cinco sistemas se probaron simultáneamente en condiciones ambientales idénticas, ubicados uno junto al otro en una sala controlada con una temperatura ambiente constante durante toda la prueba. Este enfoque de pruebas paralelas garantiza que cualquier diferencia observada sea directamente atribuible a los diseños térmicos de los sistemas y no a variables ambientales como la variación de la temperatura ambiente, los patrones de flujo de aire o las variaciones horarias.

Además, todos los modelos tenían instalada la última imagen de NVIDIA Ubuntu.

Recolectar Datos

Las métricas del sistema se recopilaron a intervalos de 1 segundo mediante un script de monitorización personalizado que lee directamente las interfaces del kernel de Linux y nvidia-smi. No se realizaron mediciones directas con sondas térmicas ni con ningún otro sistema de monitorización de energía externo.

Tenga en cuenta que las temperaturas de las unidades NVMe no se pueden comparar directamente, ya que no todos los sistemas tienen unidades de almacenamiento idénticas. Cabe destacar que el sistema Asus fue el único configurado con una unidad Phison de 1 TB, el Dell contaba con una unidad Phison de 4 TB y todos los demás sistemas que probamos contaban con una unidad Samsung de 4 TB. A medida que avancemos en cada análisis, analizaremos con más detalle las temperaturas de las unidades NVMe, ya que incluso factores como el puente térmico entre la unidad y la base de la caja no son los mismos en todos los modelos Spark.

Análisis térmico de NVIDIA DGX Spark

Antes de analizar las métricas individuales, es importante comprender que el DGX Spark utiliza un sistema de refrigeración integrado en el que los componentes comparten rutas térmicas. Como se observa en el diseño de Founders Edition, el calor de la GPU influye directamente en la temperatura de los componentes adyacentes, como la CPU, el almacenamiento NVMe y las interfaces de red. Esta interdependencia térmica implica que las cargas de trabajo intensivas en la GPU generan efectos térmicos en cascada en todo el sistema, lo que explica por qué observamos patrones de temperatura correlacionados en los diferentes componentes.

Temperatura de la CPU

Los datos de temperatura de la CPU revelan las diferencias más drásticas entre las implementaciones. El sistema Acer destaca de inmediato, alcanzando un máximo de tan solo 74.6 °C durante el exigente escenario de precarga pesada, mientras que los demás sistemas alcanzaron temperaturas entre 80 y 85 °C. Esto representa una ventaja de entre 10 y 14 °C sobre la competencia, un margen térmico considerable que sugiere que Acer invirtió significativamente en capacidad de refrigeración.

Temperaturas térmicas de la CPU NVIDIA DGX Spark

Las Founders Edition, Dell y Gigabyte se agrupan con perfiles térmicos prácticamente idénticos, alcanzando todos los 87-88 °C durante picos de carga. Esta similitud indica que la mayoría de los socios han seguido el diseño térmico de referencia de NVIDIA en lugar de ir más allá. ASUS se sitúa en un punto intermedio, con temperaturas unos grados más bajas que este grupo, pero aún muy por encima del rendimiento de Acer.

El patrón de dientes de sierra en Equal y Prefill Heavy refleja la naturaleza cíclica del benchmark, con una clara recuperación durante los periodos de enfriamiento. Durante Decode Heavy, las temperaturas se estabilizan a un nivel más sostenido; esto también indica el uso intensivo de memoria en la generación de tokens y que la configuración de la memoria es un claro cuello de botella en esta carga de trabajo.

Temperatura de la GPU

Las temperaturas de la GPU siguen una historia similar, dada la infraestructura de refrigeración compartida. Acer alcanza un máximo de tan solo 68 °C durante el prellenado intensivo, mientras que los otros cuatro sistemas alcanzan entre 80 y 82 °C, una ventaja constante de 12 a 14 °C que refleja los resultados de la CPU.

Temperaturas térmicas de la GPU NVIDIA DGX Spark

La estrecha agrupación entre Founders Edition, Dell, Gigabyte y ASUS sugiere que estas implementaciones se están acercando a límites térmicos similares, probablemente donde la gestión térmica controlada por firmware de la GPU comienza a intervenir.

Temperatura NVMe

Las temperaturas de almacenamiento revelan la eficacia con la que cada chasis aísla la bahía de la unidad del calor generado por el procesamiento. Acer vuelve a liderar con un pico de 51.8 °C frente a los 58-63 °C de los demás.

Temperaturas térmicas del SSD NVIDIA DGX Spark

El aumento gradual de temperatura durante las pruebas, independientemente de los picos de carga de trabajo, indica que la acumulación de calor de los componentes adyacentes se produce con el tiempo. Para ejecuciones prolongadas de ajuste fino o intercambios de modelos intensivos, esto es relevante para la longevidad de la unidad y un rendimiento de escritura sostenido.

Como se mencionó anteriormente, las configuraciones de las unidades varían según el sistema, por lo que estas comparaciones conllevan algunas salvedades. Sin embargo, la ventaja constante de Acer en todas las métricas térmicas apunta a mejoras reales en la refrigeración, más que a diferencias en el rendimiento de las unidades.

Temperatura de la NIC

Al observar las temperaturas de la tarjeta de red ConnectX-7, Acer alcanza un máximo de 62 °C, mientras que Founders Edition alcanza los 75 °C, una diferencia de 13 °C consistente con el patrón observado en otros componentes. Gigabyte, de hecho, funciona a menor temperatura que Dell y ASUS, a pesar de funcionar a mayor temperatura en la CPU, lo que sugiere que la distribución del calor varía según el diseño del chasis.

Consumo de energía de la GPU

Por último, queríamos comprobar el consumo de energía de la GPU. Como era de esperar, los cinco sistemas mostraron un consumo máximo de energía notablemente similar durante el prellenado intenso, con un rango de entre 69.3 W (Acer) y 76.0 W (Gigabyte).

La comida para llevar

Los datos son claros: la unidad Acer que probamos funcionó entre 10 y 15 °C más fría que la competencia en todas las métricas, lo que sugiere una solución de refrigeración fundamentalmente superior. Founders Edition, Dell y Gigabyte se agrupan térmicamente, prácticamente igualando el diseño de referencia de NVIDIA. ASUS ocupa un punto intermedio. El consumo de energía es uniforme, lo que confirma que las diferencias térmicas se deben únicamente a la implementación de la refrigeración. Gigabyte, sin embargo, destacó del resto. Ofreció uno de los mejores perfiles de refrigeración con uno de los niveles de potencia de GPU más altos, logrando el mejor equilibrio entre refrigeración y consumo.

En general, los modelos de socios funcionan de forma muy similar, y los usuarios no se equivocan con ninguno. Sin embargo, los lectores curiosos deberían estar atentos para una revisión completa de cada sistema, que abarca el rendimiento de la carga de trabajo y el tema favorito de todos: los desmontajes.

Interactuar con StorageReview

Boletín informativo | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Canal RSS

Divyansh Jain

Ingeniero de aprendizaje automático, aficionado a los laboratorios caseros y entusiasta de la tecnología. En StorageReview, lidero las pruebas de IA y de cargas de trabajo emergentes, proporcionando información y análisis de rendimiento.