StorageReview.com

Análisis del Comino Grando H100: memoria GPU NVL de 188 GB

Consumidor  ◇  Puesto de trabajo

El servidor Comino Grando H100 es el último lanzamiento de la línea de productos de la empresa. Está dirigido a usuarios que necesitan potencia con precisión refinada y refrigerada por líquido. Esta configuración de Grando presenta diferentes mejoras de hardware y diseño. Sin embargo, sigue siendo ideal para aplicaciones de alta demanda, desde inteligencia artificial y aprendizaje automático hasta análisis de datos complejos y renderización visual.

Comino Grando H100 Delantero

En nuestra nueva configuración H100, Comino ha elegido una CPU potente: el AMD Ryzen Threadripper PRO 7995WX, que se destaca por sus tareas informáticas de alto número de núcleos y subprocesos.

Comino Grando H100 tapa abierta

Esta CPU de 96 núcleos es ideal para el procesamiento en paralelo, donde los usuarios pueden ejecutar conjuntos de datos extensos o manejar aplicaciones multiproceso que funcionan mejor con más núcleos y subprocesos. La placa base ASUS SAGE WRX90 complementa esta CPU y proporciona la arquitectura necesaria para satisfacer las necesidades de conectividad y memoria mejoradas del H100.

Comino Grando H100: Opciones de procesador y memoria

Con 96 núcleos/192 subprocesos, arquitectura Zen 4 y tecnología avanzada de 5 nm, está diseñado para abordar fácilmente tareas como renderizado 3D, edición de video y simulaciones complejas. Cuenta con un reloj base de 2.5 GHz (que aumenta hasta 5.1 GHz), lo que lo hace ideal para tareas de subproceso múltiple y de subproceso único. Admite hasta 2 TB de memoria DDR5 en ocho canales, lo que proporciona un ancho de banda masivo para conjuntos de datos masivos. Además, su compatibilidad con la plataforma WRX90 significa amplios carriles PCIe Gen5 para configuraciones de GPU y almacenamiento de alta velocidad.

La configuración de GPU en este modelo Grando cuenta con dos GPU NVIDIA H100 NVL con 94 GB de memoria cada una. Esta configuración de doble GPU ofrece una impresionante cantidad de 188 GB de memoria de GPU, lo que mejora el rendimiento para aplicaciones exigentes. Es especialmente beneficiosa para profesionales de inteligencia artificial, renderizado 3D y simulaciones científicas, donde las limitaciones de memoria de la GPU pueden afectar la productividad. El modelo Grando es una excelente opción para quienes necesitan recursos informáticos potentes para manejar grandes conjuntos de datos y tareas complejas de manera eficiente. Y gracias a la refrigeración líquida de Comino, estas GPU de alta potencia pueden operar en un factor de forma de una sola ranura, logrando densidades que los sistemas tradicionales refrigerados por aire no pueden igualar.

Especificaciones de la GPU NVIDIA H100 NVL

FP64 30 teraFLOP
Núcleo tensor FP64 60 teraFLOP
FP32 60 teraFLOP
Núcleo tensor TF32* 835 teraFLOP
Núcleo tensor BFLOAT16* 1,671 teraFLOPS
Núcleo tensor FP16* 1,671 teraFLOPS
Núcleo tensor FP8* 3,341 teraFLOPS
Núcleo tensor INT8* 3,341 TOPS
Memoria de la GPU 94GB
Ancho de banda de memoria GPU 3.9 TB / s
Decodificadores 7 NVDEC
7 JPG
Potencia máxima de diseño térmico (TDP) 350-400 W (configurable)
GPU de múltiples instancias Hasta 7 MIGS a 12 GB cada uno
Factor de forma PCIe
Refrigerado por aire de doble ranura
Inteligencia de NVIDIA NVLink: 600 GB/s
PCIe Gen5: 128 GB/s
Opciones de servidor Sistemas certificados por NVIDIA y asociados con 1 a 8 GPU
NVIDIA IA empresarial Incluido

Los usuarios pueden elegir entre una memoria de escritorio de alta velocidad con Kingston Fury (ideal para tareas con menor latencia) o una capacidad mayor de 512 GB con Kingston Server Premier para una confiabilidad de nivel empresarial y cargas de trabajo con mayor uso de memoria.

Comino Grando H100: refrigeración y potencia

Al igual que en las iteraciones anteriores de Grando, la filosofía de diseño aquí se centra tanto en la practicidad como en el rendimiento. Su avanzado sistema de refrigeración interna cuenta con una configuración de bloque de agua personalizada que mantiene todos los componentes refrigerados, incluso bajo cargas de trabajo intensas.

Este sistema de refrigeración líquida garantiza que las GPU mantengan un rendimiento máximo sin limitación térmica y, al mismo tiempo, reduce los niveles de ruido. A diferencia de los servidores convencionales que dependen de ventiladores grandes y ruidosos, la solución de refrigeración líquida de Grando es eficiente y está bien diseñada. La arquitectura de refrigeración incluye un bloque de distribución de agua centralizado con accesorios de desconexión rápida sin goteo, lo que permite un fácil mantenimiento con un riesgo mínimo de fugas o derrames.

Comino Grando H100 trasero

Con cuatro fuentes de alimentación independientes de 1600 W, el Grando H100 puede mantener el tiempo de actividad incluso en caso de fallo de la fuente de alimentación, una característica fundamental para entornos empresariales en los que es necesario evitar a toda costa el tiempo de inactividad. Estas fuentes de alimentación funcionan juntas sin problemas para garantizar un suministro de energía constante, incluso bajo cargas extremas de las GPU 7995WX y H100 duales.

Comino Grando H100: Diseño y construcción

Además de la potencia y la refrigeración, el diseño del Comino Grando H100 está organizado para proporcionar un fácil acceso a los componentes críticos. Hemos revisado el diseño y la construcción en detalle en nuestras Reseña de Comino Grando, así que cubriremos los aspectos más destacados.

El panel frontal tiene una matriz de E/S completa, que incluye conectores de audio, varios puertos USB y opciones de conectividad de red, lo que lo hace adecuado para entornos montados en bastidor y para uso independiente. La pantalla LED incorporada es más que un simple detalle decorativo. Ofrece datos de telemetría en tiempo real, incluidas las temperaturas del aire y del refrigerante, las velocidades del ventilador y el estado de la bomba.

Los botones de menú retroiluminados facilitan la navegación de los usuarios por esta información. También permiten acceder a configuraciones y diagnósticos más detallados para realizar controles y ajustes, lo que mejora la usabilidad y la comodidad para el mantenimiento regular.

En el interior, cada componente está dispuesto para evitar el movimiento durante el transporte, con refuerzos adicionales alrededor de las partes sensibles, como las GPU y los SSD. Esto refleja la dedicación de Grando para garantizar que sus servidores sean duraderos y se entreguen de manera segura.

El servidor Comino también es fácil de mantener y reparar. Los cables, tubos y componentes están muy bien colocados, lo que le da al interior un aspecto limpio, casi modular. Esto también juega un papel práctico en el flujo de aire y la facilidad de mantenimiento, lo que hace que sea más fácil aislar y abordar cualquier componente sin interrumpir el resto de la configuración.

Rendimiento del servidor Comino Grando H100

Ahora, analizaremos en profundidad cómo estas opciones de configuración afectan el rendimiento en el mundo real. Compararemos esta configuración con los dos modelos Comino Grando que analizamos a principios de este año y analizaremos puntos de referencia específicos en tareas gráficas y computacionales. También la compararemos con la Supermicro AS-2115HV-TNRT.

Sistemas probados

Nuestros Servidor Grando H100 El sistema incorpora el procesador AMD Threadripper PRO 7995WX, que ofrece 96 núcleos y 192 subprocesos, lo que lo convierte en la CPU con mayor densidad de núcleos de esta línea. El sistema está equipado con 512 GB de memoria Kingston Server Premier DDR5, diseñada para cargas de trabajo de gran ancho de banda y multitarea intensiva. La configuración de la GPU incluye dos GPU NVIDIA H100 NVL con 94 GB de memoria cada una.

GPU Comino Grando H100

El Supermicro AS-2115HV-TNRT El sistema utiliza el mismo AMD Threadripper PRO 7995WX pero incluye 520 GB de memoria DDR5-4800 ECC y cuatro GPU NVIDIA RTX 6000 Ada. Estas GPU están orientadas a tareas de renderizado gráfico de alta gama y visualización profesional. El sistema Supermicro también cuenta con un Micron 7450 Max 3.2TB NVMe.

Thy Grando Server El sistema que analizamos a principios de este año incluía el procesador AMD Threadripper PRO 5995WX, una CPU de 64 núcleos y 128 subprocesos, junto con 512 GB de RAM y seis GPU NVIDIA RTX 4090. Esta configuración se centró principalmente en el rendimiento gráfico, con las RTX 4090 ofreciendo un alto rendimiento para renderizado y cargas de trabajo de GPU de uso general. El sistema también incluía 4 fuentes de alimentación de 1600 W y un SSD NVMe de 2 TB.

El otro sistema Comino es el de 3975W. Estación de trabajo Grando, que ofrece 32 núcleos y 64 subprocesos. Su configuración de GPU consta de cuatro GPU NVIDIA A100, lo que enfatiza un equilibrio entre las cargas de trabajo centradas en el cómputo y las tareas de visualización. Se combinó con 512 GB de RAM y un SSD NVMe de 2 TB, lo que lo hace menos denso en términos computacionales que los sistemas más nuevos, pero capaz de manejar flujos de trabajo exigentes.

Es importante tener en cuenta que el servidor Grando que analizamos anteriormente probablemente ofrecerá un rendimiento superior en las pruebas comparativas centradas en la GPU, en particular las relacionadas con las tareas de renderizado y visualización. Las GPU RTX 4090 están diseñadas para cargas de trabajo gráficas de alta gama, lo que proporciona una potencia computacional sustancial para dichas aplicaciones.

Las GPU Nvidia H100 son aceleradores de cómputo diseñados específicamente que omiten deliberadamente las salidas de pantalla y las funciones de consumo, lo que las hace exclusivamente enfocadas en las cargas de trabajo de los centros de datos. A diferencia de sus contrapartes de consumo y estaciones de trabajo, las H100 no incluyen puertos de pantalla ni controladores de gráficos de Windows, ya que están diseñadas para el funcionamiento de servidores sin interfaz gráfica. La ausencia de hardware de codificación NVENC enfatiza aún más su naturaleza exclusivamente de cómputo, optimizando el espacio de matriz para tareas de IA y HPC en lugar de codificación de medios.

Resultados de referencia

Blender 4.0

Nuestro primer benchmark es Blender, una completa suite de creación 3D de código abierto para proyectos de modelado, animación, simulación y renderizado. Los benchmarks de Blender evalúan el rendimiento de un sistema en la renderización de escenas complejas, un aspecto crucial para los profesionales de los efectos visuales, la animación y el desarrollo de juegos. Este benchmark mide las capacidades de renderizado de la CPU y la GPU, que son relevantes para servidores y estaciones de trabajo diseñados para tareas computacionales y de procesamiento de gráficos de alta gama.

Aquí, la configuración del servidor Grando H100 se destaca en las pruebas basadas en CPU debido al alto número de núcleos del AMD Threadripper PRO 7995WX. Supera constantemente a otros sistemas como el Supermicro AS-2115HV-TNRT en tareas de renderizado como escenas de Monster, Junkshop y Classroom. Sin embargo, las pruebas de GPU revelan las limitaciones de las GPU H100 en cargas de trabajo de renderizado de gráficos. Si bien la configuración H100 ofrece resultados decentes, los sistemas con GPU de propósito más general tienen un rendimiento significativamente mejor, como el RTX 6000 Ada o el RTX 4090. Esto resalta la especialización del H100 en tareas computacionales en lugar de gráficas.

Batidora de vaso - Blender
(Muestras por minuto; cuanto más alto, mejor)
Servidor Grando
(AMD 7995WX, 2x H100)
Supermicro AS-2115HV-TNRT (AMD 7995WX, 4x RTX 6000 Ada) Supermicro AS-2115HV-TNRT overclockeado (AMD 7995WX, 4x RTX 6000 Ada)
Pruebas de CPU de Blender 4.2
Monster  1,352.19 931 969
chatarrería  969.44 682 640
Aulas 683.30 451 472
Pruebas de GPU de Blender 4.2
Monster 2,521 5,745 N/A
chatarrería 1,888.28 2,698 N/A
Aulas 1,401.96 2,824 N/A

Los servidores Grando analizados anteriormente se probaron con la versión 4.0 de Blender. Estos son los resultados:

Batidora de vaso - Blender
(Muestras por minuto; cuanto más alto, mejor)
Gran servidor
(TR-W5995WX, 512 GB, 6x4090)
Estación de trabajo Grando
(TR 3975WX, 512 GB, 4x A100)
Pruebas de CPU de Blender 4.0
Monster  568.02 334.40
chatarrería  386.53 231.90
Aulas 293.91 174.21
Pruebas de GPU de Blender 4.0
Monster 5,880.71 1,656.34
chatarrería 2,809.36 1,137.73
Aulas 2,895.54 953.46

Prueba de velocidad Blackmagic RAW

El Blackmagic RAW Speed ​​Test mide la velocidad de procesamiento de formatos de vídeo de alta calidad, un aspecto esencial para servidores y estaciones de trabajo en la producción y edición de vídeo. Evalúa cómo los sistemas administran archivos de video RAW, lo que afecta la eficiencia del flujo de trabajo y la productividad en entornos de producción de medios.

En la prueba de velocidad Blackmagic RAW, el Grando Server H100 demuestra un sólido rendimiento de la CPU en la decodificación de video RAW 8K, pero no alcanza el rendimiento esperado en las actividades basadas en CUDA, como lo hizo el T1000 más pequeño en este sistema. Los sistemas con GPU como RTX 4090 y RTX 6000 Ada ofrecen compatibilidad con DirectX en Windows, mientras que las GPU orientadas a empresas no cuentan con esa compatibilidad de forma nativa.

Prueba de velocidad Blackmagic RAW Servidor Grando
(AMD 7995WX, 2x H100)
Gran servidor
(TR-W5995WX, 512 GB, 6x4090)
Estación de trabajo Grando
(TR 3975WX, 512 GB, 4x A100)
Supermicro AS-2115HV-TNRT (AMD 7995WX, 4x RTX 6000 Ada)
CPU 8K 156 FPS 132 FPS 135 FPS 132 fps
CUDA 8K 144 FPS 345 FPS 309 FPS 664 fps

Compresión de 7 cremalleras

El punto de referencia de compresión 7-zip prueba la eficiencia de un sistema en el manejo de la compresión y descompresión de datos, lo cual es crucial para administrar grandes conjuntos de datos y optimizar el almacenamiento. Este punto de referencia refleja el rendimiento de servidores y estaciones de trabajo en operaciones con uso intensivo de datos, donde la velocidad y la eficiencia en la manipulación de datos son vitales.

Aquí, el Grando Servidores Entre los sistemas probados, el Supermicro AS-2115HV-TNRT obtuvo los mejores resultados de compresión y descompresión. Sin embargo, en términos de eficiencia general, la configuración overclockeada del Supermicro AS-XNUMXHV-TNRT se acerca.

Punto de referencia de compresión de 7 cremalleras (cuanto más alto, mejor) Servidor Grando
(AMD 7995WX, 2x H100)
Gran servidor
(TR-W5995WX, 512 GB, 6x4090)
Estación de trabajo Grando
(TR 3975WX, 512 GB, 4x A100)
Supermicro AS-2115HV-TNRT
(AMD 7995WX, 4x RTX 6000 Ada)
Supermicro AS-2115HV-TNRT – Overclockeado
(AMD 7995WX, 4x RTX 6000 Ada)
Apresamiento
Uso actual de la CPU 5,582% 3,379% 3,439% 5,571% 6,456%
Clasificación actual/Uso 8.627 gips 7.630 gips 7.094 gips 7.835 gips 9.373 gips
Calificación actual 481.539 gips 257.832 gips 243.994 gips 436.490 gips 605.097 gips
Uso de CPU resultante 5,561% 3,362% 3,406% 5,599% 6,433%
Valoración/Uso resultante 8.631 gips 7.697 gips 7.264 gips 7.863 gips 9.420 gips
Calificación resultante 480.006 gips 258.756 gips 247.396 gips 440.288 gips 605.984 gips
Descomprimiendo
Uso actual de la CPU 6,270% 6,015% 6,286% 6,223% 6,343%
Clasificación actual/Uso 7.411 gips 5.585 gips 5.434 gips 7.215 gips 9.810 gips
Calificación actual 464.701 gips 335.958 gips 341.599 gips 449.012 gips 622.250 gips
Uso de CPU resultante 6,238% 6,053% 6,269% 6,213% 6,312%
Valoración/Uso resultante 7.589 gips 5.603 gips 5.468 gips 7.165 gips 9.834 gips
Calificación resultante 473.375 gips 339.171 gips 342.766 gips 445.130 gips 620.749 gips
Calificaciones totales
Uso total de la CPU 5,900% 4,708% 4,837% 5,906% 6,373%
Valoración total/Uso 8.110 gips 6.650 gips 6.366 gips 7.514 gips 9.627 gips
Puntuación total 476.690 gips 298.963 gips 295.081 gips 442.709 gips 613.366 gips

Y-Cruncher

Y-Cruncher es un punto de referencia computacional que prueba la capacidad de un sistema para manejar operaciones matemáticas complejas, calculando con precisión Pi hasta billones de dígitos. Este punto de referencia indica el poder computacional de los servidores y estaciones de trabajo, particularmente para su uso en investigaciones científicas y simulaciones que requieren un procesamiento numérico intensivo.

En Y-Cruncher, la configuración Grando Server H100 se destaca en el tiempo de cómputo total para calcular Pi en todos los niveles de dígitos. El alto número de núcleos del AMD Threadripper PRO 7995WX garantiza que este sistema sea líder en tareas que requieren un uso intensivo de la CPU. Sin embargo, la configuración overclockeada Supermicro AS-2115HV-TNRT reduce la brecha significativamente, lo que demuestra los beneficios del ajuste de rendimiento optimizado para estas cargas de trabajo.

Y-Cruncher (tiempo total de cálculo) Servidor Grando
(AMD 7995WX, 2x H100)
Gran servidor
(TR-W5995WX, 512 GB, 6x4090)
Estación de trabajo Grando
(TR 3975WX, 512 GB, 4x A100)
Supermicro AS-2115HV-TNRT (AMD 7995WX, 4x RTX 6000 Ada) Supermicro AS-2115HV-TNRT – Overlocked (AMD 7995WX, 4x RTX 6000 Ada)
Mil millones de dígitos 7.523 Segundos 11.023 Segundos 11.759 Segundos 8.547 segundos 6.009 segundos
Mil millones de dígitos 15.392 Segundos 28.693 Segundos 32.073 Segundos 17.493 segundos 13.838 segundos
Mil millones de dígitos 29.420 Segundos 61.786 Segundos 69.869 Segundos 33.584 segundos 27.184 segundos
Mil millones de dígitos 60.089 Segundos 130.547 Segundos 151.820 Segundos 67.849 segundos 58.283 segundos
Mil millones de dígitos 214.246 Segundos 353.858 Segundos 425.824 Segundos 182.880 segundos 161.913 segundos
Mil millones de dígitos 594.939 Segundos 788.912 Segundos 971.086 Segundos 417.853 segundos N/A

BBP triturador de y

Este benchmark y-cruncher utiliza las fórmulas Bailey-Borwein-Plouffe (BBP) para calcular dígitos hexadecimales masivos de Pi, midiendo el tiempo total de cálculo, la utilización y la eficiencia de múltiples núcleos de la CPU.

El benchmark BBP de y-cruncher destaca la eficiencia del Grando Server H100 en el manejo de tareas computacionales masivas. En todas las pruebas, el Grando Server tiene un buen desempeño, logrando el tiempo de cómputo total más rápido para cálculos de 1 BBP y 10 BBP. Su eficiencia multinúcleo en la prueba de 100 BBP, con un 98.68 %, es ligeramente inferior a la de los sistemas Supermicro AS-2115HV-TNRT, pero sigue siendo muy efectiva. La configuración overclockeada de Supermicro supera a la Supermicro estándar en tiempo total para todos los niveles de BBP. Aun así, el Grando H100 lidera consistentemente en velocidad de cómputo en el mundo real para tareas BBP más pequeñas, probablemente debido a sus capacidades multihilo optimizadas y cambio rápido de contexto.

Sin embargo, con respecto a la utilización de la CPU, los sistemas Supermicro demuestran una eficiencia de uso del núcleo ligeramente mejor, lo que indica que pueden aprovechar su arquitectura de manera más efectiva para cargas de trabajo paralelas sostenidas.

Servidor Grando
(AMD 7995WX, 2x H100)
Supermicro AS-2115HV-TNRT
(AMD 7995WX, 4x RTX 6000 Ada)
Supermicro AS-2115HV-TNRT – Overlock
(AMD 7995WX, 4x RTX 6000 Ada)
1 PBB
  • Tiempo total: 0.173 segundos
  • Utilización de CPU: 6,140.43%
  • Eficiencia multinúcleo: 31.98 %
  • Tiempo total: 0.256 segundos
  • Utilización de CPU: 7,061.79 %
  • Eficiencia multinúcleo: 36.78 %
  • Tiempo total: 0.178 segundos
  • Utilización de CPU: 3,968.01%
  • Eficiencia multinúcleo: 41.33%
10 PBB
  • Tiempo total: 1.301 segundos
  • Utilización de CPU: 16,590.73%
  • Eficiencia multinúcleo: 84.41%
  • Tiempo total: 2.006 segundos
  • Utilización de CPU: 17,317.36 %
  • Eficiencia multinúcleo: 90.19 %
  • Tiempo total: 1.458 segundos
  • Utilización de CPU: 8,574.02%
  • Eficiencia multinúcleo: 89.31%
100 PBB
  • Tiempo total: 13.966 segundos
  • Utilización de CPU: 18,846.58%
  • Eficiencia multinúcleo: 98.68%
  • Tiempo total: 21.434 segundos
  • Utilización de CPU: 18,989.11 %
  • Eficiencia multinúcleo: 98.90 %
  • Tiempo total: 15.876 segundos
  • Utilización de CPU: 9,488.48%
  • Eficiencia multinúcleo: 98.84%

Geekbench 6

Geekbench 6 mide el rendimiento computacional de CPU y GPU, abarcando capacidades de un solo núcleo y múltiples núcleos y potencia de procesamiento gráfico. Este punto de referencia es esencial para evaluar la eficiencia informática general de servidores y estaciones de trabajo en diversas tareas, incluidas simulaciones, análisis de datos y representación de gráficos.

Los resultados de Geekbench 6 demuestran que el Grando Server H100 es un dispositivo de primer nivel en tareas de CPU multinúcleo, gracias a su procesador de 96 núcleos. Sin embargo, en las puntuaciones de la GPU, la configuración del H100 supera al Supermicro AS-2115HV-TNRT, que aprovecha las GPU RTX 6000 Ada para lograr un rendimiento gráfico superior.

Geekbench 6 (Cuanto más alto, mejor) Servidor Grando
(AMD 7995WX, 2x H100)
Servidor Grando (TR W5995WX, 512 GB, 6x 4090) Estación de trabajo Grando (TR 3975WX, 512 GB, 4x A100) Supermicro AS-2115HV-TNRT
(AMD 7995WX, 4x RTX 6000 Ada)
CPU de un solo núcleo 2,893 2,127 2,131 2,875
CPU multinúcleo 28,600 21,621 20,411 24,985
GPU 298,220 294,894 193,447 307,510

Cinebench R23

Cinebench R23 mide la capacidad de renderizado de la CPU, centrándose en el rendimiento de un solo núcleo y de varios núcleos. Es un punto de referencia esencial para evaluar qué tan bien puede funcionar un servidor o una estación de trabajo en la creación de contenido, renderizado 3D y otras tareas que requieren un uso intensivo de la CPU. El MP Ratio (índice de rendimiento de múltiples núcleos) proporciona además información sobre la eficacia con la que un sistema utiliza sus múltiples núcleos.

La configuración H100 es líder en rendimiento multinúcleo, aprovechando la enorme cantidad de núcleos del Threadripper PRO 7995WX. Sin embargo, su rendimiento de un solo núcleo está a la par con los otros sistemas. El MP Ratio enfatiza la escalabilidad del 7995WX en aplicaciones multihilo. Aun así, la naturaleza agnóstica de la GPU de este punto de referencia evita que la configuración H100 muestre limitaciones relacionadas con la GPU, lo que lo hace parecer más competitivo en todos los ámbitos.

Cinebench R23
(Más alto es mejor)
Servidor Grando
(AMD 7995WX, 2x H100)
Servidor Grando (TR W5995WX, 512 GB, 6x 4090) Estación de trabajo Grando (TR 3975WX, 512 GB, 4x A100) Supermicro AS-2115HV-TNRT (AMD 7995WX, 4x RTX 6000 Ada) Supermicro AS-2115HV-TNRT – Overlocked (AMD 7995WX, 4x RTX 6000 Ada)
CPU multinúcleo  159,930 pts 73,556 puntos 49,534 puntos 111,792 pts 132,044 puntos
CPU de un solo núcleo 1,876 puntos 1,484 puntos 1,468 puntos 1,864 puntos 1,887 puntos
Relación MP 85.26 x 49.56x 33.75x 59.98x 69.99x

Almacenamiento directo de GPU

Una de las pruebas que realizamos en este servidor fue la prueba Magnum IO GPU Direct Storage (GDS). GDS es una función desarrollada por NVIDIA que permite que las GPU eviten la CPU al acceder a los datos almacenados en unidades NVMe u otros dispositivos de almacenamiento de alta velocidad. En lugar de enrutar los datos a través de la CPU y la memoria del sistema, GDS permite la comunicación directa entre la GPU y el dispositivo de almacenamiento, lo que reduce significativamente la latencia y mejora el rendimiento de los datos.

Cómo funciona el almacenamiento directo en GPU

Tradicionalmente, cuando una GPU procesa datos almacenados en una unidad NVMe, los datos primero deben pasar por la CPU y la memoria del sistema antes de llegar a la GPU. Este proceso genera cuellos de botella, ya que la CPU se convierte en un intermediario, lo que agrega latencia y consume valiosos recursos del sistema. El almacenamiento directo en la GPU elimina esta ineficiencia al permitir que la GPU acceda a los datos directamente desde el dispositivo de almacenamiento a través del bus PCIe. Esta ruta directa reduce la sobrecarga asociada con el movimiento de datos, lo que permite transferencias de datos más rápidas y eficientes.

Las cargas de trabajo de IA, especialmente las que implican aprendizaje profundo, requieren un uso intensivo de datos. El entrenamiento de redes neuronales de gran tamaño suele requerir el procesamiento de terabytes de datos, y cualquier retraso en la transferencia de datos puede provocar que las GPU se subutilicen y que los tiempos de entrenamiento sean más prolongados. El almacenamiento directo en la GPU aborda este desafío al garantizar que los datos se entreguen a la GPU lo más rápido posible, lo que minimiza el tiempo de inactividad y maximiza la eficiencia computacional.

Además, GDS es particularmente beneficioso para cargas de trabajo que implican la transmisión de grandes conjuntos de datos, como el procesamiento de video, el procesamiento de lenguaje natural o la inferencia en tiempo real. Al reducir la dependencia de la CPU, GDS acelera el movimiento de datos y libera recursos de la CPU para otras tareas, lo que mejora aún más el rendimiento general del sistema.

Probamos el servidor exhaustivamente realizando una evaluación GDSIO exhaustiva en el Comino Grando, explorando varias configuraciones para evaluar su rendimiento en diferentes escenarios. Este tipo de prueba es crucial para un servidor de este calibre, ya que simula entornos similares a estaciones de trabajo y brinda información sobre sus capacidades durante las pruebas ablativas para entrenar modelos grandes. Para el almacenamiento, aprovechamos un Unidad de estado sólido Solidigm D7-PS1010 Gen5.

Matriz de configuración de prueba

Probamos sistemáticamente cada combinación de los siguientes parámetros:

  • Tamaños de bloque: 1M, 128K, 64K, 16K, 8K
  • Número de hilos: 128, 64, 32, 16, 8, 4, 1
  • Número de trabajos: 16, 8, 4, 1
  • Tamaños de lote: 32, 16, 8, 4, 1

Para esta revisión, nos centramos en el rendimiento de lectura y escritura secuencial. Ejecutamos cada carga de trabajo GDSIO con su tamaño de bloque y número de subprocesos determinados en varios tamaños de lotes y trabajos. Las cifras informadas son los promedios de cada combinación de trabajo y número de lotes.

Análisis De Rendimiento

Las cargas de trabajo de IA, en particular en la fase de entrenamiento, requieren un procesamiento eficiente de cantidades masivas de datos. Estas cargas de trabajo suelen beneficiarse de tamaños de bloque grandes que pueden maximizar el rendimiento al leer conjuntos de datos de entrenamiento o escribir puntos de control del modelo. En nuestras pruebas integrales de capacidades de almacenamiento directo en GPU, nos centramos en varios patrones y configuraciones de E/S para comprender las características de rendimiento del sistema.

El rendimiento de E/S secuencial con tamaños de bloque de 1 M demostró resultados impresionantes entre nuestras configuraciones de prueba. El sistema logró un rendimiento de lectura secuencial notable de 8.56 GiB/s (tamaño de bloque de 1 M, tamaño de lote 4, profundidad de E/S 128 y 128 subprocesos en 16 trabajos). Este nivel de rendimiento es particularmente beneficioso para cargas de trabajo que implican cargar grandes modelos preentrenados, procesar conjuntos de datos extensos durante las fases de entrenamiento o manejar flujos de datos secuenciales como el procesamiento de video para aplicaciones de visión artificial.

Para operaciones de escritura secuencial, el sistema entregó 7.57 GiB/s (tamaño de bloque de 1 M, tamaño de lote 8, profundidad de E/S 16, con 16 subprocesos en 8 trabajos), lo que lo hace muy eficaz para escenarios que requieren puntos de control de modelo frecuentes durante el entrenamiento distribuido, el guardado de resultados intermedios o la escritura de datos procesados ​​en operaciones por lotes.

Conclusión

El servidor Comino Grando H100 es una incorporación impresionante a la línea de productos de la compañía, que ofrece una alternativa única a sus otras configuraciones. Equipado con una CPU AMD Threadripper PRO 7995WX y 512 GB de memoria DDR5, ampliable hasta 1 TB, el sistema Grando se destaca por dos GPU NVIDIA H100 NVL. Si bien esta configuración proporciona un rendimiento excepcional para flujos de trabajo impulsados ​​por IA, se produce a costa del rendimiento de la GPU en los puntos de referencia de renderizado tradicionales (como Luxmark y OctaneBench), donde los sistemas como el servidor Grando equipado con RTX 4090 y las configuraciones Supermicro con RTX 6000 Ada lideran. Dicho esto, el rendimiento del H100 en pruebas intensivas de CPU, como el renderizado multinúcleo de Blender, la compresión 7-Zip y Y-Cruncher, supera constantemente a los otros sistemas probados.

En cuanto al diseño, el servidor Comino Grando H100 puede alojar componentes de alto rendimiento en un formato compacto, algo que suele ser un desafío para los chasis estándar. Gracias a su sistema de refrigeración líquida directa (DLC) personalizado, el servidor puede manejar fácilmente configuraciones como dos GPU NVIDIA H100. Esta solución de refrigeración avanzada mantiene el calor bajo control y garantiza que el sistema se mantenga estable durante tareas exigentes de alto rendimiento. Lo que es particularmente único en este nuevo sistema Comino es cómo logra aprovechar principalmente el hardware de consumo para crear una solución que es eficiente y relativamente asequible, lo que lo convierte en una opción atractiva para profesionales y empresas que buscan maximizar la potencia de la GPU sin gastar una fortuna.

En general, el Comino Grando H100 es una excelente opción para empresas y profesionales que priorizan la optimización de la IA, las tareas computacionales y la confiabilidad en entornos exigentes. Su diseño único y las innovaciones en refrigeración ofrecen flexibilidad y rendimiento para cargas de trabajo impulsadas por IA. Sin embargo, configuraciones alternativas como el servidor Grando equipado con RTX 4090 o los sistemas con RTX 6000 Ada pueden ser más adecuadas para usuarios centrados en la renderización tradicional con GPU.

Sistemas Comino

Interactuar con StorageReview

Boletín informativo | YouTube | Podcast iTunes/Spotify | Instagram | Twitter | TikTok | RSS Feed

lyle smith

Lyle es redactor de StorageReview y cubre una amplia gama de temas relacionados con las TI para usuarios finales y empresas.