La pregunta más frecuente que recibimos sobre la MSI XpertStation WS300 tras nuestra reseña se centra en un tema clave. El GB300 Grace Blackwell Ultra Superchip es un componente de 1,300 W que normalmente se instala en un rack con refrigeración líquida, así que ¿qué ocurre con la temperatura al colocarlo en una torre? La preocupación es válida: un sistema con GB300 que alcanza su límite térmico verá reducido su rendimiento, y un sistema que se ralentiza bajo una carga de trabajo sostenida no ofrece el rendimiento esperado. En nuestra reseña, mencionamos que la WS300 se mantuvo fría y estable durante las pruebas. La razón reside en los datos de diseño de refrigeración de MSI, junto con los registros de temperatura, consumo de energía y frecuencia que obtuvimos durante una prueba del sistema.
Lo que el bucle tiene que hacer
El presupuesto térmico de una estación DGX viene establecido por NVIDIA; el módulo GB300 tiene un límite de potencia SuperChip de 1,300 W, y todo el sistema funciona con una única fuente de alimentación de 1,600 W que también debe alimentar el almacenamiento, las bombas, los ventiladores y cualquier tarjeta RTX PRO opcional. Casi la totalidad de esos 1,300 W se disipan en forma de calor en cuatro puntos: la GPU Blackwell Ultra y sus 252 GB de HBM3e, la CPU Grace de 72 núcleos, 496 GB de memoria distribuidos en cuatro módulos SOCAMM LPDDR5X y la tarjeta de red ConnectX-8 SuperNIC con sus dos puertos ópticos de 400 GbE. MSI coloca placas de refrigeración en los cuatro componentes, y el circuito pasa por dos radiadores de 360 mm con seis ventiladores de 120 mm. Un ventilador de chasis independiente de 120 mm mueve el aire por el resto de la caja para las unidades SSD y otros componentes refrigerados por aire. MSI especifica que el conjunto consume 1,400 W entre la CPU y la GPU, aproximadamente 100 W por encima de lo que NVIDIA permite que consuma el Superchip.
Ese margen de 100 W es una decisión de diseño crucial. Un circuito diseñado solo para la carga nominal no tiene margen para una oficina con alta temperatura, un radiador polvoriento o un ventilador funcionando a menos de su velocidad máxima. Un circuito con margen por encima del límite de potencia significa que el silicio alcanza su límite de potencia antes de alcanzar su límite térmico.
Datos de la placa fría de MSI
MSI compartió con nosotros los datos de caracterización del circuito. La empresa denomina a esta metodología CIT (Component Integrity Test) y etiqueta las curvas como empíricas: se midieron en el banco de pruebas durante repetidos ciclos de presión y temperatura. El primer gráfico es el que más interesa a un ingeniero térmico. Representa la resistencia térmica en grados Celsius por vatio para las placas frías de la GPU y la CPU en función del caudal del refrigerante, junto con la caída de presión que cada placa impone a la bomba.
La placa de la GPU comienza cerca de 0.031 C/W con un flujo de 0.3 litros por minuto y cae bruscamente a medida que aumenta el flujo, alcanzando aproximadamente 0.017 C/W a 1.5 LPM y 0.012 C/W a 3 LPM. La placa de la CPU, que cubre una parte de mucha menor potencia, se sitúa más arriba, alrededor de 0.028 C/W a 1.5 LPM. La resistencia térmica es el multiplicador que convierte vatios en grados: a 1.5 LPM, cada 100 W que pasa por la placa de la GPU cuesta aproximadamente 1.7 °C de aumento entre el refrigerante y la placa. Al pasar 1,000 W a través de ella, la placa funciona unos 17 °C por encima del agua. La contrapartida es la caída de presión, que aumenta con el cuadrado del flujo. A 1.5 LPM, la placa de la GPU le cuesta a la bomba aproximadamente 1.1 PSI y la placa de la CPU aproximadamente 1.9 PSI. Las curvas se aplanan a partir de los 2 LPM, razón por la cual el circuito está diseñado para funcionar en el rango de 1.5 a 2 LPM; un mayor caudal conlleva un rendimiento térmico decreciente a cambio de un elevado coste de la bomba.
Radiadores, ventiladores y la relación entre ruido y calidad del aire.
El segundo conjunto de gráficos cubre el otro extremo del circuito. ATD significa Diferencia de Temperatura Ambiente, que representa el aumento de temperatura del refrigerante por encima del aire ambiente después de que sale de los radiadores. Este valor establece el límite inferior de temperatura para cada componente del sistema, ya que ningún componente del circuito puede funcionar a una temperatura inferior a la del agua que lo alimenta. MSI grafica ATD en función de la carga térmica para el par de radiadores de 360 mm con caudales de 1 a 2 LPM, una vez con los seis ventiladores al 100 % de modulación por ancho de pulso (PWM) y otra vez al 60 %.
A máxima velocidad del ventilador, los radiadores mantienen el refrigerante entre 5 y 9 °C por encima de la temperatura ambiente con una carga térmica de 1,000 W en todo el rango de flujo, y entre 8 y 12 °C a 1,400 W, superando el límite de potencia del Superchip. Las líneas son casi lineales, y el refrigerante más lento permanece más tiempo en el radiador y sale más cerca de la temperatura ambiente, razón por la cual la línea de 1 LPM se encuentra más baja; la contrapartida es la mayor resistencia de la placa fría a bajo flujo del primer gráfico, por lo que el punto de funcionamiento del circuito es un equilibrio entre ambos. El gráfico PWM del 60 % es el más realista para un sistema junto a un escritorio, porque nadie hace funcionar (ni quiere hacer funcionar) seis ventiladores de 120 mm a máxima potencia en una oficina.
Al 60 por ciento, el ATD se duplica aproximadamente: de 10 a 16 °C a 1,000 W y de 15 a 23 °C a 1,400 W, una penalización relativamente modesta. Incluso a la potencia máxima del Superchip y con la velocidad reducida del ventilador, el refrigerante entra en las placas frías a no más de unos 23 °C por encima de la temperatura ambiente. Si añadimos el aumento de 17 °C en la placa de la GPU del primer gráfico, el paquete Blackwell Ultra funciona a unos 40 °C por encima de la temperatura ambiente a 1,000 W, muy por debajo de su rango operativo en cualquier oficina normal. El último gráfico de MSI es la curva de impedancia del lado del aire del radiador, que muestra la presión que los ventiladores tienen que superar para empujar el aire a través del conjunto de aletas, alcanzando aproximadamente 1 mm de agua a 135 CFM y 2 mm a 185 CFM. Es un núcleo de baja restricción, que es lo que permite que los ventiladores funcionen a baja velocidad.
Nuestro recorrido: ~3 horas en la GB300
Las curvas de diseño indican lo que debería hacer un bucle; para ver lo que realmente hace, registramos el WS300 durante una sesión de 2.8 horas compuesta por cinco fases: una prueba de estrés de 75 minutos con carga sostenida de GPU, luego DeepSeek v4 Flash servido a través de vLLM bajo tres perfiles, una carga de trabajo de tokens de entrada y salida iguales de 512, una carga de trabajo de prellenado intensivo de 8,192 entradas y 1,024 salidas, y una carga de trabajo de decodificación intensivo de 1,024 entradas y 8,192 salidas con concurrencia creciente, seguida de una ventana de observación inactiva. Muestreamos continuamente la GPU, HBM, CPU y la telemetría de energía. Las temperaturas del refrigerante, el aire del chasis y la placa provienen del BMC, que consultamos cada pocos minutos. Las regiones sombreadas en cada gráfico marcan las fases.
Durante toda la prueba de envejecimiento, el chip Blackwell Ultra se mantuvo a 60 °C, con HBM3e unos 10 °C más caliente a 70 °C y Grace a 64 °C. Estos son los valores en estado estacionario con aproximadamente 1,000 W de potencia de GPU, y no aumentaron durante los 75 minutos, lo que es característico de un bucle que ha alcanzado el equilibrio con margen de seguridad. Las fases de inferencia son más frías en promedio porque la carga es más ráfaga: la GPU alcanzó un pico de 60 °C nuevamente durante la carga de trabajo igual y 58 °C durante la rampa de decodificación larga, con HBM alcanzando un máximo de 73 °C. El diente de sierra en la línea DRAM es un artefacto del intervalo de muestreo del BMC; la propia LPDDR5X alcanzó un pico de alrededor de 75 °C. El sensor más caliente en la caja durante la mayor parte de la ejecución fue el ConnectX-8 a 76 a 77 °C. Las temperaturas en reposo se estabilizaron entre 33 y 36 °C para la GPU y HBM y alrededor de 48 °C para Grace.
Durante el rodaje, el refrigerante salió de los radiadores a 37 °C y regresó de las placas frías a 47 °C, un aumento de 10 °C en todo el circuito. El aire del chasis dentro de la carcasa alcanzó los 46 °C, la placa base BMC los 52 °C y el sensor de la placa más caliente los 56 °C. Todas estas curvas se estabilizan durante los primeros 15 minutos de carga y permanecen planas, para luego descender en cuestión de minutos cuando cesa la carga. En reposo, el refrigerante se mantuvo entre 30 y 31 °C.
El proceso de rodaje mantuvo la GPU en aproximadamente 995 W, con Grace añadiendo otros 85 a 90 W para un total de Superchip cercano a 1,080 W, que es la carga a la que corresponde la diferencia de refrigerante anterior. La misma carga de trabajo alcanzó brevemente el mismo nivel de GPU de 1,000 W con alta concurrencia; la fase de prellenado intensivo se ejecutó en ráfagas cortas hasta aproximadamente 1,050 W en total; y la rampa de decodificación intensiva es la imagen más clara de cómo un servidor de inferencia carga una GPU, pasando de aproximadamente 500 W a poco más de 1,000 W a medida que la concurrencia se duplicaba en cada etapa. En ningún momento de la ejecución la potencia total de Superchip se acercó a menos de 200 W del límite de 1,300 W marcado en el gráfico. Vale la pena mencionar el estado de reposo para cualquiera que planifique la energía: la GPU por sí sola consume de 150 a 210 W sin nada en ejecución, y el total de Superchip en reposo es de 220 a 290 W.
El Blackwell Ultra funcionó a aproximadamente 2.07 GHz desde el inicio de la prueba de estrés hasta su finalización, manteniendo una frecuencia constante en todas las fases sin caídas. Grace se mantuvo cerca de 3.5 GHz con fluctuaciones normales, HBM se mantuvo a 4,000 MHz y LPDDR5X a 3,200 MHz. Una GPU con limitaciones térmicas se manifiesta aquí como un rendimiento muy irregular, ya que el algoritmo de aumento de frecuencia disminuye y se recupera; una GPU con limitaciones de potencia se manifiesta como una frecuencia que sigue la carga; ninguno de estos patrones se observó en nuestras pruebas. Bajo estas cargas de trabajo, el sistema no se calentó lo suficiente ni tuvo limitaciones de potencia suficientes como para abandonar su frecuencia máxima.
Uniendo ambos
Las curvas de MSI y nuestras mediciones se produjeron de forma independiente y coinciden en la misma conclusión. Partimos del aumento de temperatura del refrigerante de 10 °C a 1,080 W. El calor transportado por un líquido es igual al caudal multiplicado por el aumento de temperatura, por lo que esa diferencia implica un caudal de refrigerante de aproximadamente 1.5 litros por minuto para un refrigerante a base de agua, justo en el rango caracterizado por MSI. Lea la gráfica del radiador de MSI con ese caudal y carga: a una velocidad del ventilador del 100 %, el refrigerante debería estar unos 8 °C por encima de la temperatura ambiente; al 60 %, unos 14 °C. No teníamos una sonda ambiental calibrada en el laboratorio de MSI, así que no podemos cerrar ese bucle al grado, pero una temperatura de suministro de 37 °C es consistente con una sala de laboratorio cálida y ventiladores funcionando muy por debajo de la velocidad máxima.
A 1.5 LPM, la resistencia medida de la placa de la GPU es de aproximadamente 0.017 C/W, lo que a 995 W predice un aumento de 17 °C desde el refrigerante hasta la placa. Medimos el chip Blackwell Ultra a 60 °C frente a una fuente de alimentación de 37 °C, una diferencia de 23 °C. La diferencia de 6 °C entre ambos se debe a la interfaz térmica y al propio encapsulado, la parte del recorrido que la placa fría no puede controlar, y es un valor pequeño para una GPU de doble retícula de este tamaño. La placa está funcionando según lo que indican los datos de las pruebas de MSI, y el margen entre el chip y el refrigerante está determinado por las leyes de la física.
Si se analiza el presupuesto en sentido contrario, el margen de maniobra que mencionamos anteriormente se hace más evidente. Las GPU para centros de datos de NVIDIA no comienzan a reducir la frecuencia hasta que el chip alcanza los 80 MHz, por lo que el WS300, bajo carga sostenida máxima, dejaba aproximadamente 20 °C entre el chip Blackwell Ultra y el punto donde intervendría la gestión térmica, y eso con el circuito absorbiendo 1,080 W. Incluso en el peor de los casos, con el límite de 1,300 W del Superchip, otros 220 W a través de una placa de 0.017 C/W añaden menos de 4 °C en la GPU, y el gráfico del radiador de MSI muestra que el refrigerante solo aumenta unos 2 °C más para esa carga adicional.
Qué significa esto para un comprador
El WS300 no reduce su rendimiento bajo carga sintética o de inferencia sostenida porque su circuito de refrigeración se dimensionó por encima del límite de potencia del Superchip, y las temperaturas medidas dejan un margen de aproximadamente 20 °C en la GPU, con la HBM y la CPU funcionando a temperaturas aún más bajas en relación con sus límites. El componente que se calienta más es el ConnectX-8, razón por la cual está en el circuito. Las temperaturas del refrigerante se estabilizan en 15 minutos y se recuperan en minutos, por lo que las tareas consecutivas no acumulan calor. La velocidad del ventilador es el único factor que regula el ruido y la temperatura del refrigerante, y los datos del 60 % de MSI muestran que el sistema puede reducir considerablemente el flujo de aire antes de que los ventiladores tengan que aumentar su velocidad. Lo que no se reduce es el aspecto eléctrico: todavía se requiere un circuito de 20 A en Norteamérica, y el consumo en reposo de entre 220 y 290 W es el coste de mantener listos para funcionar 252 GB de HBM3e y una CPU Arm de 72 núcleos. Por otro lado, con este tipo de inversión, el sistema rara vez debería permanecer inactivo.
Este informe está patrocinado por MSI. Todas las opiniones expresadas en este informe se basan en nuestra visión imparcial de los productos analizados.






Amazon