La domanda più frequente che ci è stata posta riguardo alla MSI XpertStation WS300 dopo la nostra recensione si concentra su un tema chiave. Il processore GB300 Grace Blackwell Ultra Superchip è un componente da 1,300 W che normalmente viene installato in un rack con raffreddamento a liquido, quindi cosa succede alle temperature quando viene montato in un case tower? La preoccupazione è legittima: un sistema con GB300 che raggiunge il suo limite termico subirà un calo di prestazioni, e un sistema che rallenta sotto carico di inferenza prolungato non offre le prestazioni per cui è stato acquistato. Nella nostra recensione, abbiamo affermato che la WS300 è rimasta fresca e stabile durante i test. Il motivo risiede nei dati di progettazione del sistema di raffreddamento di MSI, qui combinati con le curve di temperatura, consumo e frequenza che abbiamo registrato durante un test sul sistema.
Cosa deve fare il Loop
Il budget termico di una DGX Station è definito da NVIDIA; il modulo GB300 ha un limite di potenza SuperChip di 1,300 W e l'intero sistema funziona con un singolo alimentatore da 1,600 W che deve alimentare anche l'archiviazione, le pompe, le ventole e qualsiasi scheda RTX PRO opzionale. Quasi tutti questi 1,300 W vengono dissipati sotto forma di calore in quattro punti: la GPU Blackwell Ultra con i suoi 252 GB di HBM3e, la CPU Grace a 72 core, 496 GB di memoria distribuiti su quattro moduli SOCAMM LPDDR5X e la ConnectX-8 SuperNIC con le sue due porte ottiche da 400 GbE. MSI applica delle piastre di raffreddamento su tutti e quattro i componenti e il circuito di raffreddamento passa attraverso due radiatori da 360 mm con sei ventole da 120 mm. Una ventola separata da 120 mm spinge l'aria attraverso il resto del case per raffreddare gli SSD e gli altri componenti raffreddati ad aria. MSI dichiara un consumo di 1,400 W per CPU e GPU, circa 100 W in più rispetto al consumo massimo consentito da NVIDIA per il Superchip.
Quel margine di 100 W è una scelta progettuale di fondamentale importanza. Un circuito progettato solo per il carico nominale non tiene conto di un ufficio caldo, di un radiatore impolverato o di una ventola che funziona a velocità inferiore a quella massima. Un circuito con un margine di potenza superiore al limite consentito significa che il silicio raggiunge il suo limite di potenza prima di raggiungere il suo limite termico.
Dati sulla piastra fredda di MSI
MSI ha condiviso con noi i dati di caratterizzazione relativi al circuito di raffreddamento. L'azienda chiama la metodologia CIT, acronimo di Component Integrity Test (Test di integrità dei componenti), e definisce le curve "empiriche": sono state misurate al banco durante ripetuti cicli di pressione e temperatura. Il primo grafico è quello che interessa maggiormente a un ingegnere termico. Rappresenta la resistenza termica in gradi Celsius per watt delle piastre di raffreddamento di GPU e CPU in funzione della portata del liquido di raffreddamento, insieme alla caduta di pressione che ciascuna piastra impone alla pompa.
La resistenza termica della piastra della GPU parte da circa 0.031 °C/W con un flusso di 0.3 litri al minuto e diminuisce bruscamente all'aumentare del flusso, raggiungendo circa 0.017 °C/W a 1.5 LPM e 0.012 °C/W a 3 LPM. La piastra della CPU, che copre una parte a consumo energetico molto inferiore, si attesta su valori più elevati, intorno a 0.028 °C/W a 1.5 LPM. La resistenza termica è il moltiplicatore che trasforma i watt in gradi: a 1.5 LPM, ogni 100 W che attraversano la piastra della GPU comportano un aumento di temperatura di circa 1.7 °C tra il liquido di raffreddamento e la piastra. Con una potenza di 1,000 W, la piastra raggiunge una temperatura di circa 17 °C superiore a quella dell'acqua. Il compromesso è rappresentato dalla caduta di pressione, che aumenta con il quadrato del flusso. A 1.5 LPM, la piastra della GPU richiede alla pompa una pressione di circa 1.1 PSI, mentre la piastra della CPU richiede circa 1.9 PSI. Le curve si appiattiscono oltre i 2 LPM, motivo per cui il circuito è progettato per funzionare nell'intervallo da 1.5 a 2 LPM; una portata maggiore comporta un rendimento termico decrescente a fronte di un costo della pompa più elevato.
Radiatori, ventilatori e il compromesso tra rumore e comfort
La seconda serie di grafici riguarda l'altra estremità del circuito. ATD è l'acronimo di Ambient Temperature Difference, ovvero la differenza di temperatura tra il liquido di raffreddamento e l'aria ambiente dopo che questo ha lasciato i radiatori. È il valore che definisce la temperatura minima di ogni componente del sistema, poiché nessun elemento del circuito può funzionare a una temperatura inferiore a quella dell'acqua che lo alimenta. MSI riporta i valori di ATD in funzione del carico termico per la coppia di radiatori da 360 mm a portate comprese tra 1 e 2 LPM, una volta con le sei ventole al 100% di PWM (modulazione di larghezza di impulso) e una volta al 60%.
Alla massima velocità delle ventole, i radiatori mantengono il liquido di raffreddamento entro 5-9 °C dalla temperatura ambiente con un carico termico di 1,000 W su tutto l'intervallo di flusso, ed entro 8-12 °C a 1,400 W, oltre il limite di potenza del Superchip. Le linee sono quasi lineari e il liquido di raffreddamento a flusso più lento rimane più a lungo nel radiatore ed esce più vicino alla temperatura ambiente, motivo per cui la linea di 1 LPM si trova più in basso; il compromesso è la maggiore resistenza della piastra fredda a basso flusso dal primo grafico, quindi il punto di funzionamento del circuito è un equilibrio tra i due. Il grafico PWM al 60% è quello più realistico per un sistema accanto a una scrivania, perché nessuno fa funzionare (o vuole far funzionare) sei ventole da 120 mm a pieno regime in un ufficio.
Al 60%, l'ATD raddoppia approssimativamente: da 10 a 16 °C a 1,000 W e da 15 a 23 °C a 1,400 W, una penalità relativamente modesta. Anche alla massima potenza del Superchip e con velocità delle ventole ridotta, il liquido di raffreddamento entra nelle piastre fredde a una temperatura non superiore a circa 23 °C rispetto alla temperatura ambiente. Aggiungendo l'aumento di 17 °C della piastra della GPU dal primo grafico, il pacchetto Blackwell Ultra funziona a circa 40 °C sopra la temperatura ambiente a 1,000 W, ben all'interno del suo intervallo operativo in un normale ufficio. L'ultimo grafico MSI è la curva di impedenza lato aria del radiatore, che mostra la pressione che le ventole devono superare per spingere l'aria attraverso la pila di alette, raggiungendo circa 1 mm di acqua a 135 CFM e 2 mm a 185 CFM. Si tratta di un nucleo a bassa restrizione, che è ciò che consente alle ventole di funzionare a bassa velocità.
La nostra prova: circa 3 ore sul GB300
Le curve di progetto descrivono il comportamento previsto di un ciclo; per osservare il suo comportamento effettivo, abbiamo registrato il WS300 durante una sessione di 2.8 ore composta da cinque fasi: un burn-in di 75 minuti con carico GPU sostenuto, seguito da DeepSeek v4 Flash gestito tramite vLLM con tre profili, un carico di lavoro con 512 token in ingresso e 512 in uscita, un carico di lavoro con pre-riempimento intensivo (8,192 token in ingresso e 1,024 in uscita) e un carico di lavoro con decodifica intensiva (1,024 token in ingresso e 8,192 in uscita) con concorrenza crescente, seguito da una finestra di osservazione a riposo. Abbiamo campionato continuamente la telemetria di GPU, HBM, CPU e consumo energetico. Le temperature del liquido di raffreddamento, dell'aria del case e della scheda provengono dal BMC, che abbiamo interrogato ogni paio di minuti. Le aree ombreggiate in ciascun grafico indicano le fasi.
Durante l'intero burn-in, il die Blackwell Ultra si è mantenuto a 60°C, con HBM3e circa 10°C più caldo a 70°C e Grace a 64°C. Questi sono i valori a regime con una potenza GPU di circa 1,000 W e non sono aumentati nel corso dei 75 minuti, il che è tipico di un ciclo che ha raggiunto l'equilibrio con un margine di sicurezza. Le fasi di inferenza sono in media più fredde perché il carico è più irregolare: la GPU ha raggiunto nuovamente un picco di 60°C durante il carico di lavoro uniforme e 58°C durante la lunga fase di decodifica, con HBM che ha toccato un massimo di 73°C. L'andamento a dente di sega sulla linea DRAM è un artefatto dell'intervallo di campionamento del BMC; la LPDDR5X stessa ha raggiunto un picco di circa 75°C. Il sensore più caldo del box per la maggior parte del test è stato il ConnectX-8 con temperature comprese tra 76 e 77°C. Le temperature a riposo si sono stabilizzate tra i 33 e i 36 °C per la GPU e la memoria HBM e intorno ai 48 °C per Grace.
Durante il rodaggio, il liquido di raffreddamento ha lasciato i radiatori a 37°C ed è tornato dalle piastre fredde a 47°C, con un aumento di 10°C lungo tutto il circuito. L'aria all'interno del case ha raggiunto i 46°C, la base del BMC i 52°C e il sensore più caldo della scheda i 56°C. Ciascuna di queste temperature si stabilizza entro i primi 15 minuti di carico e rimane costante, per poi diminuire entro pochi minuti al termine del carico. In idle, la temperatura del liquido di raffreddamento si manteneva tra i 30 e i 31°C.
Il burn-in ha mantenuto la GPU a circa 995 W, con Grace che ha aggiunto altri 85-90 W per un totale di Superchip vicino a 1,080 W, che è il carico a cui corrisponde la differenza di raffreddamento sopra riportata. Lo stesso carico di lavoro ha brevemente toccato lo stesso livello di 1,000 W della GPU ad alta concorrenza; la fase di pre-riempimento ha funzionato a brevi raffiche fino a circa 1,050 W totali; e la fase di decodifica è l'immagine più chiara di come un server di inferenza carica una GPU, passando da circa 500 W a poco più di 1,000 W man mano che la concorrenza raddoppiava in ogni fase. In nessun momento del test la potenza totale di Superchip si è avvicinata di meno di 200 W al limite di 1,300 W indicato nel grafico. Vale la pena notare che in idle è importante per chiunque stia pianificando l'alimentazione: la sola GPU assorbe da 150 a 210 W senza alcun processo in esecuzione, e il Superchip totale in idle assorbe da 220 a 290 W.
La Blackwell Ultra ha funzionato a circa 2.07 GHz dall'inizio del burn-in fino alla fine del test, con una frequenza costante in ogni fase e senza cali. Grace si è mantenuta intorno ai 3.5 GHz con un jitter normale, la HBM è rimasta a 4,000 MHz e la LPDDR5X a 3,200 MHz. Una GPU limitata termicamente si manifesta in questo caso con un comportamento molto irregolare, poiché l'algoritmo di boost rallenta e poi riprende; una GPU limitata dal consumo energetico mostra una frequenza che segue il carico; nessuno di questi due comportamenti si è verificato nei nostri test. Con questi carichi di lavoro, il sistema non era né sufficientemente caldo né sufficientemente limitato dal punto di vista energetico da superare la sua frequenza massima.
Collegare i due
Le curve di MSI e le nostre misurazioni sono state prodotte in modo indipendente e giungono alla stessa conclusione. Partiamo dall'aumento di temperatura del liquido di raffreddamento di 10°C a 1,080W. Il calore trasportato da un liquido è dato dalla portata moltiplicata per l'aumento di temperatura, quindi tale differenza implica una portata di liquido di raffreddamento di circa 1.5 litri al minuto per un liquido a base d'acqua, esattamente nell'intervallo caratterizzato da MSI. Consultando il grafico del radiatore di MSI a quella portata e a quel carico: alla velocità della ventola del 100%, la temperatura del liquido di raffreddamento dovrebbe essere circa 8°C superiore alla temperatura ambiente; al 60%, circa 14°C. Non avevamo una sonda ambiente calibrata nel laboratorio di MSI, quindi non possiamo chiudere il cerchio con precisione, ma una temperatura di mandata di 37°C è coerente con una stanza di laboratorio calda e ventole che funzionano ben al di sotto della velocità massima.
A 1.5 LPM, la resistenza misurata della piastra della GPU è di circa 0.017 °C/W, il che a 995 W prevede un aumento di 17 °C tra il liquido di raffreddamento e la piastra. Abbiamo misurato il die Blackwell Ultra a 60 °C contro un alimentatore a 37 °C, con una differenza di 23 °C. La differenza di 6 °C tra i due è dovuta all'interfaccia termica e al package stesso, la parte del percorso che la piastra di raffreddamento non può controllare, ed è un valore piccolo per una GPU a doppio reticolo di queste dimensioni. La piastra sta facendo ciò che i dati di benchmark di MSI affermano, e il margine tra il die e il liquido di raffreddamento è dettato dalle leggi della fisica.
Se consideriamo il budget in modo diverso, il margine di cui abbiamo parlato prima diventa più evidente. Le GPU per data center di NVIDIA non iniziano a ridurre la frequenza di clock finché il die non raggiunge gli 80°C, quindi la WS300 a pieno carico continuo presentava circa 20°C di differenza tra il die Blackwell Ultra e il punto in cui sarebbe intervenuta la gestione termica, e questo con il circuito di raffreddamento che assorbiva 1,080W. Anche al limite peggiore di 1,300W del Superchip, altri 220W attraverso una piastra da 0.017 °C/W aggiungono meno di 4°C alla GPU, e il grafico del radiatore di MSI mostra che il liquido di raffreddamento aumenta di soli 2°C circa per quel carico aggiuntivo.
Cosa significa questo per un acquirente
Il WS300 non subisce throttling sotto carico prolungato di inferenza o simulazioni sintetiche perché il suo circuito di raffreddamento è stato dimensionato al di sopra del limite di potenza del Superchip e le temperature misurate lasciano circa 20°C di margine sulla GPU, con HBM e CPU che funzionano a temperature ancora inferiori rispetto ai loro limiti. Il componente che si scalda di più è il ConnectX-8, motivo per cui è incluso nel circuito di raffreddamento. Le temperature del liquido di raffreddamento si stabilizzano entro 15 minuti e si ripristinano in pochi minuti, quindi i processi consecutivi non accumulano calore. La velocità delle ventole è l'unico fattore che regola il rapporto tra rumore e temperatura del liquido di raffreddamento e i dati del 60% di MSI mostrano che il sistema può rinunciare a un flusso d'aria considerevole prima che le ventole debbano aumentare la velocità. L'unica cosa che non si riduce è il lato elettrico: un circuito da 20 A è ancora richiesto in Nord America e il consumo in idle, compreso tra 220 e 290 W, è il prezzo da pagare per mantenere pronti al lavoro 252 GB di HBM3e e una CPU Arm a 72 core. D'altra parte, con questo tipo di investimento, il sistema dovrebbe essere lasciato inattivo raramente.
Questo report è sponsorizzato da MSI. Tutte le opinioni espresse in questo report si basano sulla nostra valutazione imparziale del/dei prodotto/i in esame.






Amazon