隨著人工智慧和高效能運算工作負載的不斷擴展,其電力和散熱需求也隨之成長。現代GPU,包括NVIDIA的RTX PRO 6000 Blackwell伺服器版,功耗可高達600W,對傳統資料中心基礎架構帶來巨大的散熱壓力。雖然風冷伺服器可以應付這些GPU,但在如此高的密度下保持效能穩定則完全是另一回事。為裝滿高功率GPU的機架輸送空氣的成本急劇上升,尤其是在電價較高的地區,例如北歐、美國東北部和亞太部分地區。在這些市場,浸沒式冷卻技術能夠帶來顯著的營運和經濟優勢。
Hypertec 的 Trident iGW610R-G6 伺服器正是基於這種現實而設計的。與那些將風冷設計改造以適應液體環境的伺服器不同,Trident 系列伺服器從設計之初就考慮到了浸沒式散熱,其 PCB 佈局可直接在介電液體中運行。這款全新的 1U Hypertec 平台採用 21 吋 OCP 佈局,最多可支援四個全高全長的 GPU,在運算密度和穩定的散熱效能之間實現了完美平衡。
我們在 Hypertec 位於蒙特婁的實驗室對 Trident iGW610R-G6 進行了評估。首先進行遠端測試,然後到現場記錄並觀察系統的實際運作。測試配置包括一塊 NVIDIA H100 GPU 和 Solidigm SSD,並置於裝滿嘉實多介電液的 Submer 浸沒式水箱中。在持續高負載運轉時,Trident 保持了極其穩定的溫度曲線,各組件的溫度變化範圍非常窄。這種穩定性顯著降低了熱循環,而熱循環正是高效能係統中許多長期可靠性問題的根源。
浸沒式散熱的優點遠不止於溫度控制。在穩定的熱環境下,GPU 可以保持峰值睿頻頻率而不會降頻,CPU 的運作波動性更低,儲存設備也能提供穩定的 I/O 吞吐量。這種一致性轉化為更高的可靠性、可預測的性能以及更高的機架單元能耗效率——這些都是構建大規模 AI 和 HPC 環境的企業所關注的關鍵成果。
本次評估基於我們先前與 Hypertec 的合作,詳情請參閱《邊緣 AI 無所不在:浸沒式冷卻行動資料中心讓一切成為可能》。該專案展示了透過浸沒式冷卻技術在邊緣部署行動 AI 基礎設施的巨大潛力。本評估則將重點轉向固定資料中心部署,展示 Trident iGW610R-G6 及其來自 Submer 和 Castrol 的配套生態系統如何為高密度 GPU 運算提供切實可行的機架級效率。
TRIDENT iGW610R-G6 設計與製造
TRIDENT iGW610R-G6 的設計概念與傳統的風冷機架伺服器截然不同。乍一看,您會發現它沒有傳統的頂蓋,主要組件完全暴露在浸沒式冷卻液中。這種開放式機箱設計最大限度地增加了表面積,從而在介電液內部實現高效的熱傳遞,無需內部風扇或風道。系統的每個部件都經過精心設計,以實現單相浸沒式冷卻,熱能由周圍的冷卻液均勻吸收和帶走,而非透過氣流。最終打造出一個靜音、無振動的平台,專為高密度、高效能運算環境而最佳化。
這款機殼在物理尺寸上保持了 1U 標準,尺寸為 33.46 × 21.06 × 1.75 英寸,滿載重量約為 72 磅(32.6 公斤)。儘管外型纖薄,但其佈局卻非常便於維護,正面設有四個 E1.S NVMe 硬碟位,PCIe 插槽位置也便於快速更換水箱內部的組件。該設計可直接與主流的浸沒式水箱系統集成,無需專用硬體外殼或氣流控制裝置即可實現即插即用。
我們的測試單元配置了兩顆英特爾至強6530處理器,每顆處理器擁有32個核心和160MB緩存,每個插槽的TDP最高可達350瓦。散熱採用客製化的浸沒式優化純銅散熱器,並配備銦箔導熱界面材料,確保高效地將熱量傳遞至冷卻液。 CPU複合體搭配32條DDR5 RDIMM記憶體(每條容量32GB),運作頻率為4800 MT/s,為人工智慧、高效能運算和資料分析工作負載提供充足的頻寬。
儲存配置是這套方案的一大優勢。除了兩塊 1TB M.2 NVMe SSD 用於作業系統外,該系統還配備了四個 Solidigm D5-P5430 E1.S 7.68TB 硬碟作為主要資料儲存層。這些 EDSFF 硬碟兼具高密度和出色的能效,在緊湊的尺寸下充分利用了 PCIe 4.0 的性能。 E1.S 外型尺寸非常適合沉浸式環境,其前置可維護硬碟托架無需工具即可更換硬碟,無需排空或抬起機殼。 Solidigm 硬碟還有助於伺服器在速度、耐用性和散熱效率之間取得整體平衡,使其非常適合用於 AI 模型儲存、資料暫存和高吞吐量推理管線。
該系統最多支援四個雙倍寬度加速器,使用戶能夠根據需要擴展計算密度。網路連接由支援 1GbE 的雙埠 10GBase-T OCP 3.0 模組實現,確保與現有資料中心網路架構的廣泛相容性。
伺服器採用 1+1 冗餘的 3000W 80 PLUS 鈦金級 CRPS 電源供電,即使在高負載下也能保持穩定的效能,同時維持高能源效率。由於服務器完全浸沒在水中,無需主動風道,因此不會產生風扇噪音,也不會積灰。這種設計不僅簡化了維護,還延長了組件壽命,並提高了整體可靠性。
Hypertec 估計,iGW610R-G6 的浸沒式部署可降低 95% 的冷卻運行成本,並延長硬體壽命高達 60%,其經獨立認證的 PUE 為 1.03。該系統還具有回收高達 99% 廢熱的能源再利用潛力,展示了性能密度和永續性如何有效共存。
TRIDENT iGW610R-G6 管理概述
TRIDENT iGW610R-G6 採用搭載 ASPEED AST2600 基板管理控制器 (BMC) 的主機板,提供完整的 IPMI 2.0 相容性,並支援 iKVM 和虛擬媒體。此帶外管理平台使管理員能夠監控、配置和遠端管理系統,而無需考慮作業系統狀態。這些功能對於高密度和浸沒式冷卻部署至關重要。
基於網頁的介面簡潔易用,左側面板可快速存取儀錶板、系統資訊、感測器、日誌和報告以及電源控制等部分。每個部分都提供系統運作狀況、感測器資料、韌體版本和電源狀態的詳細資訊。儀錶板一目了然地顯示運行時間、訪問日誌和組件信息,無需額外軟體即可清晰了解系統狀態。
在浸沒式環境中操作時,這些遠端功能尤其重要。管理員無需將媒體或週邊設備實際插入油箱,即可透過虛擬媒體部署作業系統、掛載鏡像並執行更新。這不僅縮短了維護時間,還能確保浸沒式硬體操作的清潔、高效和安全。
儀錶板系統概述
主儀錶板顯示開機時長、韌體版本、網路詳情和GPU健康狀況。它作為TRIDENT平台的中央狀態面板,BMC提供溫度、電壓和感測器遙測數據,可透過IPMI指令或SNMP監控工具存取。
處理器庫存
處理器頁面列出了每個插槽,包括其型號、核心數和狀態。此裝置配備兩顆英特爾® 至強® 金牌 6530 處理器。每顆處理器均有 32 個核心,採用 x86 架構,分別安裝在 CPU1 和 CPU2 插槽中,並且已啟用。此頁面顯示最大頻率為 4,000 MHz,並確認了架構和系列,方便使用者驗證兩顆 CPU 是否存在、運作狀況良好且執行預期的微程式碼。
記憶體控制器清單
記憶體控制器頁面顯示所有 DIMM 記憶體條,包括其容量、供應商、序號、零件號碼、狀態和運作頻率。在我們的配置中,每個插槽都安裝了 Micron 32,768 MiB DDR5 RDIMM 記憶體條(零件號 MTC20F1045S1RC48BA22),這些記憶體已啟用並以 4400 MHz 的頻率運行,最大允許頻率為 4800 MHz。表格視圖使通道配置檢查變得簡單明了,並有助於確認所有記憶體庫的時序一致。
倉儲庫存
「儲存」標籤顯示已連接的磁碟機和控制器。在我們的系統中,可以看到 Solidigm D5-P5430 E1.S NVMe SSD 用作主存儲,而三星 990 Pro 1 TB M.2 硬碟則用於運行作業系統。每個驅動器的韌體版本、介面速度和加密狀態都會顯示出來,無需打開機箱即可輕鬆驗證儲存子系統。
TRIDENT iGW610R-G6 熱性能
熱性能對系統的長期可靠性至關重要,Hypertec Trident iGW610R-G6 的設計充分考慮了浸沒式運作的需求。 Trident 並非依靠空氣流過散熱片來帶走高密度組件的熱量,而是完全浸沒在介電液體中,將熱量直接從硬體傳導至可控冷卻迴路。這種設計消除了風冷系統常見的機械風險,例如風扇故障、灰塵污染和潮濕環境。透過將電子元件與空氣隔離並引入連續的液體散熱路徑,該系統能夠維持高度可控且穩定的熱環境。
在測試過程中,Trident iGW610R-G6 運行於一個 Submer SmartPod Exo 水箱內,該水箱配置為單相浸沒式冷卻。在此配置中,介電液體持續循環流經機箱,吸收 CPU、GPU 和 NVMe 硬碟的熱量,然後流經整合式熱交換器。吸收的熱量隨後被輸送到機房的冷水循環系統,最終被送到建築物的散熱系統。此閉環設計可使機架溫度保持穩定,確保冷卻液均勻流動,並防止高密度計算配置中常見的局部過熱現象。
循環液作為高比熱容的熱庫。隨著熱負荷的變化,液體吸收並均勻地將能量重新分配到整個水箱。這最大限度地減少了溫度梯度,並防止了風冷資料中心常見的元件級溫度波動。在傳統環境中,室溫或風扇轉速的變化會導致敏感元件的溫度波動幾度。隨著時間的推移,這些波動會在焊點和基板上造成物理應力。在浸沒式冷卻系統中,這種影響幾乎完全消除,從而減少了機械疲勞並延長了硬體的使用壽命。
為了測量高負載下的散熱性能,我們對Trident iGW610R-G6的所有主要子系統進行了壓力測試。我們使用FIO對每個SSD施加持續的I/O壓力,同時對GPU和CPU進行壓力測試,使這些組件的負載達到100%。在整個測試過程中,我們記錄了數小時內的組件溫度,以評估其平衡和波動特性。
測試結果高度一致。 CPU 溫度穩定在約 52°C,比空閒溫度高約 13.7°C。 GPU 溫度峰值約為 58°C,比空閒溫度高出 21.1°C。四塊 Solidigm NVMe SSD 的溫度變化趨勢相似,在負載下溫度維持在 29°C 至 30°C 之間,溫差為 8.8°C 至 9.2°C。達到平衡後,溫度在整個測試過程中保持穩定,波動極小,表示流體分佈均勻,且透過冷卻迴路有效散熱。
時間序列數據證實了這一性能。經過初始預熱階段後,所有感測器均顯示穩定且近乎水平的溫度曲線。沒有出現大幅波動或熱漂移,表明浸沒式冷卻能夠維持穩定的溫度,並且冷水循環系統能夠有效地將水箱中的熱量散發出去。即使在持續滿載運轉下,Trident 的溫度曲線也保持了極佳的可預測性。
從可靠性角度來看,這種穩定性帶來了顯著優勢。由於沒有風扇,減少了對活動部件的維護,而密封環境則可防止灰塵進入和連接器氧化。隨著時間的推移,這些特性轉化為更低的故障率和更長的平均維護間隔時間。 Trident iGW610R-G6 平台與 Submer 的單相 SmartPod Exo 環境相結合,提供了一種可重複且可靠的冷卻解決方案,能夠很好地擴展以適應高密度部署。
總體而言,Trident iGW610R-G6 收集的熱數據表明,採用主動式液體循環的浸沒式冷卻不僅能提供卓越的散熱管理,還能顯著提升可靠性。透過保持組件溫度的穩定性並消除對環境溫度的依賴,該系統無論工作負載或運行時間如何,都能在最佳範圍內運行,因此非常適合高可用性運算和儲存工作負載。
為什麼企業選擇沉浸式學習
浸沒式冷卻技術已不再是實驗性技術。建構大規模人工智慧和高效能運算環境的組織機構如今都在部署該技術,以實現穩定的散熱性能、更高的機架密度以及更高效的電力和設施資源利用。以下範例展示了浸沒式冷卻平台如何在生產環境中大規模應用。
阿達森
ADACEN 選擇沉浸式基礎設施來支援其 AI 和 HPC 即服務平台的擴展,使該組織能夠運行密集的 GPU 配置,同時簡化設施冷卻需求並提高長期營運效率。
「我們選擇與 Hypertec 合作,是因為他們獨創的浸沒式技術為我們帶來了空氣冷卻或晶片級液冷無法比擬的運營和可持續性優勢。他們精心設計的浸沒式平台使我們能夠部署更高密度的 CPU 和 GPU 資源,降低 90% 以上的冷卻能耗,並消除機械故障點。Hypertec 的系統使我們能夠滿足它們/HPC 實現我們的性能——HPC 即我們能夠滿足它們:這就是為什麼我們可以滿足它們/策略的核心組成部分。
ADACEN代表了一種在託管基礎設施中高密度部署的模式。研究計算環境也呈現類似的驅動因素和結果。
滑鐵盧大學
滑鐵盧大學正在九個浸沒式水槽中部署700個節點,以支援下一代科研運算。採用浸沒式設計能夠實現高密度GPU集群,同時保持穩定的熱性能並降低設施的複雜性。
「我們選擇Nibi的浸沒式冷卻技術,是因為它不僅效率和可靠性極高,還能簡化我們的資料中心設計。Hypertec的浸沒式伺服器讓我們能夠輕鬆部署高密度運算,而無需傳統風冷或液冷系統的複雜性。這種方法提高了效能和穩定性,並有助於我們建立一個高度永續、節能高效的高效能運算環境。
這些部署表明,沉浸式技術已經被用於大規模地提供可預測的效能,而這僅僅是眾多採用這種方法的組織中的兩個。
結語
我們對 Hypertec Trident iGW610R-G6 的評估表明,浸沒式散熱能夠為高密度 GPU 和儲存配置帶來持續的效能提升。在持續負載下,系統保持了穩定且較小的溫差,沒有任何溫度漂移或波動。 CPU 和 GPU 在負載下維持了穩定的工作點,Solidigm E1.S 固態硬碟也提供了穩定的 I/O 吞吐量,溫度波動極小。這種高度的溫度穩定性直接降低了組件的壓力,並最大限度地減少了通常會導致組件過早磨損的情況。
這些發現與大型業者在生產環境中的報告相符。 ADACEN報告稱,浸沒式部署的年故障率(AFR)顯著降低,這主要得益於熱循環的減少以及風扇振動和顆粒物暴露的消除。其結果是隨著時間的推移,可靠性得到提高,維護頻率降低,並且大規模運作下的服務連續性得到增強。
滑鐵盧大學在九個浸沒式冷卻槽中部署了700個節點,這進一步印證了浸沒式冷卻正被廣泛接受為建置和擴展高密度運算叢集的實用策略。其高效的運作效率、穩定的效能以及簡化的設施需求,使其非常適合規劃大規模運行人工智慧和高效能運算工作負載的機構。
浸沒式冷卻技術已在生產環境中展現出穩定的性能和高效的運作效率。隨著運算密度和功耗的持續成長,像Trident iGW610R-G6這樣的浸沒式平台為大規模人工智慧和高效能運算部署提供了一條切實可行且可持續的發展路徑。
本報告由 Solidigm 贊助。 本報告中表達的所有觀點和意見均基於我們對所考慮產品的公正看法。








Amazon