ZutaCore 推出了 OmniTherm,這是一款冷板,可為配備 NVIDIA 6000 Blackwell Server Edition GPU 的伺服器提供無水兩相冷卻方案,且採用單槽 PCIe 封裝。該解決方案的目標客戶是 OEM 廠商和大型營運商,他們希望在標準企業級和 AI 雲端伺服器設計中以全功率運行這些加速器,而無需切換到專用伺服器平台或浸沒式系統。
PCIe GPU 伺服器仍然是 AI 推理和混合工作負載的首選,因為它們更易於部署、擴展,並且能夠輕鬆整合到現有的機架和電源基礎架構中。隨著 GPU 功率密度的提高,傳統的風冷散熱開始限制效能。維運人員通常需要提高風扇轉速,這會增加功耗、提高噪音水平,並且仍然可能導致系統在處理高強度 AI 工作負載時容易過熱。
OmniTherm ZutaCore旨在透過採用兩相液冷技術來解決伺服器機殼內不使用水的問題。其冷板採用密封的介電液體,該液體在熱源處沸騰,然後在獨立的迴路中冷凝。 ZutaCore保持了單槽PCIe規格,使系統建構者能夠在標準伺服器架構中保持或提高加速器密度,同時將大部分熱量轉移到液冷迴路。這減少了對高轉速風扇的需求,降低了功耗,並減輕了機架層面的熱負荷和噪音。
ZutaCore首席技術長My D. Truong強調了PCIe GPU日益增長的重要性,隨著資料中心面臨不斷上漲的機架級電力預算,PCIe GPU兼具靈活性和高密度優勢。他提到,無水兩相冷卻和單槽外形設計的結合旨在幫助資料中心在保持穩定散熱性能的同時,增加每台伺服器的加速器數量,從而滿足持續的AI工作負載需求,尤其是在部署規模不斷擴大的情況下。
專為始終在線、可變的 AI 工作負載而設計
生產環境中的人工智慧系統很少能維持穩定的工作負載。推理任務變化很大,其使用量和功耗會隨著流量模式和模型行為而改變。這些波動會導致溫度快速變化,對風冷設計造成壓力,並影響性能可靠性。
OmniTherm 的兩相散熱設計能夠快速回應這些變化。隨著 GPU 負載增加,更多的介電液會在冷板上汽化,從而在不提高風扇轉速的情況下提升散熱效率。當負載降低時,隨著蒸氣冷凝,系統溫度會自然穩定下來。此功能有助於維運人員在各種工作負載下保持更穩定的溫度。它能夠確保效能穩定可靠,並降低高密度 PCIe GPU 伺服器中出現臨時降頻的風險。
保護長期基礎建設投資
對於營運商而言,長期可靠性和效能與峰值吞吐量同等重要。 ZutaCore 聲稱,OmniTherm 不僅能冷卻 GPU 晶片,還能冷卻附近的高價值組件,例如 CPU 和下一代高頻寬記憶體。該系統不僅涵蓋主加速器 ASIC,還能有效冷卻多晶片和 HBM 密集設計中的關鍵熱點區域。
更廣泛的散熱覆蓋範圍支援長時間運行、頻寬密集的人工智慧任務,這些任務對運算和記憶體系統都是嚴峻的挑戰。降低這些組件的熱應力可以提高長期穩定性,減少效能衰減,並在GPU和記憶體技術不斷進步的過程中保護對高功率PCIe平台的投資。
架秤操作注意事項
隨著機架處理更高功率密度的需求日益增長,僅依靠空氣冷卻的成本和複雜性也迅速增加。更高的風扇功率、更大的噪音以及更嚴格的暖通空調需求都會增加營運成本,並可能影響資料中心的工作環境。
OmniTherm 的密封式非導電介電液體迴路旨在吸收伺服器的大部分熱量,並將其傳遞到機房側的液體迴路,而無需將水引入機箱內部。這種結構可以減少對極高風扇轉速的依賴,降低冷卻能耗,並幫助營運商控制噪音水平。此外,該方案還能透過將更多冷卻需求轉移到液體系統而非僅依賴氣流,從而支援在現有空間內擴展基於 PCIe 的 AI 部署。
HyperCool Cloud
與 OmniTherm 一同推出的還有 HyperCool Cloud,這是一個基於雲端的運維平台,用於管理分散式部署中的液冷系統。本平台設計安全可靠,並採用遙測技術,可提供近乎即時的冷卻液分配單元 (CDU) 及相關冷卻設備的運作狀況資訊。
HyperCool Cloud 為 CDU 提供遙測數據,支援全集群監控,並實現從警報到解決的完整工作流程。對於營運商而言,這意味著液冷系統可以像其他基礎設施組件一樣,作為可管理、可觀測的服務運作。其目標是在液冷系統擴展到多個站點和更大規模的 PCIe GPU 伺服器叢集時,提升服務回應速度,簡化事件管理,並確保正常運作時間。
OmniTherm 和 HyperCool Cloud 的結合使 ZutaCore 能夠應對基於 PCIe 的 AI 平台在擴展過程中,透過無水兩相液冷技術所面臨的硬體和營運挑戰。




Amazon