布萊恩最近採訪了熱管理專家、液冷技術先驅蒂姆·謝德。播客節目回顧了資料中心液冷技術的發展歷程,從蒂姆早年在克雷公司使用噴淋技術冷卻管道,到他近期參與戴爾PowerEdge XE9680伺服器項目,內容涵蓋了資料中心液冷技術的一些歷史發展階段。

StorageReview 實驗室中的戴爾 PowerEdge XE9680
蒂姆·謝德是一位行業專家和機械工程師,專長於熱管理、液冷和資料中心基礎設施。他曾任威斯康辛大學麥迪遜分校教授,從事學術研究;也曾在 Motivair 公司擔任基礎工程職務;並在戴爾科技集團首席技術官辦公室擔任高級技術領導職務。他的職業生涯涵蓋了高密度冷卻架構的多個領域,並始終處於該領域的前沿。他的工作重點在於將先進的熱物理學與超大規模製造流程結合,制定冷卻分配單元的標準,並優化風冷和液冷硬體拓撲結構下的資料中心電源效率。
本播客深入剖析了從大型主機、高效能運算平台到目前伺服器技術的散熱發展歷程。不到一小時,您就能更好地理解散熱如何影響我們技術高效運作的方方面面。
如果您沒有時間從頭到尾觀看,我們已將其分成五分鐘的片段,以便您可以選擇對您最重要的部分。
[00:00] 從高效能運算到企業人工智慧的液冷技術演變
第一部分概述了液冷技術從專用超級電腦裝置到高密度商業企業應用的歷史發展歷程,重點介紹了早期的熱設計選擇。
- 早期的運算環境依靠蒸發冷卻和基本的強制空氣對流,直到達到高密度高效能運算和加速運算工作負載所帶來的限制。
- 最初對 Cray 架構的學術實驗涉及直接在管子上噴塗液體,這在技術上是可行的,但在商業成本上卻難以承受。
- 2015 年後機架功率密度的轉折點促使 OEM 廠商設計標準化的企業級液態部署方案,最終在 2019 年實現了高密度機架生產模式。
- OEM 供應鏈從每年生產數千個液冷節點轉變為每週交付數千個生產系統。
- 像 PowerEdge XE9680 這樣的主力企業平台是戴爾歷史上成長最快的伺服器,在全面採用晶片直接散熱成為強制性措施之前,早期的 AI 熱負載透過密集空氣散熱器和後門熱交換器來平衡。
[05:00] 大規模測試熱斷點與流體物理學
本節探討了競爭性熱技術的實驗室評估,詳細說明了為什麼單相直接到晶片迴路成為比浸沒式系統更占主導地位的架構。

戴爾 PowerEdge R760 伺服器內部採用 CoolIT 晶片直冷板
- OEM 驗證實驗室對冷板迴路、負壓網路、浸沒式配置和兩相繫統進行了廣泛的測試,以建立部署基準。
- 從歷史上看,矽的熱負荷隨著每一代晶片的迭代而逐步增加,因此在 TDP 超過 500W-1000W 範圍之前,標準的空氣冷卻和基本的液冷方法就足夠了。
- 浸沒式冷卻對於分佈廣泛的熱分佈(例如加密貨幣農場)具有操作優勢,但對於現代加速器上發現的局部、高度集中的熱通量則難以應對。
- 將水與 25% 丙二醇 (PG25) 混合,透過以下方式輸送 微通道冷板由於其可預測的規模、供應的便利性和已確立的熱傳遞性能,它成為了主要標準。
- 開放的生態系統標準對於從多個供應商採購冷板、歧管和快速接頭而不出現性能下降仍然至關重要。
[10:00] 標準化、多廠商互通性和機械可靠性
討論轉向部署液態硬體的實際操作,重點在於多供應商組件整合、責任劃分和材料完整性。
- 混合使用不同供應商的冷卻組件會帶來嚴重的機械相容性問題,並且在發生液體洩漏時會受到嚴格的保固限制。
- 法律責任和服務等級協定仍然是阻礙生產伺服器樓層採用混合供應商管道架構的主要產業障礙。
- 傳統的繩索式洩漏檢測系統正在被整合式感測器拓撲結構所取代,該結構具有自動泵浦跳閘和閥門切斷功能。
- 過氧化物硫化 EPDM 軟管製造技術的進步顯著降低了直接接觸晶片的管路系統中的組件級故障率。
- 現場系統不可靠性主要源自於製造過程中產生的碎屑和初始管路沖洗不充分,而不是零件本身的疲勞。
[15:00] 碎片管理、熱通量限制與負壓物理學
本研究探討了精密冷板流體動力學、微觀顆粒污染的災難性影響以及限制負壓冷卻迴路的大氣物理現象。

Chilldyne負壓CDU
- 即使是 100 到 200 微米的顆粒物,即使是一根卡在快速斷開裝置中的鋼絲刷纖維,也會堵塞微通道鰭片,並透過熱節流導致機架損壞。
- 先進的計算流體動力學 (CFD) 建模使現代冷板能夠在保持 30°C 溫差懲罰的前提下,耗散 1500W 的負載。
- 負壓冷卻系統 本質上受到大氣壓力的限制,在室溫下,流體達到沸點之前,只有 7 到 9 PSI 的可用壓力差。
- 有限的壓力預算使得負壓迴路難以透過長設施歧管、CDU 和高阻力微通道冷板進行佈線。
- 專門的水化學分析和持續的化學監測對於防止腐蝕、生物生長和材料降解至關重要。
[20:00] 環境因素、流體化學和先進洩漏檢測
本次對話探討了區域氣候對資料中心營運的影響、冷凝風險以及快速反應洩漏檢測感測器的技術發展。
- 區域濕度、海拔和環境條件決定了二次循環水的溫度和設施的冷卻效率。
- 在高濕度氣候下,低於環境溫度的迴路溫度會導致伺服器機箱組件上形成冷凝水,因此需要專門的露點控制。
- 傳統洩漏檢測繩存在供應鏈瓶頸和觸發閾值高的問題,需要大量的液體才能觸發警報。
- 新一代洩漏檢測技術利用柔性聚合物印刷感測器線、光學染料檢測和蒸汽嗅探器來識別微洩漏,從而避免災難性故障的發生。
- 智慧型機架控制器在偵測到早期流體損失時主動調節 CDU 迴路壓力,以最大限度地減少洩漏量,同時保持正常運作時間。
[25:00] 評估兩相直接晶片製造的潛力及冷媒化學性質
本部分探討了兩相冷卻中潛熱汽化的熱力學優勢,以及低全球暖化潛勢冷媒的供應鏈和化學方面的考量。
- 兩相直接對晶片冷卻消除了單相迴路的顯熱損耗(通常至少為 5°C),無論晶片耗散 10W 還是 1,000W 的功率,都能保持恆定的沸點。
- 兩相冷卻最大限度地減少了與水有關的腐蝕和機架中電氣短路的風險,為企業資料中心提供了引人注目的部署模式。
- 擴展兩相迴路需要解決相變歧管、常壓蒸餾裝置和複雜蒸汽冷凝器等多供應商的互通性問題。
- 新興的低全球暖化潛勢值、不易燃的介電液體(如 R-515B 和 R-1233zd)正在克服與傳統 PFAS 化合物相關的監管限制。
- 現代資料中心基礎設施供應商正在收購專業的冷卻供應商,以建立統一的交鑰匙液冷散熱解決方案組合。
[31:33] CDU架構、動態流動控制與爆炸半徑減緩
本節重點在於核心泵送基礎設施,分析標準化測試方法、瞬態熱響應以及集中式和分佈式常量供熱單元之間的工程權衡。

戴爾 PowerCool CDU
- ASHRAE 標準 127 制定了標準化的測試方法,以便對 CDU 熱效率和泵浦性能進行準確的、公平的比較。
- 冷卻液流量的微小變化會立即轉換為冷板上的溫度波動;10% 的流量變化可能會觸發節流事件,這就要求控制演算法具有超強的反應能力。
- 集中式多兆瓦常壓裝置涉及大量的流體和較大的運行爆炸半徑,因此一次污染或洩漏事件可能導致整個設施大廳癱瘓。
- 添加劑的化學不相容性使得混合不同供應商的專用冷卻液變得危險,可能導致沉澱和堵塞。
- 分散式行級和機架內 CDU 可隔離機械故障區域,減少流體輸送管道,並加快安裝進度。
[37:00] 機架內CDU與集中式迴路及風冷乾涉的可行性
本部分評估了高性能機架式 CDU 的性能概況,並概述了為什麼空氣冷卻在分散式企業推理集群中仍然佔據主導地位。
- 專用機架內 CDU 可支援 220kW 的熱負荷,溫差為 4°C,可將 41°C 的設施用水轉化為 45°C 的冷卻液,用於 Vera Rubin 機架,每千瓦消耗 1.5 公升冷卻液。
- 機架式 CDU 內部的雙泵冗餘設計即使在單泵維護期間也能保持連續冷卻運作。
- 空氣冷卻約佔全球伺服器出貨量的 90%,並為相當一部分企業推理部署提供支援。
- 邊緣和企業推理硬體必須直接部署在傳統的、已有 10 到 15 年歷史的、採用風冷技術的資料中心內,資料就是在這些資料中心內產生的。
- 透過對老舊設施進行改造,安裝後門熱交換器和蒸發冷卻塔,可以將寄生冷卻功率轉換為可用於本地 AI 推理盒的計算千瓦。
[45:20] 機殼內部空氣動力學與風扇效率前沿
最後一部分詳細分析了閉環一體式散熱器的機械權衡,並探討了機箱空氣動力學優化如何將空氣冷卻能力推向其物理極限。
- 伺服器級內部一體化液冷散熱系統引入了機械故障點和機箱封裝複雜性,而與優化後的均熱板散熱器相比,性能提升卻微乎其微。
- 對於缺乏設施用水的設施,側掛式液冷式空氣熱交換器為局部液冷機架提供了更清潔、更易於維護的路徑。
- 企業伺服器風扇效率已從十年前的 15% 到 20% 提高到如今的 50% 到 60% 的電能到機械能轉換率。
- 圍繞每千瓦 100 CFM 的設計點優化底盤空氣動力學,使每一滴進氣都能均勻地加熱 18°C,從而最大限度地提高每千瓦的散熱量。
- 空氣具有良好的熱擴散特性,當與精密管道和先進的散熱器相結合時,可為下一代企業硬體提供堅實的基礎。
要了解有關液冷和高效資料中心設計的最新資訊,請在 LinkedIn 上關注 Tim Shedd。




Amazon