布莱恩最近采访了热管理专家、液冷技术先驱蒂姆·谢德。播客节目回顾了数据中心液冷技术的发展历程,从蒂姆早年在克雷公司使用喷淋技术冷却管道,到他近期参与戴尔PowerEdge XE9680服务器项目,内容涵盖了数据中心液冷技术的一些历史发展阶段。

StorageReview 实验室中的戴尔 PowerEdge XE9680
蒂姆·谢德是一位行业专家和机械工程师,专长于热管理、液冷和数据中心基础设施。他曾任威斯康星大学麦迪逊分校教授,从事学术研究;也曾在 Motivair 公司担任基础工程职务;并在戴尔科技集团首席技术官办公室担任高级技术领导职务。他的职业生涯涵盖了高密度冷却架构的多个领域,始终处于该领域的前沿。他的工作重点在于将先进的热物理学与超大规模制造工艺相结合,制定冷却分配单元的标准,并优化风冷和液冷硬件拓扑结构下的数据中心电源效率。
本播客深入剖析了从大型机、高性能计算平台到当前服务器技术的散热发展历程。不到一小时,您就能更好地理解散热如何影响我们技术高效运行的方方面面。
如果您没有时间从头到尾观看,我们已将其分成五分钟的片段,以便您可以选择对您最重要的部分。
[00:00] 从高性能计算到企业人工智能的液冷技术演变
第一部分概述了液冷技术从专用超级计算机装置到高密度商业企业应用的历史发展历程,重点介绍了早期的热设计选择。
- 早期的计算环境依靠蒸发冷却和基本的强制空气对流,直到达到高密度高性能计算和加速计算工作负载所带来的限制。
- 最初对 Cray 架构的学术实验涉及直接在管子上喷涂液体,这在技术上是可行的,但在商业成本上却难以承受。
- 2015 年之后机架功率密度的拐点促使 OEM 厂商设计标准化的企业级液态部署方案,最终在 2019 年实现了高密度机架生产模式。
- OEM 供应链从每年生产几千个液冷节点转变为每周交付数千个生产系统。
- 像 PowerEdge XE9680 这样的主力企业平台是戴尔历史上增长最快的服务器,在全面采用芯片直接散热成为强制性措施之前,早期的 AI 热负载通过密集空气散热器和后门热交换器来平衡。
[05:00] 大规模测试热断点和流体物理学
本节探讨了竞争性热技术的实验室评估,详细说明了为什么单相直接到芯片回路成为比浸没式系统更占主导地位的架构。

戴尔 PowerEdge R760 服务器内部采用 CoolIT 芯片直冷板
- OEM 验证实验室对冷板回路、负压网络、浸没式配置和两相系统进行了广泛的测试,以建立部署基准。
- 从历史上看,硅的热负荷随着每一代芯片的迭代而逐步增加,因此在 TDP 超过 500W-1000W 范围之前,标准的空气冷却和基本的液冷方法就足够了。
- 浸没式冷却对于分布广泛的热分布(例如加密货币农场)具有操作优势,但对于现代加速器上发现的局部、高度集中的热通量则难以应对。
- 将水与 25% 丙二醇 (PG25) 混合,通过以下方式输送 微通道冷板由于其可预测的规模、供应的便利性和已确立的热传递性能,它成为了主要标准。
- 开放的生态系统标准对于从多个供应商采购冷板、歧管和快速接头而不出现性能下降仍然至关重要。
[10:00] 标准化、多厂商互操作性和机械可靠性
讨论转向部署液态硬件的实际操作,重点关注多供应商组件集成、责任划分和材料完整性。
- 混合使用不同供应商的冷却组件会带来严重的机械兼容性问题,并且在发生液体泄漏时会受到严格的保修限制。
- 法律责任和服务级别协议仍然是阻碍生产服务器楼层采用混合供应商管道架构的主要行业障碍。
- 传统的绳索式泄漏检测系统正在被集成传感器拓扑结构所取代,该结构具有自动泵跳闸和阀门切断功能。
- 过氧化物硫化 EPDM 软管制造技术的进步显著降低了直接接触芯片的管道系统中的组件级故障率。
- 现场系统不可靠性主要源于制造过程中产生的碎屑和初始管路冲洗不充分,而不是部件本身的疲劳。
[15:00] 碎片管理、热通量限制和负压物理学
本研究探讨了精密冷板流体动力学、微观颗粒污染的灾难性影响以及限制负压冷却回路的大气物理现象。

Chilldyne负压CDU
- 即使是 100 到 200 微米的颗粒物,哪怕是一根卡在快速断开装置中的钢丝刷纤维,也会堵塞微通道鳍片,并通过热节流导致机架损坏。
- 先进的计算流体动力学 (CFD) 建模使现代冷板能够在保持 30°C 温差惩罚的前提下,耗散 1500W 的负载。
- 负压冷却系统 本质上受到大气压力的限制,在室温下,流体达到沸点之前,只有 7 到 9 PSI 的可用压差。
- 有限的压力预算使得负压回路难以通过长设施歧管、CDU 和高阻力微通道冷板进行布线。
- 专门的水化学分析和持续的化学监测对于防止腐蚀、生物生长和材料降解至关重要。
[20:00] 环境因素、流体化学和先进泄漏检测
本次对话探讨了区域气候对数据中心运营的影响、冷凝风险以及快速响应泄漏检测传感器的技术发展。
- 区域湿度、海拔和环境条件决定了二次循环水的温度和设施的冷却效率。
- 在高湿度气候下,低于环境温度的回路温度会导致服务器机箱组件上形成冷凝水,因此需要专门的露点控制。
- 传统泄漏检测绳存在供应链瓶颈和触发阈值高的问题,需要大量的液体才能触发警报。
- 新一代泄漏检测技术利用柔性聚合物印刷传感器线、光学染料检测和蒸汽嗅探器来识别微泄漏,从而避免灾难性故障的发生。
- 智能机架控制器在检测到早期流体损失时主动调节 CDU 回路压力,以最大限度地减少泄漏量,同时保持正常运行时间。
[25:00] 评估两相直接芯片制造的潜力及制冷剂化学性质
本部分探讨了两相冷却中潜热汽化的热力学优势,以及低全球变暖潜值制冷剂的供应链和化学方面的考虑因素。
- 两相直接对芯片冷却消除了单相回路的显热损耗(通常至少为 5°C),无论芯片耗散 10W 还是 1,000W 的功率,都能保持恒定的沸点。
- 两相冷却最大限度地减少了与水有关的腐蚀和机架中电气短路的风险,为企业数据中心提供了一种引人注目的部署模式。
- 扩展两相回路需要解决相变歧管、常压蒸馏装置和复杂蒸汽冷凝器等多供应商的互操作性问题。
- 新兴的低全球变暖潜能值、不易燃的介电液体(如 R-515B 和 R-1233zd)正在克服与传统 PFAS 化合物相关的监管限制。
- 现代数据中心基础设施提供商正在收购专业的冷却供应商,以构建统一的交钥匙液冷散热解决方案组合。
[31:33] CDU架构、动态流动控制和爆炸半径减缓
本节重点关注核心泵送基础设施,分析标准化测试方法、瞬态热响应以及集中式和分布式常量供热单元之间的工程权衡。

戴尔 PowerCool CDU
- ASHRAE 标准 127 制定了标准化的测试方法,以便对 CDU 热效率和泵性能进行准确的、公平的比较。
- 冷却液流量的微小变化会立即转化为冷板上的温度波动;10% 的流量变化可能会触发节流事件,这就要求控制算法具有超强的响应能力。
- 集中式多兆瓦常压装置涉及大量的流体和较大的运行爆炸半径,因此一次污染或泄漏事件就可能导致整个设施大厅瘫痪。
- 添加剂的化学不相容性使得混合不同供应商的专用冷却液变得危险,可能导致沉淀和堵塞。
- 分布式行级和机架内 CDU 可隔离机械故障区域,减少流体输送管道,并加快安装进度。
[37:00] 机架内CDU与集中式回路以及风冷干涉的可行性
本部分评估了高性能机架式 CDU 的性能概况,并概述了为什么空气冷却在分布式企业推理集群中仍然占据主导地位。
- 专用机架内 CDU 可支持 220kW 的热负荷,温差为 4°C,可将 41°C 的设施用水转化为 45°C 的冷却液,用于 Vera Rubin 机架,每千瓦消耗 1.5 升冷却液。
- 机架式 CDU 内部的双泵冗余设计即使在单泵维护期间也能保持连续冷却运行。
- 空气冷却约占全球服务器出货量的 90%,并为相当一部分企业推理部署提供支持。
- 边缘和企业推理硬件必须直接部署在传统的、已有 10 到 15 年历史的、采用风冷技术的数据中心内,数据就是在这些数据中心内生成的。
- 通过对老旧设施进行改造,安装后门热交换器和蒸发冷却塔,可以将寄生冷却功率转化为可用于本地 AI 推理盒的计算千瓦。
[45:20] 机箱内部空气动力学和风扇效率前沿
最后一部分详细分析了闭环一体式散热器的机械权衡,并探讨了机箱空气动力学优化如何将空气冷却能力推向其物理极限。
- 服务器级内部一体化液冷散热系统引入了机械故障点和机箱封装复杂性,而与优化的均热板散热器相比,性能提升却微乎其微。
- 对于缺乏设施用水的设施,侧挂式液冷式空气热交换器为局部液冷机架提供了一条更清洁、更易于维护的路径。
- 企业服务器风扇效率已从十年前的 15% 到 20% 提高到如今的 50% 到 60% 的电能到机械能转换率。
- 围绕每千瓦 100 CFM 的设计点优化底盘空气动力学,使每一滴进气都能均匀地加热 18°C,从而最大限度地提高每千瓦的散热量。
- 空气具有良好的热扩散特性,当与精密管道和先进的散热器相结合时,可为下一代企业硬件提供坚实的基础。
要了解有关液冷和高效数据中心设计的最新资讯,请在 LinkedIn 上关注 Tim Shedd。




Amazon