StorageReview凭借一项新的π计算纪录——小数点后314万亿位——重夺计算领域的桂冠。如今的π计算竞赛已从云实验发展到全面扩展基础设施。2022年,谷歌云将π的计算精度提升至小数点后100万亿位,其y-cruncher算法跨越庞大的云实例集群运行,并在此过程中处理了数十PB的I/O数据。这一成绩一度成为传统基础设施计算能力“极限”的标杆。
随后,我们把研究重心转移到了实验室。2024年初,我们利用近1PB的Solidigm QLC固态硬盘,将记录数字提升至105万亿位。这一成就树立了规模化的新标杆,并展示了单台本地机器的高效运行能力。几个月后,我们再次突破极限,这次达到了202万亿位。这验证了高密度闪存和精心调优能够超越超大规模基础设施,满足这种特定且高要求的工作负载需求。
当然,纪录总会招致挑战。Linus Media Group 和 KIOXIA 凭借 300 万亿位的运行成绩摘得桂冠,他们使用的是一个拥有 2PB 闪存的大型 Weka 共享存储集群。这项壮举展现了传统存储密集型基础设施的强大实力,尽管它需要大量的硬件设备、高昂的电费以及复杂的散热系统。我们怎能袖手旁观,任由这项纪录保持不败呢!
StorageReview 使用一台配备双 AMD EPYC 192 核 CPU 和 40 块 61.44 TB Micron 6550 Ion SSD的 2U Dell PowerEdge R7725服务器,成功将圆周率 π 的计算结果推至 314 万亿位。系统搭建和调优工作于 7 月完成,我们于 2025 年 7 月 31 日正式启动了计算。巧合的是,我们的圆周率计算恰好在 SC25 的第二天结束,创造了新的高性能计算 (HPC) 纪录。
将 y-cruncher 的规模扩展到 314 万亿位数
一旦运算规模达到数千亿位,y-cruncher 的表现就不再像传统的基准测试程序,而更像是一项长期的基础设施压力测试。应用程序本身很简单,但它在这种规模下与硬件的交互方式才是决定性因素。一切都取决于系统能否在不导致 CPU 卡顿或存储层过载的情况下,保持数千次多精度运算的流畅运行。事实上,正是存储层促成了这项纪录的诞生。我们部署了 40 块 Micron 6550 Ion Gen5 NVMe SSD,其中 34 块分配给了 y-cruncher。这 34 块 SSD 提供了约 2.1 PB 的容量,足以让 y-cruncher 完成 314T 的运算。剩余的 6 块 SSD 用于构建一个软件 RAID10 卷,我们用它来记录圆周率 314T 位的位数。
第 16 代和第 17 代戴尔 PowerEdge 服务器之间的设计变更也促成了我们最近一次 314T 硬盘读写记录的提升。在我们之前的 202T 记录中,我们使用了 24 盘位的戴尔 PowerEdge R760 服务器,该服务器在硬盘背板上采用了 PCIe 交换机,以牺牲硬盘密度为代价换取了更高的性能。而在第 17 代戴尔 PowerEdge 服务器上,例如基于英特尔的 R770 或基于 AMD 的 R7725,背板恢复了直连式设计,每个硬盘位配备 2 或 4 条 PCIe 通道。在配备 40 盘位 Gen5 E3.S 背板的 PowerEdge R7725 中,每个 SSD 都拥有 2 条 PCIe 通道。虽然这看似会造成性能损失,但当所有 40 个硬盘位同时使用时,该平台仍然能够达到高达 280GB/s 的读写速度。
我们使用内部的 y-cruncher 存储基准测试工具,记录了每个平台在每次运行所用配置下的存储性能。在所有工作负载下,我们都观察到存储性能提升了 72% 到 383%,读写性能指标也保持均衡。
| 米制 | 202T 系统(旧记录) | 314T 系统(新纪录) | 百分比差异(314T vs 202T) |
|---|---|---|---|
| 顺序写入 | 47.0 GiB/秒 | 107 GiB/秒 | +127.7% |
| 顺序阅读 | 56.7 GiB/秒 | 127 GiB/秒 | +124.0% |
| 阈值步进写入 | 62.2 GiB/秒 | 107 GiB/秒 | +72.0% |
| 阈值步幅读取 | 20.9 GiB/秒 | 101 GiB/秒 | +383.3% |
戴尔 PowerEdge R7725 不仅仅是一台存储服务器;它还搭载了双路 AMD Turin 平台,拥有强大的计算能力。我们采用了 192 核 AMD EPYC 9965 CPU,总共 384 个核心。此外,我们还用 CoolIT SP5 水冷散热器替换了原装的风冷散热器,并由 CoolIT AHx10 液冷散热器进行冷却。这套散热方案使 CPU 能够持续保持较高的时钟频率,机箱风扇的 PWM 功率控制在 30% 左右,而我们测试的系统平均功耗则控制在 1,600W 左右。
在软件方面,本次平台运行的是 Ubuntu 24.04.2 LTS Server,而非以往运行的 Windows Server。这最大限度地提高了系统稳定性,并显著提升了工作负载性能。在正式启动运行之前,我们进行了多次测试迭代,包括预留 384 个核心中的 4 个用于后台系统操作。最终结果不仅打破了现有的树莓派世界纪录,而且在多项指标上都远超以往。在性能、功耗以及最令人印象深刻的可靠性方面,我们的运行表现都遥遥领先。此外,我们也是唯一一次在没有任何停机时间的情况下完成的大规模树莓派世界纪录挑战。从开始到结束,整个运行过程从未出现过需要恢复的情况。
创纪录的能效
StorageReview 在每次 π 值计算记录挑战中都采取了降低复杂性并尽可能降低功耗的策略。之前的 300T 记录利用了分布式存储集群和高速网络,但代价是更高的功耗和散热需求。我们另辟蹊径,专注于提高存储密度,使用一台 2U 服务器同时作为交换存储和输出存储。这显著降低了我们的整体功耗和散热需求。在 314T 的运行过程中,我们的 Dell PowerEdge R7725 服务器仅消耗了 4,304.662 kWh 的电量,相当于每万亿位数字仅消耗 13.70 kWh 的电量。这使其成为最节能的大规模 π 值计算之一。比较这两种方法,差异显而易见,如下表所示。
| 运行 | 总千瓦时 | 成本按每千瓦时 0.12 美元计算 | 成本按每千瓦时 0.20 美元计算 |
|---|---|---|---|
| 300T Weka 集群运行 | 33,600 千瓦时(预估) | $4,032 | $6,720 |
| 314T 单服务器运行 | 4,304.662千瓦时 | $517 | $861 |
值得注意的是,在计算过程中,我们的 314T 运行使用了 JBOD 配置的 SSD,但没有采用数据恢复机制。功耗和整体系统性能是做出这一决定的因素,但也引发了关于如何围绕工作负载设计存储解决方案的讨论。每个工作负载都各不相同,有些工作负载可以在对生产影响最小的情况下重启,而有些工作负载可能不需要相同级别的容错能力。在我们的案例中,我们专注于使用传统的软件 RAID 来保护数据输出。
总运行时间 110 天
尽管计算的数字位数超过了以往任何一次运行,但实际运行时间却显著低于之前的记录,之前的记录大约需要 225 天才能完成(不包括停机时间,实际计算时间为 175 天)。这 110 天不间断的运行得益于稳定的操作系统、最小化的后台负载、均衡的 NUMA 拓扑结构以及专为 y-cruncher 在此规模下生成的模式而设计的临时阵列。
技术亮点
- 已计算总位数:314,000,000,000,000
- 二手硬件戴尔 PowerEdge R7725 服务器,配备 2 个 AMD EPYC 9965 处理器、1.5TB DDR5 内存和 40 块 Micron 61.44TB 6550 Ion 固态硬盘
- 软件和算法y-cruncher v0.8.6.9545,Chudnovsky
- SSD 磨损情况(基于 SMART 测试)每个硬盘写入 7.3PB,或 34 个用于交换的 SSD 总共写入 249.11PB。
- 逻辑最大检查点:850,538,385,064,992(774 TiB)
- 逻辑峰值磁盘使用率:1,605,960,520,636,440(1.43 PiB)
- 逻辑磁盘字节读取:148,356,635,606,263,504(132 PiB)
- 写入的逻辑磁盘字节数:126,658,805,195,776,600(112 PiB)
- 开始日期2025年7月31日星期四 17:16:41
- 结束日期:2025年11月18日星期二 05:57:08
- 圆周率: 8793223.144 秒,101.773 天
- 总计算时间:9274878.580秒
- 开始到结束的挂墙时间:9463226.454秒
关闭的思考
几十年来,极限圆周率运行一直是炫耀当时所谓“高性能机器”的一种方式。早期的纪录依赖于高性能台式机和外接存储设备,后来转向本地企业级设备。近年来,这场竞赛转移到了云端,像谷歌的100万亿位圆周率运行这样的任务证明,只要拥有足够的实例和I/O,就能通过蛮力突破纪录。随后,我们看到大型共享存储集群的出现,它们牺牲了易用性,换取了强大的并行处理能力,但也带来了巨额的电力和冷却成本。
我们的方法恰恰相反。在多次创纪录的运行中,我们始终将 y-cruncher 视为一项严肃的高性能计算工作负载,而非一次性的尝试。105T 和 202T 的解决方案帮助我们识别了真正的瓶颈,调整了暂存存储的大小和性能,在不增加 I/O 层负担的情况下保证了 CPU 的正常运行,并强化了系统,确保长达数月的作业能够顺利完成。314T 的运行正是这些经验的结晶。它不仅仅是更大的数字,更代表着更成熟的设计。
各项指标再次印证了这一点。我们在一台配备 40 块 Micron 6550 Ion SSD 和双 192 核 AMD EPYC CPU 的 2U Dell PowerEdge R7725 服务器上,实现了 300 万亿位数据的处理量,系统连续在线运行 110 天,且从未发生故障需要恢复。与我们的 202T 平台相比,存储吞吐量翻了一番以上,而服务器平均功耗仅为 1,600W 左右,总耗电量为 4,305 kWh。这意味着每处理 1 万亿位数据仅消耗 13.70 kWh 的电量,远低于之前 300T 集群的预估能耗:节点更少,系统更简单,能耗更低,工作效率更高。
这就是为什么这项记录的意义远不止于炫耀:如果一台商用 2U 服务器能够以如此高的可靠性和效率支持如此大规模的 y 计算,那么同样的设计模式可以直接应用于生产科学研究。长时间运行的气候模型、物理模拟、基因组学流程和人工智能训练任务的成败都取决于相同的基本要素:均衡的 I/O、可预测的散热、稳定的固件以及能够连续稳定运行数月的架构。如今,该平台已经证明,即使在容错率极低的条件下,它也能做到这一点。
是的,StorageReview 以 314 万亿位数的成绩重夺 π 的桂冠。更重要的是,我们为在真实硬件上进行大规模数值计算的“优秀”标准树立了新的标杆。如果有人想要打破纪录,我们希望他们能做到面面俱到:更高的位数、更低的功耗、更短的运行时间,以及同样零停机的可靠性。在此之前,这便是效率的标杆。




Amazon