三星已开始量产其首款 PCIe Gen6 企业级固态硬盘 PM1763,该产品采用第九代 V-NAND 闪存和全新开发的 4nm 控制器。这款 15.36TB 的旗舰级产品,顺序读取速度最高可达 28,400 MB/s,写入速度最高可达 21,000 MB/s,其中读取速度是其前代产品 Gen5 PM1753(14,500 MB/s)的 1.96 倍。三星表示,PM1763 已完成下一代 AI 平台的验证,其上市时间与预计明年推出的首批支持 Gen6 的服务器相吻合。
为什么 PCIe Gen6 很重要
PCIe Gen6 使用 PAM4 协议,将每条通道的信号传输速率提升至 64 GT/s,这意味着标准 x4 SSD 链路的单向带宽约为 32 GB/s,而 Gen5 的带宽约为 16 GB/s。Gen5 的固态硬盘性能早已接近这一上限,最快的型号的带宽也仅达到该接口允许的 14-14.5 GB/s。
PM1763 的 28.4 GB/s 读写速度充分利用了新增的读写空间。对于 AI 基础设施而言,其实际效果是:只需更少的硬盘即可填满 GPU 服务器的存储路径,同时检查点和模型加载操作占用加速器的时间也更少。三星以模型速度为例进行阐述,声称 40GB 的 LLM 文件从硬盘到内存的传输时间约为 1.4 秒,而 PM1753 则需要约 2.7 秒。需要注意的是,1.4 秒是 40GB 文件的顺序读取速度,而非实际传输时间,因此请将其视为接口性能的最佳示例。
随机性能与顺序性能成正比。三星的产品资料显示,16TB 级配置的随机读取 IOPS 最高可达 6.8 万,随机写入 IOPS 最高可达 950,000 万;SCADA 白皮书中测得的单盘 IOPS 为 6.92 万(详见下文),这表明读取性能数据较为保守。
与上一代产品相比,能效提升高达 1.8 倍,这在密集部署环境中与原始速度同样重要,因为第六代控制器运行温度较高,每个硬盘节省的每一瓦特在密集机箱中都会产生巨大的影响。为此,三星针对采用芯片直冷 (D2C) 技术的液冷服务器优化了 PM1763,旨在实现长时间负载下的持续峰值性能,而非瞬时峰值性能。
PM1763 技术规格
| 规格 | 三星PM1763 |
|---|---|
| 平台概述 | |
| 接口 | PCIe Gen6 x4、NVMe 2.1、OCP 2.6 |
| NAND闪存 | 三星第九代V-NAND |
| 控制器 | 三星新型4nm控制器 |
| 容量 | 发布时提供 4TB、8TB 和 16TB 级(格式化后容量为 15.36TB)三种规格。 产品页面列出了 30.72TB 和 61.44TB 两种规格。 |
| 形状因素 | E1.S E3.S U.2(仅限PCIe Gen5) |
| 性能 (16TB) | |
| 顺序阅读 | 达到28,400 MB / s |
| 顺序写入 | 达到21,000 MB / s |
| 随机阅读 | 高达 6,800,000 次 IOPS |
| 随机写入 | 高达 950,000 次 IOPS |
| 电源和冷却 | |
| 电源效率 | 与 PM1753 相比,性能提升高达 1.8 倍 |
| 散热器 | 针对液冷服务器进行了优化,直接芯片级 (D2C) |
| 安保防护 | |
| 产品特性 | 后量子密码学(PQC) TEE 设备接口安全协议 (TDISP) |
GPU驱动的I/O:42个硬盘共计281亿IOPS
三星还发布了一份白皮书,将 PM1763 与 SCADA(Scaled Accelerated Data Access,规模化加速数据访问)框架相结合。SCADA 是 NVIDIA 开发的框架,它允许 GPU 线程直接向 NVMe 驱动器提交命令,完全绕过 CPU 和内核存储堆栈。GPU 发起 I/O 的优势在于并发性:CPU 的线程池大约可以同时处理 45 万 IOPS,而三星的测试表明,一个 GPU 可以同时从大约 100,000 万个线程分发任务,每个 GPU 的 IOPS 超过 95 万。
这些数据来自一台配备一个 H100、两个 H200 和 42 块 PM1763 E1.S 15.36TB 硬盘的 H3 Falcon 6048 Gen6 服务器,该服务器采用 512 字节随机读取工作负载,并通过三个 Broadcom PEX90144 Gen6 交换机进行连接。单块 PM1763 硬盘处理了约 6.92 万 GPU 发出的 IOPS,比相同配置下 Gen5 PM1753 硬盘的 3.72 万 IOPS 提升了 86%。每个 GPU 配备 14 块硬盘时,系统在每个 GPU 组下实现了近乎线性的扩展,IOPS 约为 96 万。完整的 42 块硬盘配置实现了 281 亿 IOPS 的总和,单块硬盘的性能与单块硬盘的峰值性能相差不到 5%。我们并未进行此项测试,也未对结果进行独立审核,但这种扩展特性很有意思:决定总性能表现的并非峰值 IOPS,而是硬盘间的延迟一致性。
Gen6 为高密度存储服务器带来了什么?
问题在于,在单个机箱内,这些硬盘组成的硬盘架能发挥多大的作用。我们最近使用 24 块第五代 SSD,将戴尔 PowerEdge R7725xd 服务器的本地吞吐量推高至 300 GB/s 以上。每块硬盘都通过 CPU 专用的 x4 通道传输数据,并通过 PEAK:AIO 软件保持队列饱和,实现了 160 GB/s 的网络吞吐量。该系统仅用一个 2U 机箱就足以媲美多节点存储集群。如果换用 PM1763 额定速度的第六代 SSD,同样的 24 盘位拓扑结构理论上可提供约 681 GB/s 的原始读取带宽,但 CPU 通道预算和网络出口带宽会比硬盘本身更早成为瓶颈。
容量密度同步提升。PEAK :AIO 的 2U AI 数据服务器采用 61.44TB QLC 固态硬盘,容量已达 1.5PB,并通过 RDMA 提供 120GB/s 的传输速度。三星即将推出 61.44TB PM1763 固态硬盘,届时,同类系统将在相近的体积内实现第六代带宽和 PB 级以上的存储密度(下一代服务器可能会增加一个机架单元用于散热)。对于那些希望在不构建跨十几个节点的并行文件系统的情况下,为 GPU 集群提供充足数据的 AI 企业而言,单服务器存储方案的优势日益凸显。
安全性和可用性
三星还扩展了该硬盘的安全协议栈,以适应多租户人工智能环境。PM1763 支持后量子加密算法,能够抵御预期的量子攻击对传统加密技术的威胁;此外,它还支持 TDISP(TEE 设备接口安全协议),可在虚拟化部署中保护机密虚拟机与设备之间的数据路径。
三星电子副总裁兼内存产品规划负责人崔章硕表示:“PM1763 拥有业界领先的性能,已成功完成对下一代 AI 平台的验证,能够很好地支持不断发展的 AI 基础设施需求。随着 AI 模型规模和复杂性的不断增长,PM1763 将成为关键解决方案,帮助客户高效扩展内存容量并优化 AI 操作。”
PM1763固态硬盘目前已量产,容量分别为4TB、8TB和16TB。三星尚未公布更大容量版本的发货日期。




Amazon