戴尔已通过铠侠 (KIOXIA) 245.76TB NVMe SSD 的认证,使其符合软件定义的 ObjectScale 要求,从而在一台 2U 服务器中实现了 9.83PB 的原始闪存容量。这一密度里程碑的实现,建立在戴尔今年早些时候在 ObjectScale 4.2 和 4.3 版本中详细介绍的数据路径改进工作之上。这些改进旨在通过原生 S3 over RDMA、LLM 的键值 (KV) 缓存卸载、改进的块存储引擎以及通过 S3 Tables 直接支持 Apache Iceberg,实现高吞吐量 AI 训练、小对象流水线效率和推理加速。
密度里程碑:采用 245 TB KIOXIA SSD,在 2U 机架空间内实现 9.83 PB 的存储容量
随着企业级 AI 数据湖在模型训练、微调和合规性数据保留等多个层面不断扩展,机架密度、散热管理和机房空间限制已成为主要的设计变量。为了满足每个机架单元的原始容量需求,戴尔已对KIOXIA 的 245.76 TB NVMe SSD 进行了认证,使其可用于在戴尔 PowerEdge R7725服务器上运行的软件定义 ObjectScale 。
ObjectScale 通过在单个 2U 机箱内安装 40 块 245.76 TB 的闪存盘,实现了 9.83 PB 的原始全闪存容量;我们去年夏天对该平台进行了评测。这种高密度存储方案的目标用户是企业级人工智能工厂、矢量数据库、大型分析存储库以及网络安全平台,这些应用需要多 PB 级的非结构化存储,同时还要最大限度地降低功耗、散热负荷和布线复杂性。有关 245TB 闪存与硬盘相比在功耗和机架数量方面的具体差异,请参阅我们的Micron 6600 ION 报告。
吞吐量提升和小对象架构
在经过认证的戴尔PowerEdge服务器上进行软件定义部署后,戴尔内部测试表明,每个节点的读取吞吐量最高可达40 GB/s,比上一代全闪存对象平台提升了8倍。戴尔还指出,一家英国高频交易客户在生产环境中实现了约280 GB/s的聚合读取吞吐量。这些数据与我们在硬件本身上测得的结果相符:在去年11月我们对R7725xd的测试中,该平台在内部NVMe池上的读取吞吐量超过300 GB/s,在NVMe-oF RDMA上的读取吞吐量达到160 GB/s。该测试直接对服务器进行了性能表征,而非在其上运行ObjectScale,但它确定了软件所能达到的性能上限。
为了消除处理数百万个小型特征集、矢量块和遥测日志的管道中常见的元数据瓶颈,ObjectScale 采用了一种优化的块存储引擎。该架构在跨节点应用纠删码之前,会将小型有效载荷聚合到统一的 128MB 块中。对于典型的 10KB 文件,单个块可以容纳超过 10,000 个对象,从而显著降低元数据开销。
这种分块方法还重构了驱动器故障重建流程,将需要重建的分片总数从数十亿减少到数百万,从而将高密度 NVMe 驱动器的恢复时间从数周缩短到数小时。在条带级别验证的内联校验和减少了主机 CPU 用于后台完整性扫描的周期数。此外,ObjectScale 4.2 中重新设计的键值存储 (KVS) 内存效率提高了约 4 倍,元数据磁盘占用空间减少了 30% 到 60%。
S3 over RDMA 和推理加速
ObjectScale 4.3 将 S3 over RDMA 扩展到戴尔的全闪存产品组合,包括XF960、EXF900 和软件定义 PowerEdge R7725xd 部署。该平台利用 RoCEv2 网络和戴尔的 S3-over-RDMA SDK,绕过内核 TCP 开销和 CPU 中断,在主机 GPU 和后端 NVMe 介质之间建立直接内存路径。内部测试表明,与标准的 S3 over TCP 相比,该方案可将吞吐量提高高达 230%,延迟降低 80%,客户端 CPU 利用率降低高达 98%。
对于推理架构而言,ObjectScale 可作为外部层用于KV 缓存卸载。由于长上下文推理会迅速耗尽 GPU 上的 HBM 和 VRAM,因此与 vLLM、LMCache 和 NVIDIA 的 NIXL 库集成,使得推理框架能够通过 RDMA 加速的 S3 将活跃注意力状态直接溢出到 ObjectScale。戴尔报告称,与未进行缓存卸载的标准 vLLM 相比,首次令牌时间 (TTFT) 最多可提升 19 倍,令牌吞吐量最多可提升 5.3 倍,多轮吞吐量几乎提升 3 倍。此外,戴尔在其与竞争对手对象平台进行的直接对比测试中,TTFT 约为 0.86 秒。
原生 S3 表和横向扩展效率
ObjectScale 4.3 还引入了原生 S3 表功能(戴尔将其列为技术预览版),该功能将 Apache Iceberg 开放表格式直接嵌入到存储桶层中。包括 Trino、Starburst、Spark 和 Flink 在内的查询引擎可以直接对 S3 存储桶进行分析,无需专用暂存区或将 ETL 数据移动到单独的数据仓库。戴尔表示,与传统数据仓库配置相比,这种架构的数据摄取速度最高可提升 2 倍,查询速度最高可提升 4.5 倍。
底层存储效率得益于 24+2 和 24+4 纠删码配置文件,戴尔表示,这些配置文件可将写入放大率降低高达 75%。在 EX500 等高容量 HDD 平台上,戴尔报告称,大对象摄取速度提升高达 25%,中等大小对象的写入性能提升高达 2 倍。针对特定工作负载的存储桶压缩支持 Snappy、LZ4、ZSTD 和 Deflate 算法,并提供遥测功能以进行财务运维成本跟踪。配置和编排与云原生工具(包括 Kubernetes 容器对象存储接口 (COSI) 和 Terraform 提供程序)原生集成。




Amazon