MinIO 推出了 ExaPOD,这是一种用于开发和管理百亿亿次级 AI 基础设施的模块化参考架构。该架构由 MinIO 与 Intel、Solidigm 和 Supermicro 合作开发。ExaPOD 运行于 MinIO AIStor 之上,后者是 MinIO 面向 AI 企业开发的百亿亿次级数据存储系统。它将现有的 DataPOD 概念从 100PB 的存储单元扩展到 1EB 的存储块。
ExaPOD 为企业和新型云服务提供商提供了一个可复用的蓝图。它有助于在他们可控的基础设施上,以极高的规模实现可持续、可预测且经济高效的 AI 性能。
解决人工智能的真正瓶颈
随着人工智能代理、长上下文模型和多模态流水线的日益普及,数据量正从PB级增长到EB级。在许多情况下,主要的限制因素并非GPU的可用性,而是数据传输。GPU经常处于闲置状态,并非因为计算能力不足,而是因为存储和数据路径无法足够快速地提供数据。
ExaPOD 的设计初衷正是为了消除这一瓶颈。它能够降低并稳定百亿亿次级计算的延迟,确保数据路径保持畅通且稳定。MinIO 旨在利用 ExaPOD 构建一个存储和数据层,支持对训练、推理和检索数据集进行高吞吐量、低延迟的访问。这确保了 AI 工作负载能够持续接收数据,而无需等待 I/O 操作。
除了性能之外,ExaPOD 还满足了大规模人工智能的实际需求:
- 可预测的总拥有成本: 该参考设计采用广泛理解的行业标准组件和软件定义存储,从而可以随着容量的增加进行可预测的成本建模。
- 自主部署,本地部署: ExaPOD旨在运行于企业或新云提供商控制的硬件上。这最大限度地降低了意外成本,避免了云锁定,并简化了对数据驻留和主权规则的合规性。
换句话说,ExaPOD 不仅仅是速度的问题;它使 AI 数据基础设施在 EB 级规模下更易于管理、可预测和可持续。
人工智能的核心在于数据架构,而不仅仅是模型。
MinIO联合创始人兼联合首席执行官AB Periasamy认为,现代人工智能的发展对数据基础设施提出了挑战,而不仅仅是模型或硬件问题。他相信,能够在人工智能领域取得成功的组织,将是那些重新思考如何大规模存储、传输和访问数据,同时保持超大规模数据中心级别的成本效益的组织。
鉴于此,ExaPOD 为企业提供了一种清晰、模块化的方式来构建 AI 就绪的基础设施,同时又不牺牲控制力、灵活性或成本透明度。ExaPOD 摒弃了不透明的、一刀切的解决方案,提供了一系列相同且可重复的模块,这些模块可以从机架扩展到完整的数据中心,从而保持性能和可靠性。
合作伙伴硬件
Supermicro SYS-212H-TN 2U,24 个 NVMe 硬盘位: SYS-212H-TN 为机架级部署提供了一个高密度且均衡的构建模块。它配备 24 个 U.2 NVMe 硬盘位,可在不影响气流、电源效率或可维护性的前提下,最大限度地提高每个机架的存储密度,并支持液冷和高效供电。
英特尔至强 6781P(80 个核心,136 条 PCIe Gen5 通道): 选择 Xeon 6781P 是因为它能够同时支持高密度 NVMe 和 400/800 GbE 网络。凭借 136 条 PCIe Gen5 通道,它支持 24 个 NVMe 硬盘和双 400 GbE 网卡之间的完全并行传输,而不会出现超额分配。
Solidigm D5-P5336 SSD(122.88 TB QLC NVMe): 容量为 122.88 TB 每个硬盘的存储容量, Solidigm D5-P5336 提供极高的存储密度,使 ExaPOD 能够实现多艾字节的存储容量 在业内最小、最高效的数据中心占地面积中提供可用容量。
ExaPOD 的一个关键方面是其对密度和能效的关注——这是多拍字节和艾字节规模的关键因素。
ExaPOD提供:
- 每个机架单元提供 36 PiB 的可用容量,采用紧凑的一体化设计,显著减少了 AI 数据基础设施所需的占地面积。这种高密度对于受电力和物理空间限制的设施至关重要。
- 平均而言,每 PiB 可用容量的功耗为 900 瓦(含散热)。通过降低数据层的功耗,ExaPOD 可以释放数据中心更多的电力容量,供 GPU 和加速器使用。
请在 SC25 上观看
MinIO 将于 11 月 16 日至 21 日在圣路易斯举行的 SuperComputing '25 大会上展示 ExaPOD。




Amazon