Meta概述了其Meta训练和推理加速器(MTIA)项目的快速发展。该公司介绍了在两年左右的时间里开发的四代芯片。这些芯片解决了Meta认为对全球人工智能至关重要的一个关键基础设施问题:无需依赖漫长的芯片开发周期,即可低成本地快速适应不断演进的模型架构。MTIA是Meta更广泛的芯片战略的一部分,Meta重申了与博通公司在芯片开发方面的合作。
据 Meta 公司称,其已在生产环境中部署了数十万台 MTIA 设备,并集成了多个内部模型。验证工作包括测试 Llama 等大型语言模型。该公司此前已在 ISCA 研究论文中发布了前两代 MTIA(MTIA 100 和 MTIA 200)的技术细节。目前,该公司正在通过 MTIA 300、400、450 和 500 扩展平台功能。这些新组件将覆盖范围从排序和推荐 (R&R) 推理扩展到 R&R 训练,并日益扩展到通用 GenAI 工作负载,尤其是推理,相关部署正在进行中或计划于 2026 年和 2027 年进行。
迭代作为一种设计原则
节奏是关键所在。Meta 认为,MTIA 芯片的演进速度比传统芯片开发更快,后者从设计到量产可能需要两年时间。Meta 基于开源 RISC-V 架构构建 MTIA 芯片,并由台积电 (TSMC) 负责制造。其解决方案是采用迭代式模块化设计方法。每一代产品都基于可重用的芯片组,并根据运营商和服务领域的最新洞察进行微调。该公司还强调了芯片之外的重用性的重要性。MTIA 400、450 和 500 共享相同的机箱、机架和网络基础设施。这使得快速升级成为可能,从而缩短了从芯片准备就绪到数据中心部署的时间。
MTIA 300:硅谷内置的网络和社群
MTIA 300 是新路线图的基础。它最初针对 R&R 训练进行了优化,这是在 GenAI 兴起之前 Meta 的主要工作负载。该架构包含内置网络芯片、用于高效集体通信的专用消息引擎以及近内存计算,以减轻集体操作的负载。虽然最初专注于 R&R,但这些通信组件在后续版本中也支持 GenAI 的训练和推理效率。
在模块层面,Meta 将 MTIA 300 描述为一个多芯片组设计,包含一个计算芯片组、两个网络芯片组和多个 HBM 堆栈。计算模块以处理单元 (PE) 网格的形式排列,并配备额外的 PE 以提高良率。每个 PE 包含两个 RISC-V 向量内核、一个用于矩阵运算的点积引擎、一个用于激活和逐元素运算的专用功能单元、一个用于累加和 PE 间通信的归约引擎,以及一个用于本地数据传输的 DMA 引擎。
MTIA 400:向具有竞争力的吞吐量宣称的GenAI转型
MTIA 400 是 MTIA 300 的升级版,旨在更好地支持 GenAI,同时保持其可重用性。Meta 将 MTIA 400 描述为一次重大升级,其 FP8 FLOPS 性能比 MTIA 300 提升了 400%,HBM 带宽提升了 51%。在架构方面,MTIA 400 集成了两个计算芯片,提高了计算密度,并增加了对改进的 MX8 和 MX4 低精度格式的支持,Meta 认为这对于高效的 GenAI 推理至关重要。
系统设计仍然是重点。Meta 描述了一种机架级部署方案,其中 72 台 MTIA 400 设备通过交换式背板连接,形成一个可扩展的单一域。为了实现灵活部署,Meta 提到了空气辅助液冷 (AALC) 机架,以加快现有数据中心的部署速度。该公司还指出,该平台可以支持液冷解决方案。
MTIA 450:GenAI推理优化始于内存带宽
MTIA 450 是 MTIA 400 的改进版本,专注于推理,旨在满足日益增长的 GenAI 推理需求。Meta 发现 HBM 带宽是限制推理性能的主要因素,因此将带宽从 MTIA 400 提升至 MTIA 450 的两倍。该公司还报告称,MX4 的 FLOPS 性能提升了 75%,从而改善了混合专家计算,并采用了硬件加速来减少注意力机制和前馈操作中的常见瓶颈,尤其是在 Softmax 和 FlashAttention 的行为方面。
Meta强调其在数据类型方面的工作是其成功的关键因素。MTIA 450超越了FP8和MX8,实现了MX4吞吐量,速度是FP16/BF16的六倍。该芯片支持混合低精度计算,无需软件转换。它针对数据类型进行了定制创新,旨在以最小的面积影响,在提高浮点运算性能的同时,保持模型质量。MTIA 450计划于2027年初大规模部署。
MTIA 500:更大的带宽、更大的容量、更精细的芯片分解
MTIA 500 继续专注于推理性能,并在内存和计算方面进行了进一步改进。Meta 指出,MTIA 500 的 HBM 带宽比 MTIA 450 提升了 50%,HBM 容量提升了高达 80%,MX4 浮点运算性能提升了 43%。芯片组设计也进行了改进,采用了 2×2 的小型计算芯片组配置,周围环绕着多个 HBM 堆栈和两个网络芯片组。此外,它还包含一个用于通过 PCIe 连接到主机 CPU 和横向扩展网卡的系统级芯片 (SoC) 芯片组。Meta 还提到,为了解决推理瓶颈问题,MTIA 500 增加了硬件加速功能并更改了数据类型。
MTIA 500计划于2027年大规模部署。
轻松采用
Meta 致力于让 MTIA 易于上手,强调使用行业标准工具而非专用框架。该公司称 MTIA 是 PyTorch 原生框架,可与 PyTorch 2.x 编译流程无缝协作,并支持 eager 模式和图模式两种执行方式。在图模式下,开发者可以使用 `torch.compile` 和 `torch.export` 来优化图,而无需重写 MTIA 特有的模型,从而实现跨 GPU 和 MTIA 的并行部署。
Meta详细介绍了基于Torch FX IR和TorchInductor构建的MTIA编译器栈。底层使用了Triton、MLIR和LLVM,以及MTIA特有的优化,包括内核融合的改进和对性能关键部分的扩展。自动调优是其关键特性,可用于选择不同的编译策略。
为了实现分布式执行,Meta 推出了 Hoot 集体通信库 (HCCL)。该库类似于 GPU 集体通信协议栈,但针对 MTIA 的内置网络芯片和消息引擎进行了优化。它利用近内存计算来加速归约操作。Meta 还支持计算集体融合以降低延迟,并拥有一个旨在管理数据路径和减少主机开销的传输协议栈。
在运行时,Meta 展示了一个设备运行时环境,该环境能够管理内存、调度以及在即时模式和图形模式下的协调。它还引入了一个基于 Rust 的用户空间驱动程序,从而摆脱了传统的 Linux 内核驱动程序。固件采用裸机 Rust 编写,强调低延迟和安全性。
Meta 介绍了其 GenAI 服务中如何利用插件系统集成 vLLM。该系统将 FlashAttention 和融合 LayerNorm 等关键算子替换为 MTIA 特有的内核。此外,它还通过自定义的 torch.compile 后端启用图模式。Meta 还提到了一些用于管理大型 MTIA 部署的工具,包括跨主机和设备的监控、性能分析、调试和可观测性。
下一步是什么
Meta 更新后的 MTIA 路线图强调了 GenAI 推理的经济性,并将 HBM 带宽和低精度格式列为关键因素。如果 Meta 能够按计划完成部署,MTIA 450 和 500 将成为首批大规模测试,以确定基于快速芯片迭代和标准化软件的推理优先加速器策略,在提供 GenAI 服务方面,能否保持相对于主流 GPU 平台的优势。




Amazon