存储评论网

AMD AI 能效自 2024 年以来提升 4 倍,提前实现其到 2030 年机架规模能效提升 20 倍的目标

AI  ◇  企业版

AMD表示,其人工智能能效预计在2024年至2026年中期之间提升了4倍,超过了此前设定的3倍目标。该公司正致力于在2030年前将机架级人工智能训练和推理效率提升20倍,这是其在2025年6月设定的目标。

该公司以2024年为基准,采用代表性AMD机架配置的每瓦性能指标来衡量进展。AMD指出,其2026年的业绩结果结合了实测产品数据和模型估算值(在最终性能数据尚未公布的情况下)。AMD在设定20倍的目标时表示,该目标本身就比2018年至2025年期间的行业平均增长趋势高出近3倍;而4倍的阶段性成果甚至超过了这一加速增长的趋势。

这是橡树岭国家实验室正在建设中的 Lux 超级计算机的效果图,该系统采用 AMD 处理器,是首个 Genesis Mission 平台。

Lux 超级计算机正在田纳西州橡树岭国家实验室建造中。Lux 采用 AMD 技术,旨在成为首个投入运行的 Genesis Mission 平台,并将助力美国能源部巩固其在人工智能领域的领先地位,加速能源研究、材料科学、医学和先进制造等领域的进步与创新。(图片来源:橡树岭国家实验室)

机架级,而非组件级

AMD 的 20×30 计划旨在提升机架级性能,而不仅仅是组件级改进。该公司将战略重点放在计算芯片、工艺技术、内存和互连带宽、软件以及系统设计等各个环节的协同发展上。这反映了随着人工智能基础设施从单个加速器转向高密度集成机架,全栈优化的重要性日益凸显。AMD 高级副总裁兼企业院士 Sam Naffziger 在公告中表示:“下一波人工智能效率的提升将取决于计算芯片、内存、互连、软件和机架级系统设计等各个环节更紧密的协同优化。” 这与Lux 背后的全栈优化理念不谋而合。Lux 是一款采用 AMD 芯片的系统,它成为了橡树岭国家实验室首台 Genesis Mission 超级计算机。

该公司预计,到 2030 年,更高的能效将带来两种结果,具体取决于客户如何部署现有性能。在一种情况下,AMD 预测,到 2024 年,大约两个未来的机架即可提供相当于 570 个机架的计算能力,从而将使用阶段的电力消耗降低 20 倍,碳排放强度降低 28 倍。另一种情况是,预计的改进可以在相同的能耗下,使计算能力(以每秒每瓦特浮点运算次数衡量)提高 20 倍。

内存和互连技术是这项工作的核心。AMD 认为,高带宽内存、更大的缓存以及更紧密的内存与计算集成是确保计算资源充足并减少高能耗数据传输的有效机制。高速纵向互连( AMD 72 GPU MI455X Helios 机架的核心架构)预计也将变得越来越重要,因为随着人工智能工作负载的扩大,GPU、CPU、内存和其他机架级组件之间需要更高效的通信。

软件或可将速度提升至 100 倍

软件仍然是该公司效率战略的另一重要组成部分。AMD表示,其ROCm软件栈、开放标准以及客户优化工作旨在提高AI训练和推理吞吐量,同时降低每个生成令牌的能耗​​。该公司预计,软件、算法和模型层面的进步将与硬件和系统性能的提升相辅相成,到2030年,AI能效有望整体提升高达100倍。

人们越来越关注每瓦可用功率下的有效计算能力。随着电力供应、冷却能力和物理基础设施成为人工智能扩展的制约因素,提高机架级每瓦性能可以在不使功耗随计算需求线性增长的情况下,降低电力消耗并提高基础设施利用率。

参与 StorageReview

电子报| YouTube | 播客iTunes / Spotify | Instagram | Twitter | TikTok | RSS订阅

哈罗德弗里茨

自 IBM 创建 Selectric 以来,我一直在科技行业工作。 不过,我的背景是写作。 因此,我决定退出售前业务,回归本源,从事一些写作工作,但仍从事技术工作。