存储评论网

智能体人工智能所需的内存、GPU 和存储空间:你到底需要多少?

更新于2026年8月16日:首次发布。模型尺寸和内存数据已根据截至当日的官方模型发布信息进行核实;由于模型尺寸会发生变化,此表格每季度更新一次。

所有本地AI硬件指南最终都会归结为一个问题:模型是否适用?本页面用数据回答了这个问题,并在规格表计算的基础上更进一步。下表中出现的模型类别均已在StorageReview实验室运行过,硬件推荐链接指向我们实际在台式机笔记本电脑本地AI排行榜上测试过的系统。

NVIDIA Agent Toolkit 运行在 DGX Station 上,DGX Station 是一类用于本地代理 AI 工作负载的桌面硬件。

简而言之:仅凭参数数量已无法预测硬件需求。量化可以将权重减少约 4 倍,混合专家模型的运行成本远低于其参数总数所显示的水平,而智能体工作负载会增加内存开销,而大多数容量规划指南完全忽略了这一点。以下是如何对这三者进行预算。

模型内存要求

以下文件大小为常见的 Q4_K_M 量化版本(或注明的原生格式),数据发布于 2026 年 8 月的 Ollama 和 Hugging Face 网站上。“运行内存”列增加了工作开销和适度的上下文窗口;标有星号的数字是计算估算值,而 GPT-OSS 和 DeepSeek 671B 的数字是供应商自己的声明。

型号 参数 第四季度/原生下载 运行内存* 运行
羊驼 3.1 8B 8B 4.9 GB 约6至8 GB 8GB显存笔记本电脑 及以上
Phi-4 14B 14.7B 9.1 GB 约11至12 GB 16GB 显存或 64GB共享内存笔记本电脑
GPT-OSS 20B (MXFP4) 21B(3.6B活跃) 12至14 GB 约13至16 GB 16GB 显存, 共享内存笔记本电脑
米斯特拉尔小号 3.2 24B 24B 15 GB 约18至20 GB 24GB RTX PRO 笔记本电脑
杰玛 3 27B 27B 17 GB 约20至22 GB 24GB RTX PRO 笔记本电脑, 统一内存桌面
Qwen3 30B-A3B 30.5B(3.3B活跃) 19 GB 约22至24 GB 24GB 显存(紧张)或 统一记忆
QwQ 32B / DeepSeek-R1 32B 32B 20 GB 约22至24 GB 24GB 显存(紧张)或 统一记忆
Llama 3.3 70B / R1 Distill 70B 70B 43 GB 约48至50 GB 96GB+统一内存, RTX PRO 6000 塔式机
GPT-OSS 120B (MXFP4) 117B(5.1B活跃) 65 GB 约65至80 GB 96GB 至 128GB 统一内存96GB GPU
DeepSeek-R1 671B(完整版) 671B(37B活跃) 404 GB 450 GB以上 台式机无法企及;机架级应用领域

*估算基于大约 8KB 的活动上下文,以及权重文件之外约 15% 的运行时开销。更大的上下文会带来更高的开销;请参阅下文的代理开销。

有两个值得注意的规律。首先,混合专家模型改变了计算方式:GPT-OSS 120B 包含 1170 亿个参数,但每个 token 只激活 5.1 亿个参数,因此它只需要 96GB 到 128GB 的​​内存池即可运行,而 OpenAI 的目标是使用单个 80GB 的 GPU。我们曾在HP Z2 Mini G1a上运行过它,这是一款容量仅为 1 升、完全没有独立显卡的机器。其次,拥有 6710 亿个参数的完整版 DeepSeek-R1 则完全是另一个世界:仅下载就需要 404GB 的内存(在第四季度),而要流畅运行它,则需要大约 450GB 的内存。我们排行榜上的任何机器都无法运行它,任何台式机都不应该尝试。

什么跑哪里

8GB 显存的笔记本电脑(RTX PRO 500 到 2000 系列)。第四季度的 7B 到 8B 型号以及更小的 Phi 和 Gemma 型号都能流畅运行。但显存上限确实存在:在我们的测试中,一款需要大约 12GB 显存的 13B 型号,使用 8GB 显卡根本无法流畅运行。我们的“最佳本地 AI 笔记本电脑”页面涵盖了这一领域。

24GB 显存系统(RTX PRO 5000 笔记本电脑、RTX 台式机显卡)。对于 14B 到 27B 的模型来说,这是最佳配置,既能保证足够的上下文信息,又能以最快的速度运行它们;我们的戴尔 Pro Max 18 Plus在 Phi 测试中以每秒 185 个令牌的速度领先。32B 级别的模型虽然符合第四季度的要求,但几乎没有上下文信息,而一旦涉及到代理,上下文信息的重要性就远超你的想象。

统一内存和共享内存系统(96GB 至 128GB)。AMD Strix Halo 机器最多可为 GPU 分配 96GB 系统内存,而像NVIDIA DGX Spark这样的 GB10 系统则配备 128GB 的​​一致性内存。此类系统运行 70B 型号的显卡(Q4 版本)和 GPT-OSS 120B 型号的显卡,以速度换取容量。它们在“最佳本地 AI台式机”排行榜上榜上有名,同样的架构也应用于笔记本电脑,例如HP ZBook Ultra G1a 14,我们测试的这款笔记本电脑就搭载了 DeepSeek-R1 70B 显卡。

RTX PRO 6000 工作站塔式机(单卡 96GB 显存,最高测试容量达 384GB)。速度与容量兼备:支持 70 亿位模型,量化级别更高,并具备完整的上下文信息;支持 120 亿位 GPT-OSS 模型,且容量充足;或支持多个模型同时运行,满足多智能体流水线的需求。我们的最佳桌面工作站排行榜涵盖了这一类别,其中排名第一的是配备四 GPU 的HP Z8 Fury G6i

代理税:语境是第二记忆预算

仅凭权重文件进行大小计算适用于短时聊天会话。但智能体打破了这一假设。智能体会循环往复:它会将工具输出、文件以及之前的步骤读取回上下文窗口,而上下文中保存的每个标记都会占用键值缓存的内存,这还不包括权重本身。这些开销并不小。

模型类 KV缓存位于32K上下文 KV缓存位于128K上下文 每1,000个代币的大致成本
8B(Llama 3.1 8B,FP16 KV) 4.19 GB 16.78 GB 〜0.13 GB
70B(Llama 3.3 70B,FP16 KV) 10.49 GB 41.94 GB 〜0.33 GB

将该表与上面的容量规划表进行对比,问题显而易见。一个 70B 的模型在 Q4 时权重占用 43GB,但在完整的 128K 上下文中,它总共需要大约 85GB 的内存,是权重占用的两倍。一个 8B 的模型在 128K 上下文中占用的内存(16.78GB)比其自身 Q4 权重(4.9GB)还要多。键值缓存量化有所帮助,FP8 可以将这些数值减半,INT4 可以将其减至四分之一,但会牺牲一些质量,不过规划规则依然成立:对于智能体工作,应像分配第二个模型一样分配上下文内存。

服务会再次增加开销。如果一个系统同时运行多个代理或用户,每个请求都会占用自己的键值缓存。我们在本地人工智能排行榜上使用的服务堆栈 vLLM 默认预分配 90% 的 GPU 内存,正是因为键值空间决定了有多少并发请求能够存活下来,而不会被占用,从而导致吞吐量下降。一台能够流畅运行一个聊天窗口的机器,对于三个代理来说可能就显得捉襟见肘了。

系统内存:被遗忘的第三条腿

对于纯GPU推理,系统内存只需尽量减少占用,在我们测试的机器上,32GB到64GB是一个比较合适的最低配置。在两种情况下,系统内存至关重要。卸载(即超出显存容量的层在CPU上运行)是通过内存映射的模型文件进行的,因此系统内存至少应与模型文件大小加上操作系统预留空间相匹配。而在统一内存机器上,系统内存即为GPU内存,这正是64GB和128GB配置在我们的本地AI排行榜上占据主导地位的原因。Ollama给出的最低配置建议是:7B级模型需要8GB内存,13B级模型需要16GB内存,33B级模型需要32GB内存;这些是最低配置要求,而非目标配置。

储物:人人都忽略的环节

模型库会迅速膨胀。我们规模评估表中列出的十个模型,在常用的量化版本下总共大约需要 240GB,而一个包含几个变体、用于检索的嵌入模型以及用于代理内存的向量存储的工作库,在任何项目数据到达之前,其大小就可能超过 500GB。此外,代理工作流还会产生大量的临时数据:与模型并存的日志、检查点和检索索引。

加载时间是硬盘等级差异的体现。计算方法很简单:一个 65GB 的 GPT-OSS 120 字节文件,在 SATA 硬盘上读取大约需要 109 秒;在 Gen3 NVMe 硬盘上大约需要 17 秒;而在 Gen4 硬盘上,由于操作系统页面缓存的存在,重新加载几乎是瞬间完成的,因此读取时间仅需不到 9 秒。实际应用中,加载程序并非总能达到硬盘的全部速度,因此我们计划发布我们自行测量的、针对不同硬盘等级的模型负载数据;请关注更新日志。我们的存储排行榜涵盖了硬盘本身的性能表现。

实用指南:对于专用 AI 工作站来说,2TB NVMe 是合理的最低配置;如果机器上运行着会积累状态的代理,则需要 4TB;如果经常在大型模型之间切换,则需要 Gen4 或更高配置。

Agentic AI 硬件常见问题解答

在本地运行70B模型需要多少显存?

在第四季度,中等上下文情况下,内存占用约为 48 至 50GB,因此这类显卡属于配备 96GB 统一内存的机器和 96GB 工作站 GPU,而非消费级显卡。如果上下文接近 128K,总内存占用将接近 85GB。在第八季度运行,仅权重就高达 75GB。

我可以在本地运行完整的 DeepSeek-R1 吗?

本站排名中没有提及。完整的 671B 版本在第四季度需要 404GB 的下载量,并且需要大约 450GB 的总内存才能流畅运行。实际可行的本地部署方案是使用官方精简版,而我们容量规划表中的 32B 和 70B 精简版已经能够满足桌面级的大部分性能需求。

混合专家模型会改变硬件的数学计算吗?

确实如此。MoE 模型每个 token 只激活一部分参数,因此内存占用量随参数总数增加而增加,但速度更接近于激活参数的数量。GPT-OSS 120B(5.1 亿激活参数)和 Qwen3 30B-A3B(3.3 亿激活参数)在与其大小相匹配的内存池中运行速度都比其预期要快。你仍然需要足够的内存来存储所有权重;只是每 GB 内存的运行速度更快。

人工智能工作站需要多少存储空间?

建议至少使用 2TB NVMe 固态硬盘,代理主机至少需要 4TB。仅一个模型库就占用数百 GB 的空间,代理还会积累日志和向量存储,而最大的单个文件(65GB 及以上)每次加载或切换模型都会让慢速硬盘不堪重负。

我应该专门为本地代理商购买哪些硬件?

内存优先级高于速度。智能体需要长时间保存上下文,并且有时会并发运行,因此键值缓存预算与权重预算同样重要。在我们的桌面本地AI排行榜上,96GB至128GB的统一内存系统是最经济的选择;而在工作站排行榜上,当速度和并发性都至关重要时,RTX PRO 6000塔式显卡则是最佳解决方案。

评测:GB300 数据已出炉

以上所有内容均基于我们测试过的硬件,而我们之前所说的能够改变现状的系统现在确实做到了。我们对 MSI XpertStation WS300 的评测已经发布,这是我们拿到的第一台 GB300 DGX 工作站:它拥有 748GB 的​​连续内存池,包括 252GB 的 HBM3e 和 496GB 的 LPDDR5X,FP4 浮点运算能力高达 20 petaFLOPS。在我们的测试中,它运行了一个 433GB 的 GLM-5.2 检查点,而这个检查点通常不应该出现在工作站上。此外,还有 216GB 的专家权重存储在 Grace 内存中。

本指南之所以如此重要,是因为内存容量。本页上的所有建议都围绕着内存容量的上限展开,例如将模型分布在多个 GPU 上、利用量化技术,或者在权重和键值缓存无法容纳时启用 CPU 卸载。NVIDIA 为 GB300 桌面系统配备了数百 GB 的可寻址相干内存,这与上表中列出的 96GB 级显卡相比,内存容量相差一个数量级。目前需要多 GPU 塔式服务器才能运行的模型,或者我们认为根本无法在本地运行的模型,现在都可以在单机环境下运行。

在完成测试之前,我们不会给出具体数值。本页上的所有数据均未基于 GB300,也未为此进行任何调整。评测发布后,我们将根据实际测试结果修订本指南,并在下方日志中注明变更内容。

我们如何维护本指南

模型尺寸和热门模型列表每季度都会更新,更新速度远超任何硬件周期。我们每季度都会根据官方发布版本重新验证尺寸表,并在新系统通过本地人工智能测试后添加实验室数据。所有变更都会记录在页面顶部的日期注释中。标记为估算值的尺寸数据使用已发布的权重文件加上测量的 KV 缓存成本和标准运行时开销;厂商提供的数据会明确标明。