更新于2026年8月16日:首次发布。模型尺寸和内存数据已根据截至当日的官方模型发布信息进行核实;由于模型尺寸会发生变化,此表格每季度更新一次。
所有本地AI硬件指南最终都会归结为一个问题:模型是否适用?本页面用数据回答了这个问题,并在规格表计算的基础上更进一步。下表中出现的模型类别均已在StorageReview实验室运行过,硬件推荐链接指向我们实际在台式机和笔记本电脑本地AI排行榜上测试过的系统。
简而言之:仅凭参数数量已无法预测硬件需求。量化可以将权重减少约 4 倍,混合专家模型的运行成本远低于其参数总数所显示的水平,而智能体工作负载会增加内存开销,而大多数容量规划指南完全忽略了这一点。以下是如何对这三者进行预算。
模型内存要求
以下文件大小为常见的 Q4_K_M 量化版本(或注明的原生格式),数据发布于 2026 年 8 月的 Ollama 和 Hugging Face 网站上。“运行内存”列增加了工作开销和适度的上下文窗口;标有星号的数字是计算估算值,而 GPT-OSS 和 DeepSeek 671B 的数字是供应商自己的声明。
| 型号 | 参数 | 第四季度/原生下载 | 运行内存* | 运行 |
|---|---|---|---|---|
| 羊驼 3.1 8B | 8B | 4.9 GB | 约6至8 GB | 8GB显存笔记本电脑 及以上 |
| Phi-4 14B | 14.7B | 9.1 GB | 约11至12 GB | 16GB 显存或 64GB共享内存笔记本电脑 |
| GPT-OSS 20B (MXFP4) | 21B(3.6B活跃) | 12至14 GB | 约13至16 GB | 16GB 显存, 共享内存笔记本电脑 |
| 米斯特拉尔小号 3.2 24B | 24B | 15 GB | 约18至20 GB | 24GB RTX PRO 笔记本电脑 |
| 杰玛 3 27B | 27B | 17 GB | 约20至22 GB | 24GB RTX PRO 笔记本电脑, 统一内存桌面 |
| Qwen3 30B-A3B | 30.5B(3.3B活跃) | 19 GB | 约22至24 GB | 24GB 显存(紧张)或 统一记忆 |
| QwQ 32B / DeepSeek-R1 32B | 32B | 20 GB | 约22至24 GB | 24GB 显存(紧张)或 统一记忆 |
| Llama 3.3 70B / R1 Distill 70B | 70B | 43 GB | 约48至50 GB | 96GB+统一内存, RTX PRO 6000 塔式机 |
| GPT-OSS 120B (MXFP4) | 117B(5.1B活跃) | 65 GB | 约65至80 GB | 96GB 至 128GB 统一内存96GB GPU |
| DeepSeek-R1 671B(完整版) | 671B(37B活跃) | 404 GB | 450 GB以上 | 台式机无法企及;机架级应用领域 |
*估算基于大约 8KB 的活动上下文,以及权重文件之外约 15% 的运行时开销。更大的上下文会带来更高的开销;请参阅下文的代理开销。
有两个值得注意的规律。首先,混合专家模型改变了计算方式:GPT-OSS 120B 包含 1170 亿个参数,但每个 token 只激活 5.1 亿个参数,因此它只需要 96GB 到 128GB 的内存池即可运行,而 OpenAI 的目标是使用单个 80GB 的 GPU。我们曾在HP Z2 Mini G1a上运行过它,这是一款容量仅为 1 升、完全没有独立显卡的机器。其次,拥有 6710 亿个参数的完整版 DeepSeek-R1 则完全是另一个世界:仅下载就需要 404GB 的内存(在第四季度),而要流畅运行它,则需要大约 450GB 的内存。我们排行榜上的任何机器都无法运行它,任何台式机都不应该尝试。
什么跑哪里
8GB 显存的笔记本电脑(RTX PRO 500 到 2000 系列)。第四季度的 7B 到 8B 型号以及更小的 Phi 和 Gemma 型号都能流畅运行。但显存上限确实存在:在我们的测试中,一款需要大约 12GB 显存的 13B 型号,使用 8GB 显卡根本无法流畅运行。我们的“最佳本地 AI 笔记本电脑”页面涵盖了这一领域。
24GB 显存系统(RTX PRO 5000 笔记本电脑、RTX 台式机显卡)。对于 14B 到 27B 的模型来说,这是最佳配置,既能保证足够的上下文信息,又能以最快的速度运行它们;我们的戴尔 Pro Max 18 Plus在 Phi 测试中以每秒 185 个令牌的速度领先。32B 级别的模型虽然符合第四季度的要求,但几乎没有上下文信息,而一旦涉及到代理,上下文信息的重要性就远超你的想象。
统一内存和共享内存系统(96GB 至 128GB)。AMD Strix Halo 机器最多可为 GPU 分配 96GB 系统内存,而像NVIDIA DGX Spark这样的 GB10 系统则配备 128GB 的一致性内存。此类系统运行 70B 型号的显卡(Q4 版本)和 GPT-OSS 120B 型号的显卡,以速度换取容量。它们在“最佳本地 AI台式机”排行榜上榜上有名,同样的架构也应用于笔记本电脑,例如HP ZBook Ultra G1a 14,我们测试的这款笔记本电脑就搭载了 DeepSeek-R1 70B 显卡。
RTX PRO 6000 工作站塔式机(单卡 96GB 显存,最高测试容量达 384GB)。速度与容量兼备:支持 70 亿位模型,量化级别更高,并具备完整的上下文信息;支持 120 亿位 GPT-OSS 模型,且容量充足;或支持多个模型同时运行,满足多智能体流水线的需求。我们的最佳桌面工作站排行榜涵盖了这一类别,其中排名第一的是配备四 GPU 的HP Z8 Fury G6i。
代理税:语境是第二记忆预算
仅凭权重文件进行大小计算适用于短时聊天会话。但智能体打破了这一假设。智能体会循环往复:它会将工具输出、文件以及之前的步骤读取回上下文窗口,而上下文中保存的每个标记都会占用键值缓存的内存,这还不包括权重本身。这些开销并不小。
| 模型类 | KV缓存位于32K上下文 | KV缓存位于128K上下文 | 每1,000个代币的大致成本 |
|---|---|---|---|
| 8B(Llama 3.1 8B,FP16 KV) | 4.19 GB | 16.78 GB | 〜0.13 GB |
| 70B(Llama 3.3 70B,FP16 KV) | 10.49 GB | 41.94 GB | 〜0.33 GB |
将该表与上面的容量规划表进行对比,问题显而易见。一个 70B 的模型在 Q4 时权重占用 43GB,但在完整的 128K 上下文中,它总共需要大约 85GB 的内存,是权重占用的两倍。一个 8B 的模型在 128K 上下文中占用的内存(16.78GB)比其自身 Q4 权重(4.9GB)还要多。键值缓存量化有所帮助,FP8 可以将这些数值减半,INT4 可以将其减至四分之一,但会牺牲一些质量,不过规划规则依然成立:对于智能体工作,应像分配第二个模型一样分配上下文内存。
服务会再次增加开销。如果一个系统同时运行多个代理或用户,每个请求都会占用自己的键值缓存。我们在本地人工智能排行榜上使用的服务堆栈 vLLM 默认预分配 90% 的 GPU 内存,正是因为键值空间决定了有多少并发请求能够存活下来,而不会被占用,从而导致吞吐量下降。一台能够流畅运行一个聊天窗口的机器,对于三个代理来说可能就显得捉襟见肘了。
系统内存:被遗忘的第三条腿
对于纯GPU推理,系统内存只需尽量减少占用,在我们测试的机器上,32GB到64GB是一个比较合适的最低配置。在两种情况下,系统内存至关重要。卸载(即超出显存容量的层在CPU上运行)是通过内存映射的模型文件进行的,因此系统内存至少应与模型文件大小加上操作系统预留空间相匹配。而在统一内存机器上,系统内存即为GPU内存,这正是64GB和128GB配置在我们的本地AI排行榜上占据主导地位的原因。Ollama给出的最低配置建议是:7B级模型需要8GB内存,13B级模型需要16GB内存,33B级模型需要32GB内存;这些是最低配置要求,而非目标配置。
储物:人人都忽略的环节
模型库会迅速膨胀。我们规模评估表中列出的十个模型,在常用的量化版本下总共大约需要 240GB,而一个包含几个变体、用于检索的嵌入模型以及用于代理内存的向量存储的工作库,在任何项目数据到达之前,其大小就可能超过 500GB。此外,代理工作流还会产生大量的临时数据:与模型并存的日志、检查点和检索索引。
加载时间是硬盘等级差异的体现。计算方法很简单:一个 65GB 的 GPT-OSS 120 字节文件,在 SATA 硬盘上读取大约需要 109 秒;在 Gen3 NVMe 硬盘上大约需要 17 秒;而在 Gen4 硬盘上,由于操作系统页面缓存的存在,重新加载几乎是瞬间完成的,因此读取时间仅需不到 9 秒。实际应用中,加载程序并非总能达到硬盘的全部速度,因此我们计划发布我们自行测量的、针对不同硬盘等级的模型负载数据;请关注更新日志。我们的存储排行榜涵盖了硬盘本身的性能表现。
实用指南:对于专用 AI 工作站来说,2TB NVMe 是合理的最低配置;如果机器上运行着会积累状态的代理,则需要 4TB;如果经常在大型模型之间切换,则需要 Gen4 或更高配置。
Agentic AI 硬件常见问题解答
在本地运行70B模型需要多少显存?
在第四季度,中等上下文情况下,内存占用约为 48 至 50GB,因此这类显卡属于配备 96GB 统一内存的机器和 96GB 工作站 GPU,而非消费级显卡。如果上下文接近 128K,总内存占用将接近 85GB。在第八季度运行,仅权重就高达 75GB。
我可以在本地运行完整的 DeepSeek-R1 吗?
本站排名中没有提及。完整的 671B 版本在第四季度需要 404GB 的下载量,并且需要大约 450GB 的总内存才能流畅运行。实际可行的本地部署方案是使用官方精简版,而我们容量规划表中的 32B 和 70B 精简版已经能够满足桌面级的大部分性能需求。
混合专家模型会改变硬件的数学计算吗?
确实如此。MoE 模型每个 token 只激活一部分参数,因此内存占用量随参数总数增加而增加,但速度更接近于激活参数的数量。GPT-OSS 120B(5.1 亿激活参数)和 Qwen3 30B-A3B(3.3 亿激活参数)在与其大小相匹配的内存池中运行速度都比其预期要快。你仍然需要足够的内存来存储所有权重;只是每 GB 内存的运行速度更快。
人工智能工作站需要多少存储空间?
建议至少使用 2TB NVMe 固态硬盘,代理主机至少需要 4TB。仅一个模型库就占用数百 GB 的空间,代理还会积累日志和向量存储,而最大的单个文件(65GB 及以上)每次加载或切换模型都会让慢速硬盘不堪重负。
我应该专门为本地代理商购买哪些硬件?
内存优先级高于速度。智能体需要长时间保存上下文,并且有时会并发运行,因此键值缓存预算与权重预算同样重要。在我们的桌面本地AI排行榜上,96GB至128GB的统一内存系统是最经济的选择;而在工作站排行榜上,当速度和并发性都至关重要时,RTX PRO 6000塔式显卡则是最佳解决方案。
评测:GB300 数据已出炉
以上所有内容均基于我们测试过的硬件,而我们之前所说的能够改变现状的系统现在确实做到了。我们对 MSI XpertStation WS300 的评测已经发布,这是我们拿到的第一台 GB300 DGX 工作站:它拥有 748GB 的连续内存池,包括 252GB 的 HBM3e 和 496GB 的 LPDDR5X,FP4 浮点运算能力高达 20 petaFLOPS。在我们的测试中,它运行了一个 433GB 的 GLM-5.2 检查点,而这个检查点通常不应该出现在工作站上。此外,还有 216GB 的专家权重存储在 Grace 内存中。
本指南之所以如此重要,是因为内存容量。本页上的所有建议都围绕着内存容量的上限展开,例如将模型分布在多个 GPU 上、利用量化技术,或者在权重和键值缓存无法容纳时启用 CPU 卸载。NVIDIA 为 GB300 桌面系统配备了数百 GB 的可寻址相干内存,这与上表中列出的 96GB 级显卡相比,内存容量相差一个数量级。目前需要多 GPU 塔式服务器才能运行的模型,或者我们认为根本无法在本地运行的模型,现在都可以在单机环境下运行。
在完成测试之前,我们不会给出具体数值。本页上的所有数据均未基于 GB300,也未为此进行任何调整。评测发布后,我们将根据实际测试结果修订本指南,并在下方日志中注明变更内容。
我们如何维护本指南
模型尺寸和热门模型列表每季度都会更新,更新速度远超任何硬件周期。我们每季度都会根据官方发布版本重新验证尺寸表,并在新系统通过本地人工智能测试后添加实验室数据。所有变更都会记录在页面顶部的日期注释中。标记为估算值的尺寸数据使用已发布的权重文件加上测量的 KV 缓存成本和标准运行时开销;厂商提供的数据会明确标明。




Amazon