存儲評論網

智能體人工智慧所需的記憶體、GPU 和儲存空間:你到底需要多少?

更新於2026年8月16日:首次發布。模型尺寸和記憶體資料已根據截至當日的官方模型發布資訊進行核實;由於模型尺寸會發生變化,此表格每季更新一次。

所有本地AI硬體指南最終都會歸結為一個問題:模型是否適用?本頁面以數據回答了這個問題,並在規格表計算的基礎上更進一步。下表中出現的模型類別均已在StorageReview實驗室運行過,硬體推薦連結指向我們實際在桌上型電腦筆記型電腦本地AI排行榜上測試過的系統。

NVIDIA Agent Toolkit 運行在 DGX Station 上,DGX Station 是一類用於本地代理 AI 工作負載的桌面硬體。

簡而言之:僅憑參數數量已無法預測硬體需求。量化可以將權重減少約 4 倍,混合專家模型的運行成本遠低於其參數總數所顯示的水平,而智能體工作負載會增加記憶體開銷,而大多數容量規劃指南完全忽略了這一點。以下是如何對這三者進行預算。

模型記憶體需求

以下檔案大小為常見的 Q4_K_M 量化版本(或註明的原生格式),資料發佈於 2026 年 8 月的 Ollama 和 Hugging Face 網站上。 「運行記憶體」列增加了工作開銷和適度的上下文視窗;標有星號的數字是計算估算值,而 GPT-OSS 和 DeepSeek 671B 的數字是供應商自己的聲明。

型號 參數 第四季/原生下載 運行記憶體* 繼續運行
羊駝 3.1 8B 8B GB 4.9 約6至8 GB 8GB顯存筆記型電腦 及以上
Phi-4 14B 14.7B GB 9.1 約11至12 GB 16GB 記憶體或 64GB共享記憶體筆記型電腦
GPT-OSS 20B (MXFP4) 21B(3.6B活躍) 12 到 14 GB 約13至16 GB 16GB 顯存, 共享記憶體筆記型電腦
米斯特拉爾小型 3.2 24B 24B GB 15 約18至20 GB 24GB RTX PRO 筆記型電腦
傑瑪3 27B 27B GB 17 約20至22 GB 24GB RTX PRO 筆記型電腦, 統一記憶體桌面
Qwen3 30B-A3B 30.5B(3.3B活躍) GB 19 約22至24 GB 24GB 顯存(緊張)​​或 統一記憶
QwQ 32B / DeepSeek-R1 32B 32B GB 20 約22至24 GB 24GB 顯存(緊張)​​或 統一記憶
Llama 3.3 70B / R1 Distill 70B 70B GB 43 約48至50 GB 96GB+統一記憶體, RTX PRO 6000 塔式機
GPT-OSS 120B (MXFP4) 117B(5.1B活躍) GB 65 約65至80 GB 96GB 至 128GB 統一內存96GB GPU
DeepSeek-R1 671B(完整版) 671B(37B活躍) GB 404 450 GB以上 桌上型電腦無法企及;機架級應用領域

*估算基於大約 8KB 的活動上下文,以及權重檔案之外約 15% 的執行時間開銷。更大的上下文會帶來更高的開銷;請參閱下文的代理開銷。

有兩個值得注意的規律。首先,混合專家模型改變了計算方式:GPT-OSS 120B 包含 1170 億個參數,但每個 token 只激活 5.1 億個參數,因此它只需要 96GB 到 128GB 的​​內存池即可運行,而 OpenAI 的目標是使用單個 80GB 的 GPU。我們曾在HP Z2 Mini G1a上運行過它,這是一款容量僅 1 公升、完全沒有獨立顯示卡的機器。其次,擁有 6710 億個參數的完整版 DeepSeek-R1 則完全是另一個世界:僅下載就需要 404GB 的內存(在第四季度),而要流暢運行它,則需要大約 450GB 的內存。我們排行榜上的任何機器都無法運行它,任何桌上型電腦都不應該嘗試。

What Runs Where

8GB 記憶體的筆記型電腦(RTX PRO 500 到 2000 系列)。第四季的 7B 到 8B 型號以及更小的 Phi 和 Gemma 型號都能流暢運行。但顯存上限確實存在:在我們的測試中,一款需要約 12GB 記憶體的 13B 型號,使用 8GB 顯示卡根本無法流暢運作。我們的「最佳本地 AI 筆記型電腦」頁面涵蓋了這一領域。

24GB 記憶體系統(RTX PRO 5000 筆記型電腦、RTX 桌上型電腦顯示卡)。對於 14B 到 27B 的模型來說,這是最佳配置,既能保證足夠的上下文信息,又能以最快的速度運行它們;我們的戴爾 Pro Max 18 Plus在 Phi 測試中以每秒 185 個令牌的速度領先。 32B 級別的模型雖然符合第四季度的要求,但幾乎沒有上下文信息,而一旦涉及到代理,上下文信息的重要性就遠超你的想像。

統一記憶體和共享記憶體系統(96GB 至 128GB)。 AMD Strix Halo 機器最多可為 GPU 分配 96GB 系統內存,而像NVIDIA DGX Spark這樣的 GB10 系統則配備 128GB 的​​一致性內存。此類系統運行 70B 型號的顯示卡(Q4 版本)和 GPT-OSS 120B 型號的顯示卡,以速度換取容量。它們在「最佳本地 AI桌上型電腦」排行榜上榜上有名,同樣的架構也應用於筆記型電腦,例如HP ZBook Ultra G1a 14,我們測試的這款筆記型電腦就搭載了 DeepSeek-R1 70B 顯示卡。

RTX PRO 6000 工作站塔式機(單卡 96GB 記憶體,最高測試容量達 384GB)。速度與容量兼備:支援 70 億位元模型,量化等級更高,並具備完整的上下文資訊;支援 120 億位元 GPT-OSS 模型,且容量充足;或支援多個模型同時運行,滿足多智能體管線的需求。我們的最佳桌面工作站排行榜涵蓋了這個類別,其中排名第一的是配備四 GPU 的HP Z8 Fury G6i

代理稅:語境是第二記憶預算

僅憑權重檔案進行大小計算適用於短時聊天會話。但智能體打破了這個假設。智能體會循環往復:它會將工具輸出、檔案以及先前的步驟讀取回上下文窗口,而上下文中保存的每個標記都會佔用鍵值快取的內存,這還不包括權重本身。這些開銷並不小。

模型類 KV快取位於32K上下文 KV快取位於128K上下文 每1,000個代幣的大致成本
8B(Llama 3.1 8B,FP16 KV) GB 4.19 GB 16.78 ~0.13 GB
70B(Llama 3.3 70B,FP16 KV) GB 10.49 GB 41.94 ~0.33 GB

將該表與上面的容量規劃表進行對比,問題顯而易見。一個 70B 的模型在 Q4 時權重佔用 43GB,但在完整的 128K 上下文中,它總共需要大約 85GB 的內存,是權重佔用的兩倍。一個 8B 的模型在 128K 上下文中佔用的記憶體(16.78GB)比其自身 Q4 權重(4.9GB)還要多。鍵值快取量化有所幫助,FP8 可以將這些數值減半,INT4 可以將其減至四分之一,但會犧牲一些質量,不過規劃規則依然成立:對於智能體工作,應像分配第二個模型一樣分配上下文內存。

服務會再次增加開銷。如果一個系統同時運行多個代理或用戶,每個請求都會佔用自己的鍵值快取。我們在本地人工智慧排行榜上使用的服務堆疊 vLLM 預設預先分配 90% 的 GPU 內存,正是因為鍵值空間決定了有多少並發請求能夠存活下來,而不會被佔用,從而導致吞吐量下降。一台能夠流暢運行一個聊天視窗的機器,對於三個代理商來說可能就顯得捉襟見肘了。

系統記憶體:被遺忘的第三條腿

對於純GPU推理,系統記憶體只需盡量減少佔用,在我們測試的機器上,32GB到64GB是一個比較合適的最低配置。在兩種情況下,系統記憶體至關重要。卸載(即超出顯存容量的層在CPU上運行)是透過記憶體映射的模型檔案進行的,因此系統記憶體至少應與模型檔案大小加上作業系統預留空間相符。而在統一記憶體機器上,系統記憶體即為GPU內存,這正是64GB和128GB配置在我們的本地AI排行榜上佔據主導地位的原因。 Ollama給出的最低配置建議是:7B級模型需要8GB內存,13B級模型需要16GB內存,33B級模型需要32GB內存;這些是最低配置要求,而非目標配置。

收納:人人忽略的環節

模型庫會迅速膨脹。我們規模評估表中列出的十個模型,在常用的量化版本下總共大約需要 240GB,而一個包含幾個變體、用於檢索的嵌入模型以及用於代理內存的向量存儲的工作庫,在任何項目數據到達之前,其大小就可能超過 500GB。此外,代理程式工作流程也會產生大量的暫存資料:與模型並存的日誌、檢查點和檢索索引。

載入時間是硬碟等級差異的體現。計算方法很簡單:一個 65GB 的 GPT-OSS 120 位元組文件,在 SATA 硬碟上讀取大約需要 109 秒;在 Gen3 NVMe 硬碟上大約需要 17 秒;而在 Gen4 硬碟上,由於作業系統頁面快取的存在,重新載入幾乎是瞬間完成的,因此讀取時間僅需不到 9 秒。在實際應用中,載入程式並非總是能達到硬碟的全部速度,因此我們計劃發布我們自行測量的、針對不同硬碟等級的模型負載資料;請注意更新日誌。我們的儲存排行榜涵蓋了硬碟本身的效能表現。

實用指南:對於專用 AI 工作站來說,2TB NVMe 是合理的最低配置;如果機器上運行著會累積狀態的代理,則需要 4TB;如果經常在大型模型之間切換,則需要 Gen4 或更高配置。

Agentic AI 硬體常見問題解答

在本地運行70B模型需要多少顯存?

在第四季度,中等上下文情況下,記憶體佔用約為 48 至 50GB,因此這類顯示卡屬於配備 96GB 統一記憶體的機器和 96GB 工作站 GPU,而非消費級顯示卡。如果上下文接近 128K,總記憶體佔用將接近 85GB。在第八季度運行,僅權重就高達 75GB。

我可以在本地運行完整的 DeepSeek-R1 嗎?

本站排名中沒有提及。完整的 671B 版本在第四季度需要 404GB 的下載量,並且需要大約 450GB 的總記憶體才能流暢運行。實際可行的本地部署方案是使用官方精簡版,而我們容量規劃表中的 32B 和 70B 精簡版已經能夠滿足桌面級的大部分效能需求。

專家混合模型會改變硬體的數學計算嗎?

確實如此。 MoE 模型每個 token 只啟動一部分參數,因此記憶體佔用量隨參數總數增加而增加,但速度更接近啟動參數的數量。 GPT-OSS 120B(5.1 億激活參數)和 Qwen3 30B-A3B(3.3 億激活參數)在與其大小相符的記憶體池中運行速度都比其預期要快。你仍然需要足夠的記憶體來儲存所有權重;只是每 GB 記憶體的運行速度更快。

人工智慧工作站需要多少儲存空間?

建議至少使用 2TB NVMe 固態硬碟,代理主機至少需要 4TB。僅一個模型庫就佔用數百 GB 的空間,代理還會累積日誌和向量存儲,而最大的單一檔案(65GB 及以上)每次加載或切換模型都會讓慢速硬碟不堪重負。

我應該專門為本地代理商購買哪些硬體?

記憶體優先權高於速度。智能體需要長時間保存上下文,有時會並發運行,因此鍵值快取預算與權重預算同樣重要。在我們的桌面本地AI排行榜上,96GB至128GB的統一記憶體系統是最經濟的選擇;而在工作站排行榜上,當速度和並發性都至關重要時,RTX PRO 6000塔式顯示卡則是最佳解決方案。

評測:GB300 數據已出爐

以上所有內容均基於我們測試過的硬件,而我們之前所說的能夠改變現狀的系統現在確實做到了。我們對 MSI XpertStation WS300 的評測已經發布,這是我們拿到的第一台 GB300 DGX 工作站:它擁有 748GB 的​​連續內存池,包括 252GB 的 HBM3e 和 496GB 的 LPDDR5X,FP4 浮點運算能力高達 20FL 浮點。在我們的測試中,它運行了一個 433GB 的 GLM-5.2 檢查點,而這個檢查點通常不應該出現在工作站上。此外,還有 216GB 的專家權重儲存在 Grace 記憶體中。

本指南之所以如此重要,是因為記憶體容量。本頁上的所有建議都圍繞著記憶體容量的上限展開,例如將模型分佈在多個 GPU 上、利用量化技術,或在權重和鍵值快取無法容納時啟用 CPU 卸載。 NVIDIA 為 GB300 桌上型系統配備了數百 GB 的可尋址相干內存,這與上表中列出的 96GB 級顯示卡相比,內存容量相差一個數量級。目前需要多 GPU 塔式伺服器才能運行的模型,或者我們認為根本無法在本地運行的模型,現在都可以在單機環境下運行。

在完成測試之前,我們不會給出具體數值。本頁上的所有數據均未基於 GB300,也未為此進行任何調整。評測發布後,我們將根據實際測試結果修訂本指南,並在下方日誌中註明變更內容。

我們如何維護本指南

模型尺寸和熱門模型清單每季都會更新,更新速度遠超任何硬體週期。我們每季都會根據官方發布版本重新驗證尺寸表,並在新系統通過本地人工智慧測試後添加實驗室數據。所有變更都會記錄在頁面頂部的日期註釋中。標記為估算值的尺寸資料使用已發佈的權重檔案加上測量的 KV 快取成本和標準運作時開銷;廠商提供的資料會明確標示。