2026년 8월 16일 업데이트: 최초 게시일. 모델 크기 및 메모리 수치는 해당 날짜 기준 공식 모델 출시 정보를 바탕으로 검증되었습니다. 모델 크기는 변동될 수 있으므로 본 표는 분기별로 업데이트됩니다.
로컬 AI용 하드웨어 가이드는 결국 한 가지 질문으로 귀결됩니다. 바로 "모델이 호환될까?"입니다. 이 페이지에서는 수치를 통해 이 질문에 답하고, 사양표에 나와 있는 계산보다 한 단계 더 나아갑니다. 아래 표에 모델 클래스가 나와 있는 경우, StorageReview 연구실에서 직접 테스트를 거친 제품이며, 하드웨어 권장 사항은 저희 데스크톱 및 노트북 로컬 AI 순위표에서 실제로 테스트한 시스템으로 연결됩니다.
요약하자면, 매개변수 개수만으로는 더 이상 하드웨어 요구 사항을 예측할 수 없습니다. 양자화는 가중치를 약 4배 줄이고, 혼합형 전문가 모델은 전체 매개변수 개수에 비해 훨씬 적은 리소스를 사용하며, 에이전트 기반 워크로드는 대부분의 크기 조정 가이드에서 완전히 간과되는 메모리 사용량 증가를 초래합니다. 이 세 가지 요소를 모두 고려하여 예산을 책정하는 방법을 알아보겠습니다.
모델 메모리 요구 사항
아래 파일 크기는 2026년 8월 Ollama와 Hugging Face에 게시된 일반적인 Q4_K_M 양자화 릴리스(또는 명시된 경우 기본 형식)의 크기입니다. "실행에 필요한 메모리" 열에는 작업 오버헤드와 적절한 컨텍스트 창이 포함되어 있습니다. 별표(*)가 표시된 수치는 계산된 추정치이며, GPT-OSS 및 DeepSeek 671B 수치는 해당 공급업체의 자체 발표 값입니다.
| 모델 | 파라미터 | 4분기 / 네이티브 다운로드 | 실행에 필요한 메모리* | 실행 중 |
|---|---|---|---|---|
| 라마 3.1 8B | 8B | 4.9 GB | 약 6~8GB | 8GB VRAM 노트북 그리고 위로 |
| 파이-4 14B | 14.7B | 9.1 GB | 약 11~12GB | 16GB VRAM 또는 64GB 공유 메모리 노트북 |
| GPT-OSS 20B (MXFP4) | 21B(3.6B 활성) | 12~14GB | 약 13~16GB | 16GB VRAM, 공유 메모리 노트북 |
| 미스트랄 스몰 3.2 24V | 24B | 15 GB | 약 18~20GB | 24GB RTX PRO 노트북 |
| 젬마 3 27B | 27B | 17 GB | 약 20~22GB | 24GB RTX PRO 노트북, 통합 메모리 데스크톱 |
| Qwen3 30B-A3B | 30.5B(3.3B 활성) | 19 GB | 약 22~24GB | 24GB VRAM (제한적) 또는 통합 메모리 |
| QwQ 32B / DeepSeek-R1 32B | 32B | 20 GB | 약 22~24GB | 24GB VRAM (제한적) 또는 통합 메모리 |
| 라마 3.3 70B / R1 증류 70B | 70B | 43 GB | 약 48~50GB | 96GB 이상의 통합 메모리, RTX PRO 6000 타워 |
| GPT-OSS 120B (MXFP4) | 117B(5.1B 활성) | 65 GB | 약 65~80GB | 96GB~128GB 통합 메모리96GB GPU |
| DeepSeek-R1 671B (전체) | 671B(37B 활성) | 404 GB | GB 이상 | 데스크톱으로는 접근할 수 없는, 랙 규모의 영역 |
*추정치는 활성 컨텍스트가 약 8KB이고 가중치 파일 외에 런타임 오버헤드가 약 15%라고 가정합니다. 컨텍스트 규모가 클수록 비용이 훨씬 더 많이 발생합니다. 아래의 에이전트 세금 부분을 참조하십시오.
주목할 만한 두 가지 패턴이 있습니다. 첫째, 전문가 혼합 방식은 계산 방식을 바꿉니다. GPT-OSS 120B는 117억 개의 파라미터를 가지고 있지만 토큰당 5.1억 개만 활성화하므로 96GB에서 128GB의 단일 메모리 풀에서 실행됩니다. OpenAI는 목표 사양으로 80GB GPU 하나를 제시했습니다. 저희는 외장 GPU가 없는 1리터 용량의 HP Z2 Mini G1a 에서 이를 실행해 보았습니다. 둘째, 671억 개의 파라미터를 가진 DeepSeek-R1 전체 버전은 완전히 다른 차원의 문제입니다. Q4 기준으로 다운로드 용량만 404GB에 달하며, 제대로 실행하려면 총 450GB의 메모리가 필요합니다. 저희 순위표에 있는 어떤 컴퓨터도 이 버전을 실행하지 못했으며, 어떤 데스크톱도 시도해서는 안 됩니다.
무엇이 실행되는 곳
8GB VRAM 노트북(RTX PRO 500~2000급). Q4의 7B~8B 모델과 그보다 작은 Phi 및 Gemma 변형 모델도 무리 없이 작동합니다. 하지만 성능 한계는 분명히 존재합니다. 저희 테스트에서 약 12GB의 그래픽 메모리가 필요한 13B 모델은 8GB 그래픽 카드로는 제대로 작동하지 못했습니다. 저희의 '로컬 AI에 최적화된 노트북 ' 페이지에서 더 자세한 정보를 확인하실 수 있습니다.
24GB VRAM 시스템(RTX PRO 5000 노트북, 데스크톱 RTX 카드). 컨텍스트 여유 공간이 충분하고 실행 속도가 가장 빠른 14B~27B 모델에 가장 적합한 시스템입니다. 저희 Dell Pro Max 18 Plus는 Phi에서 초당 185개의 토큰을 처리하며 이 분야에서 최고 성능을 자랑합니다. 32B급은 4분기에 적합하지만 컨텍스트를 저장할 공간이 부족한데, 상담원이 개입하게 되면 컨텍스트가 생각보다 훨씬 중요해집니다.
통합 및 공유 메모리 시스템(96GB~128GB). AMD Strix Halo 기반 시스템은 최대 96GB의 시스템 RAM을 GPU에 할당할 수 있으며, NVIDIA DGX Spark 와 같은 GB10 시스템은 128GB의 통합 메모리를 탑재하고 있습니다. 이 제품군은 70B 모델을 Q4 속도로, GPT-OSS 120B 모델을 실행하며, 속도를 희생하는 대신 용량을 늘렸습니다. 최고의 로컬 AI 데스크톱 순위에서 이 제품들을 확인할 수 있으며, 동일한 아키텍처를 사용하는 HP ZBook Ultra G1a 14 노트북 도 테스트에 사용되었습니다.
RTX PRO 6000 워크스테이션 타워(카드당 96GB, 테스트 결과 최대 384GB). 속도와 용량을 동시에 제공합니다. 높은 양자화 수준에서 전체 컨텍스트를 지원하는 70B 모델, 여유 공간이 충분한 GPT-OSS 120B, 또는 멀티 에이전트 파이프라인을 위해 여러 모델을 동시에 실행할 수 있습니다. 저희 최고의 데스크톱 워크스테이션 순위표에서 4개의 GPU를 탑재한 HP Z8 Fury G6i가 1위를 차지했습니다.
행위자세: 맥락은 제2의 기억 예산이다
짧은 채팅 세션에서는 가중치 파일만으로 크기를 조정하는 방식이 효과적입니다. 하지만 에이전트는 이러한 가정을 깨뜨립니다. 에이전트는 루프를 돌면서 도구 출력, 파일, 이전 단계 등을 컨텍스트 창으로 읽어들이는데, 컨텍스트에 저장된 모든 토큰은 가중치 외에도 키-값 캐시에서 메모리를 소모합니다. 이러한 비용은 결코 적지 않습니다.
| 모델 클래스 | 32K 컨텍스트의 KV 캐시 | 128K 컨텍스트의 KV 캐시 | 토큰 1,000개당 대략적인 비용 |
|---|---|---|---|
| 8B (라마 3.1 8B, FP16 KV) | 4.19 GB | 16.78 GB | ~ 0.13 GB |
| 70B (라마 3.3 70B, FP16 KV) | 10.49 GB | 41.94 GB | ~ 0.33 GB |
위의 크기 조정표와 해당 표를 비교해 보면 문제가 명확해집니다. 70B 모델은 Q4에서 43GB의 가중치를 사용하지만, 128K 컨텍스트를 완전히 활용하면 총 약 85GB가 필요하며, 이는 가중치의 두 배에 달합니다. 8B 모델은 128K 컨텍스트에서 자체 Q4 가중치(4.9GB)보다 컨텍스트(16.78GB)에 더 많은 메모리를 사용합니다. 키-값 캐시 양자화는 FP8을 사용하면 이 수치를 절반으로, INT4를 사용하면 품질 저하를 감수하고 4분의 1로 줄여주지만, 핵심은 여전히 유효합니다. 에이전트 기반 작업에서는 두 번째 모델처럼 컨텍스트에 충분한 메모리를 할당해야 합니다.
서비스 제공은 비용을 다시 한번 증가시킵니다. 시스템이 여러 에이전트 또는 사용자를 동시에 호스팅하는 경우, 각 요청은 자체 KV 캐시를 보유합니다. 저희가 로컬 AI 리더보드 벤치마킹에 사용하는 서비스 스택인 vLLM은 KV 공간이 처리량 저하를 초래하는 선점 없이 얼마나 많은 동시 요청이 처리될 수 있는지를 결정하기 때문에 기본적으로 GPU 메모리의 90%를 미리 할당합니다. 채팅 하나를 원활하게 실행할 수 있는 시스템이라도 세 명의 에이전트를 처리하기에는 용량이 부족할 수 있습니다.
시스템 RAM: 잊혀진 세 번째 요소
GPU 전용 추론의 경우 시스템 RAM은 방해가 되지 않도록만 하면 되며, 저희가 테스트한 시스템에서는 32GB에서 64GB 정도가 최소 사양입니다. 시스템 RAM 용량은 두 가지 경우에 결정적인 역할을 합니다. 첫째, VRAM에 들어가지 않는 레이어를 CPU로 넘기는 오프로딩은 메모리 매핑된 모델 파일을 통해 이루어지므로 시스템 RAM은 최소한 모델 파일 크기에 운영체제 여유 공간을 더한 값 이상이어야 합니다. 둘째, 통합 메모리 시스템에서는 시스템 RAM이 GPU 메모리 역할을 하므로, 64GB와 128GB 구성이 Local AI 순위표에서 상위권을 차지하는 이유입니다. Ollama 자체의 최소 권장 사양은 7B 모델의 경우 8GB, 13B 모델의 경우 16GB, 33B 모델의 경우 32GB입니다. 이는 최소 사양일 뿐 목표치는 아닙니다.
수납: 모두가 건너뛰는 부분
모델 라이브러리는 빠르게 용량이 커집니다. 저희의 용량 산정표에 있는 10개 모델의 일반적인 양자화 용량은 총 약 240GB에 달하며, 몇 가지 변형 모델과 검색용 임베디드 모델, 에이전트 메모리용 벡터 저장소를 포함하는 작업 라이브러리는 프로젝트 데이터가 입력되기 전에도 500GB를 넘어설 수 있습니다. 게다가 에이전트 워크플로는 모델과 함께 저장되는 로그, 체크포인트, 검색 인덱스와 같은 실제 임시 트래픽을 발생시킵니다.
로드 시간은 드라이브 등급의 차이를 보여주는 부분입니다. 계산은 간단합니다. 65GB GPT-OSS 120B 파일을 SATA 속도로 읽는 데는 약 109초가 걸리고, Gen3 NVMe 드라이브에서는 약 17초, Gen4에서는 9초 미만이 걸립니다. 이는 OS 페이지 캐시 덕분에 재로딩은 거의 즉각적으로 이루어지기 때문에 첫 로드 시에만 해당됩니다. 실제 사용 환경에서는 드라이브의 최대 속도를 항상 유지할 수는 없으므로, 드라이브 등급별 자체 측정 로드 시간을 공개할 예정입니다. 변경 로그를 확인해 주세요. 드라이브 자체의 성능은 스토리지 리더보드 에서 확인할 수 있습니다.
실용적인 지침: AI 전용 워크스테이션에는 2TB NVMe가 최소 권장 용량이며, 상태를 축적하는 에이전트를 실행하는 경우 4TB, 대규모 모델 간 전환을 자주 하는 경우에는 Gen4 이상이 적합합니다.
에이전트형 AI 하드웨어 FAQ
70B 모델을 로컬에서 실행하려면 VRAM이 얼마나 필요합니까?
Q4에서 중간 정도의 컨텍스트를 사용할 경우 약 48~50GB의 용량이 필요하며, 이 때문에 이 등급의 그래픽 카드는 일반 소비자용 카드보다는 96GB 통합 메모리를 탑재한 워크스테이션급 기기에 적합합니다. 컨텍스트를 128K까지 높이면 총 용량은 85GB에 육박하고, Q8에서 실행하면 가중치만 해도 75GB에 달합니다.
DeepSeek-R1 전체 버전을 로컬에서 실행할 수 있나요?
이 사이트의 어떤 순위 목록에서도 그렇지 않습니다. 풀 671B 모델은 4분기에 404GB 다운로드 용량을 제공하며, 원활하게 작동하려면 약 450GB의 메모리가 필요합니다. 실제로 사용 가능한 방법은 공식 사양의 제품을 사용하는 것이며, 저희 사양표에 있는 32B 및 70B 사양은 데스크톱급 요구 사항을 충족하는 대부분의 성능을 제공합니다.
다양한 전문가를 혼합한 모델은 하드웨어 계산 방식에 변화를 줄까요?
상당히 그렇습니다. MoE 모델은 토큰당 일부 매개변수만 활성화하므로 메모리 사용량은 전체 매개변수에 비례하지만 속도는 활성화된 매개변수에 더 가깝게 비례합니다. GPT-OSS 120B(활성화 5.1B)와 Qwen3 30B-A3B(활성화 3.3B)는 모두 해당 메모리 풀에서 크기에 비해 훨씬 빠른 속도로 실행됩니다. 모든 가중치를 저장할 메모리는 여전히 필요하지만, 기가바이트당 속도가 향상되는 것입니다.
AI 워크스테이션에는 얼마나 많은 저장 공간이 필요합니까?
최소 2TB NVMe, 에이전트 호스트에는 4TB의 스토리지를 계획하십시오. 간단한 모델 라이브러리만 해도 수백 기가바이트에 달하며, 에이전트는 로그와 벡터 저장소를 축적하고, 가장 큰 단일 파일(65GB 이상)은 모델을 로드하거나 교체할 때마다 느린 드라이브에 심각한 부담을 줍니다.
지역 에이전트를 위해 구체적으로 어떤 하드웨어를 구매해야 할까요?
속도보다는 메모리 용량을 우선시해야 합니다. 에이전트는 장시간 컨텍스트를 유지하고 때로는 동시에 실행되므로, 키-값 캐시 용량은 가중치 용량만큼 중요합니다. 데스크톱 로컬 AI 순위표 에서 가장 경제적인 선택은 96GB~128GB 통합 메모리 시스템이며, 워크스테이션 순위표 에서 RTX PRO 6000 타워는 속도와 동시 실행 모두 중요한 경우에 적합합니다.
검토 완료: GB300 수치가 나왔습니다
위의 모든 내용은 저희가 테스트한 하드웨어를 반영하며, 저희가 수학 계산 방식을 바꿀 것이라고 언급했던 시스템이 이제 실제로 변화를 가져왔습니다. 저희 가 처음으로 사용해 본 GB300 DGX 스테이션 인 MSI XpertStation WS300에 대한 리뷰가 공개되었습니다. 이 시스템은 252GB의 HBM3e와 496GB의 LPDDR5X로 구성된 748GB의 일관성 있는 메모리 풀, 20페타플롭스의 FP4 처리 능력을 갖추고 있으며, 테스트 과정에서 워크스테이션에서 실행하기에는 너무 과한 433GB 용량의 GLM-5.2 체크포인트와 Grace 메모리에 저장된 216GB의 전문가 가중치 데이터를 처리했습니다.
이 가이드에서 메모리 용량이 중요한 이유는 바로 메모리 때문입니다. 이 페이지의 모든 권장 사항은 엄격한 메모리 용량 제한을 고려하여 설계되었으며, 모델을 GPU에 분산시키거나, 양자화를 활용하거나, 가중치와 키-값 캐시 용량이 부족할 경우 CPU 오프로드를 사용하는 등의 방식을 사용합니다. NVIDIA는 GB300 데스크톱 시스템에 가속기가 접근할 수 있는 수백 기가바이트의 일관성 있는 메모리를 제공하는데, 이는 위 표에 언급된 96GB급 그래픽 카드와는 차원이 다른 용량입니다. 현재 멀티 GPU 타워가 필요하거나 로컬 환경에서 실행하기에 비실용적인 것으로 분류되는 모델 클래스도 이제 단일 GPU 환경에서 실행 가능해집니다.
실제 측정이 완료될 때까지는 수치를 제시하지 않겠습니다. 이 페이지의 어떤 수치도 GB300을 기준으로 한 것이 아니며, GB300 발표를 예상하여 조정된 내용도 없습니다. GB300 검토 결과가 발표되면, 이 가이드는 측정 결과를 반영하여 수정될 것이며, 변경 사항은 아래 기록에 남을 것입니다.
이 가이드를 어떻게 관리하나요?
모델 크기와 인기 모델 목록은 하드웨어 주기보다 빠르게 분기별로 변경됩니다. 저희는 분기별로 공식 릴리스를 기준으로 크기 표를 재검증하고, 새로운 시스템이 Local AI 테스트를 통과하면 연구소 영수증을 추가합니다. 변경 사항은 페이지 상단의 날짜별 메모에 반영됩니다. 추정치로 표시된 크기 수치는 공개된 가중치 파일에 측정된 KV 캐시 비용과 표준 런타임 오버헤드를 더한 값이며, 공급업체에서 제공한 수치는 별도로 명시되어 있습니다.




아마존