2026년 8월 19일 업데이트: 최초 발행. 연구 결과는 이 날짜를 기준으로 최신입니다.
언어 모델을 브라우저 탭이 아닌 자체 하드웨어에서 실행해야 하는 이유는 네 가지이며, 그중 이념적인 이유는 단 하나뿐입니다. 첫째, 개인정보 보호입니다. 로컬 모델에 전달하는 문서는 절대 외부로 유출되지 않으며, 클라이언트 코드, 계약서, 환자 데이터, 미출시 제품 등 모든 대화 내용이 해당 기기 내에 저장됩니다. 둘째, 비용 구조입니다. 클라우드 AI는 사용량에 따라 비용이 청구되며, 에이전트 기반 워크로드는 토큰 사용량이 빠르게 증가하므로 고성능 워크스테이션을 구축하면 투자 비용을 회수할 수 있습니다. 반면 자체 하드웨어는 전기 요금만으로 운영할 수 있습니다. 셋째, 가용성입니다. 사용량 제한이나 서비스 중단이 없으며, 갑자기 업무 흐름이 변경되는 알림 메일도 없습니다. 마지막으로, 제어 권한이 있습니다. 검증된 모델은 사용자가 변경을 결정할 때까지 계속 실행할 수 있습니다.
하지만 클라우드 기반 모델은 여전히 더 뛰어난 성능을 제공하며, 장기적인 에이전트 기반 작업에서는 그 격차가 분명히 존재합니다. 로컬 모델이 클라우드 모델과 동등한 수준에 도달한 분야는 채팅, 요약, 단일 파일 코드 작성, 문서 질의응답과 같은 제한된 작업입니다. 이는 대부분의 사람들이 하루 종일 하는 작업의 대부분을 차지합니다. 만약 가격에 상관없이 최고의 성능을 원한다면 클라우드를 사용하는 것이 좋습니다. 하지만 개인정보 보호, 비용 절감, 또는 제어가 중요하다면 로컬 환경도 현재로서는 충분히 가능하며, 이 페이지는 그 방향을 제시합니다.
이러한 기준에 따라 하드웨어 예산을 책정해야 합니다. 로컬 AI 개발에 있어 가장 중요한 것은 메모리 용량이기 때문입니다. 16GB의 VRAM 또는 32GB의 통합 메모리는 7~8B급 성능을 지원하며, 이는 제한적인 작업량을 처리합니다. 24~32GB의 VRAM 또는 48GB의 통합 메모리는 30B급 성능을 제공하며, 이 정도 용량이면 에이전트 코딩이 단순한 데모 수준을 넘어섭니다. 96~128GB의 통합 메모리는 100B급 이상의 성능을 요구하는 최첨단 AI 개발 환경을 지원합니다. 메모리 용량이 너무 크면 체감하기 어려울 수 있지만, 반대로 너무 작으면 원하는 성능의 AI 프로그램이 아예 실행되지 않을 수 있습니다. 저희의 ' 로컬 AI에 적합한 최고의 노트북' 및 '로컬 AI에 적합한 최고의 데스크톱' 게시판에서 각 사양별로 시스템을 평가하고 있습니다. 이 페이지에서는 이러한 시스템에서 어떤 작업을 실행할 수 있는지에 대해 설명합니다.
소프트웨어 측면은 하드웨어만큼 순조롭게 발전하지 못했습니다. 오늘날 검색 결과에서 추천되는 도구 중 약 3분의 1은 더 이상 작동하지 않으며, 이를 추천하는 대부분의 페이지는 이를 인지하지 못하고 있습니다.
이 페이지는 2026년 8월 기준으로 어떤 도구가 어떤 하드웨어에서 작동하는지 추적합니다. 현재는 GitHub 스타 수를 기준으로 순위를 매기는데, 이는 중립적이고 검증 가능한 지표이기 때문입니다. 또한, 도구가 클로즈드 소스이고 스타 수가 없는 경우에는 별도로 명시합니다. 표에 있는 모든 도구 이름은 공식 다운로드 링크로 연결됩니다. 각 플랫폼을 테스트하면서 '가이드' 열에는 실제 설정 과정과 자체 측정 결과가 추가됩니다.
이 페이지에는 세 가지 규칙이 있습니다. 첫째, 로컬 모델 과 로컬 에이전트를 구분합니다 . 일부 제품은 사용자의 컴퓨터에서 실행되지만 모든 추론 호출은 공급업체 클라우드로 전송됩니다. 이는 오프라인 기능이 아닌 개인정보 보호를 위한 조치이며, 이러한 도구는 목록에서 제외하지 않고 별도로 하단에 나열합니다. 둘째, 모든 항목에는 현실적인 최소 하드웨어 사양이 명시되어 있습니다. "노트북에서 실행됩니다"라는 말은 메모리 용량 정보가 없으면 의미가 없기 때문입니다. 셋째, FAQ에서 지원이 중단된 항목과 그 날짜를 기록합니다.
추천 상품
최고 종합 지역 LLM 프로그램: 올라마
기본 응답이며, 다른 대부분의 도구들이 사용하는 방식입니다. MIT 라이선스가 적용되었고, GitHub에서 약 179,000개의 스타를 받았으며, 현재는 CLI와 함께 데스크톱 GUI도 제공합니다. 한 번의 명령으로 모델을 가져올 수 있고, localhost에 OpenAI 호환 엔드포인트를 제공하며, 2026년 1월에는 Anthropic Messages API 호환성이 추가되어 현재 Claude Code에서 로컬 모델을 참조할 수 있게 되었습니다. 최소 요구 사양: 30억 모델의 경우 시스템 RAM 8GB, 7~80억 모델의 경우 16GB, 300억 모델의 경우 VRAM 24GB.
하드웨어 벤치마킹에 가장 적합한 제품: LM Studio
클로즈드 소스라서 별점은 없지만, 그 자체로 충분히 가치가 있습니다. LM Studio는 llama.cpp와 MLX를 모두 포함하고 있으며, 머신을 사용하는 것이 아니라 성능을 측정할 때 중요한 제어 기능(GPU 오프로드 레이어, 양자화 방식, 컨텍스트 길이, 멀티 GPU 동작)을 제공합니다. 2025년 7월부터 상업적 용도로 무료로 사용할 수 있습니다. 이 도구는 워크스테이션 및 노트북 보드에서 측정된 대부분의 초당 토큰 수(TPS) 수치에 사용되었습니다. 최소 사양: 16GB RAM, 제대로 작동하려면 24GB VRAM 또는 32GB 통합 메모리가 필요합니다.
최적의 기본 엔진: llama.cpp
이 페이지의 거의 모든 내용은 llama.cpp의 하위 코드입니다. MIT 라이선스가 적용되었으며, 약 124,700개의 별을 받았고, 매일 여러 개의 태그된 빌드가 게시됩니다. 하드웨어 사용자에게 중요한 이유는 다음과 같습니다. 백엔드 목록이 방대하여 CUDA, ROCm, Metal, Vulkan, SYCL, CANN, OpenCL 등을 지원하며, 벤더 엔지니어들이 직접 최적화를 제공하고 있습니다. 빌드 8688에 포함된 Intel Arc 사전 채우기 개선 사항은 성능을 약 5배 향상시켰으며, 모든 Ollama 및 LM Studio 사용자는 별도의 설치 없이 이 개선 사항을 적용받았습니다. 최소 사양: CPU 단독 실행, 원활한 사용을 위해서는 8GB RAM이 필요합니다.
최고의 로컬 우선 데스크톱 앱: Jan
Apache 2.0은 약 44,100개의 별점을 받았으며, 2026년 7월 기준 v0.8.4 버전입니다. Jan은 llama.cpp를 번들로 제공하므로 추가로 설치할 필요가 없으며, 네트워크 케이블이 없는 상태에서도 작동합니다. 언뜻 보기에는 간단해 보이지만, Ollama 필드를 사용하는 클라우드 클라이언트 앱이 이 범주에 얼마나 많은지 확인해 보면 생각이 달라질 것입니다. 터미널을 전혀 사용하지 않는 동료에게 추천하기 좋은 앱입니다. 문서 RAG 기능이 약점입니다. 최소 요구 사양: 8GB RAM.
최고의 로컬 문서 RAG: AnythingLLM
MIT에서 개발한 이 도구는 약 64,800개의 별점을 받았습니다. 벡터 데이터베이스를 포함하고 있으며 별도의 설정 없이 청킹 및 임베딩을 처리하므로 데스크톱 환경에서 가장 간편하게 사용할 수 있는 문서 채팅 도구입니다. 하지만 두 가지 중요한 사항을 알려드리겠습니다. 2026년 3월에 발견된 CVSS 9.6 등급의 취약점은 모델의 스트리밍 응답을 통해 원격 코드 실행을 허용했는데, 이 문제는 1.11.2 버전에서 수정되었으므로 사용 전에 업데이트하시기 바랍니다. 또한, 로컬 우선 앱으로 홍보되지만 기본적으로 원격 측정 기능이 활성화되어 있으며, 이는 설정에서 끌 수 있습니다. 문서 작업을 위해서는 최소 16GB RAM이 필요합니다.
최고의 자체 호스팅 다중 사용자 환경: Open WebUI
약 149,000개의 별점을 받았으며, 가장 심도 있는 검색 설정 기능을 제공하는 이 프로젝트는 2026년 7월에 v0.11.0 버전이 출시될 예정입니다. 데스크톱 앱이 아닌 자체 호스팅 서버이므로 Docker를 진입점으로 사용해야 합니다. 개발 전에 알아두어야 할 사항이 있습니다. 2025년 4월에 라이선스가 BSD-3에서 OSI 승인을 받지 않은 맞춤형 라이선스로 변경되었으며, Open WebUI 브랜딩을 제거하는 것을 금지하는 조항이 추가되었습니다. 단, 30일 동안 사용자 수가 50명 미만인 경우는 예외입니다. 소규모로 수정 없이 실행하는 경우에는 아무런 문제가 없습니다. 최소 요구 사항은 별도의 런타임 환경과 컨테이너 용량 4GB입니다.
최고의 지역 코딩 에이전트: 클라인
Apache 2.0은 약 63,900개의 별을 받았습니다. Cline은 Ollama 및 LM Studio를 위해 특별히 설계된 간편한 시스템 프롬프트와 모델 제품군별 네이티브 도구 호출 기능을 포함하여, 경쟁사보다 훨씬 더 실질적인 로컬 엔지니어링 작업을 수행했습니다. 자체 문서에서도 클라우드가 여전히 우위를 점하는 부분을 매우 솔직하게 밝히고 있습니다. 최소 요구 사양은 24GB VRAM 또는 36GB 통합 메모리이며, 컨텍스트 메모리를 32K 이상으로 설정해야 합니다.
최고의 오프라인 터미널 코딩 도구: Aider
Apache 2.0 기반의 Aider는 약 48,300개의 별점을 받았으며, 아키텍처적으로 가장 안정적인 로컬 환경 옵션입니다. 그 이유는 충분히 이해할 만합니다. Aider는 JSON 형식의 도구 호출을 전혀 사용하지 않습니다. 일반 텍스트에서 diff 및 전체 파일 편집 형식을 파싱하여 로컬 모델에서 대부분의 에이전트가 제대로 작동하지 못하게 하는 근본적인 원인을 해결합니다. 단점은 유지보수입니다. 한 명의 개발자가 전체 커밋의 96%를 담당했으며, 릴리스 주기는 2026년에 한 번의 안정적인 릴리스로 축소되었습니다. 최소 요구 사양은 24GB VRAM 또는 36GB 통합 메모리입니다.
최고의 자체 호스팅 에이전트 플랫폼: OpenHands
MIT에서 개발된 OpenHands는 약 84,500개의 별점을 받았습니다. OpenHands는 로컬 모델에 대한 문서화가 잘 되어 있으며, 더 유용한 점은 문제가 사용자의 설정 때문이 아닌 경우를 알려준다는 것입니다. OpenHands 자체 문서에 따르면 에이전트가 챗봇처럼 동작하거나 도구 사용에 계속 실패하는 경우 모델 자체에 문제가 있는 것입니다. 최소 22KB의 컨텍스트 메모리가 필요하며 32KB를 권장합니다. 양자화 모델의 경우 최소 24GB의 VRAM 또는 64GB의 통합 메모리가 필요합니다.
최고의 무료 오프라인 깜짝 선물: GitHub Copilot CLI
2026년 4월부터 Copilot CLI는 Ollama, vLLM 및 Foundry Local에서 실행됩니다. GitHub 인증은 선택 사항이며 Copilot 구독은 필요하지 않습니다. COPILOT_OFFLINE으로 설정하면 모든 원격 측정 및 네트워크 연결이 중지되고 하위 에이전트는 로컬 공급자를 상속합니다. 대부분의 비교 문서에서는 여전히 클라우드 전용으로 표기하고 있지만, IDE 확장 프로그램은 자체 키 사용(BYOC) 환경에서도 인라인 자동 완성 기능을 클라우드로 전송한다는 점에 유의해야 합니다. 최소 사양은 컨텍스트 창 크기가 128KB인 모델, 즉 32GB VRAM 또는 64GB 통합 RAM입니다.
최고의 벤더 지원 서버: Lemonade
Apache 2.0은 약 5,400개의 별점을 받았으며, 하드웨어 충성도보다는 성능 면에서 추천할 만한 유일한 벤더 관련 도구입니다. AMD 엔지니어들이 유지 관리하며, NVIDIA CUDA, Apple Metal, Vulkan, 일반 CPU는 물론 Radeon 및 Ryzen AI NPU에서도 실행됩니다. 약 2주마다 새로운 버전이 출시되며, 2026년 4월에 데스크톱 앱이 Electron에서 Tauri로 이전되었습니다. 최소 사양: 16GB RAM, NPU 경로의 경우 Ryzen AI 300 시리즈 이상.
파일 시스템 전체에서 사용할 수 있는 최고의 로컬 RAG: Nexa AI Hyperlink
클로즈드 소스이며 무료입니다. 기기의 전체 파일 시스템을 인덱싱하고 인라인 인용으로 답변을 제공합니다. 이 목록에 포함된 이유는 소비자 하드웨어에서 가속 성능이 공개된 유일한 새로운 로컬 RAG 도구이기 때문입니다. RTX 5090에서 인덱싱은 약 3배, 추론은 약 2배 빨라지며, 1GB 폴더를 처리하는 데 약 15분이 걸리던 것이 4~5분으로 단축됩니다. 최소 사양: 최신 RTX GPU, 16GB RAM.
실행 시간: 실제로 모델을 실행하는 것은 무엇입니까?
이것이 엔진입니다. 다음 두 표에 있는 모든 것은 이 엔진과 통신하는 프런트엔드입니다. GitHub 스타 수 순으로 정렬되어 있습니다.
| 런타임 | 별 | 특허 | 최소 하드웨어 | 가속 | 안내서 |
|---|---|---|---|---|---|
| 올라마 | ~ 179,000 | MIT | 8GB RAM(3B), 16GB(7-8B), 24GB VRAM(30B급) | CUDA, ROCm, 메탈, 벌칸 | Coming soon |
| 라마.cpp | ~ 124,700 | MIT | 8GB RAM, CPU 단독 작동 | CUDA, ROCm, Metal, Vulkan, SYCL, CANN, OpenCL | Coming soon |
| MLX / mlx-lm | ~ 27,500 | MIT | 애플 실리콘, 16GB 통합 | 메탈; CUDA 백엔드 추가 (2026년) | Coming soon |
| LM스튜디오 | 폐쇄형 소스 | 저작권은 보호되며, 상업적 용도로는 무료입니다. | 16GB RAM, 24GB VRAM 또는 32GB 통합 메모리 | llama.cpp와 MLX를 묶습니다. | Coming soon |
| vLLM | 생산 서비스 | 아파치 2.0 | 24GB VRAM, 사실적인 바닥 | CUDA, ROCm | Coming soon |
데스크톱 앱 및 로컬 RAG
독자가 설치한 앱 목록입니다. 특히 '로컬 우선' 열을 주의 깊게 살펴보세요. 이 열은 사용자의 컴퓨터에서 모델을 실행하는 소프트웨어와 Ollama URL 필드를 추가한 소프트웨어를 구분합니다.
| 앱 | 별 | 특허 | 지역 우선 | 최소 하드웨어 | 안내서 |
|---|---|---|---|---|---|
| WebUI 열기 | ~ 149,000 | 맞춤형 제품이며 OSI 승인을 받지 않았습니다. | 서버용이지 데스크톱용이 아닙니다. | 별도의 런타임 환경과 컨테이너용 4GB가 필요합니다. | Coming soon |
| 무엇이든LLM | ~ 64,800 | MIT | 가능함; 원격 측정 기능이 기본적으로 켜져 있음 | RAM 16GB | Coming soon |
| 월 | ~ 44,100 | 아파치 2.0 | 네, llama.cpp를 묶습니다. | RAM 8GB | Coming soon |
| LM스튜디오 | 폐쇄형 소스 | 소유권 | 가능 | 16GB RAM, 24GB VRAM이면 흥미로울 것 같네요. | Coming soon |
| 엠스티 | 폐쇄형 소스 | 독점, 무료 등급 | 예, Ollama, MLX, llama.cpp가 번들로 제공됩니다. | RAM 8GB | Coming soon |
| 넥사 AI 하이퍼링크 | 폐쇄형 소스 | 독점, 무료 | 예, 기기 내 인덱싱이 가능합니다. | 최신 RTX GPU, 16GB RAM | Coming soon |
코딩 및 에이전트 도구
이 페이지에서 가장 높은 하드웨어 사양을 요구하는 항목들입니다. 에이전트 기반 작업은 넓은 컨텍스트 창과 긴 세션 시간을 필요로 하기 때문입니다. 32GB의 VRAM 또는 64GB의 통합 메모리를 초과하면 데모 수준을 넘어 실제 작업에 필요한 성능을 발휘하게 됩니다.
| 수단 | 별 | 특허 | 로컬 경로 | 최소 하드웨어 | 안내서 |
|---|---|---|---|---|---|
| 오픈핸즈 | ~ 84,500 | MIT | LM 스튜디오, 올라마, vLLM, SGLang | 24GB VRAM 또는 64GB 통합 메모리; 32K 컨텍스트 메모리 | Coming soon |
| 클라인 | ~ 63,900 | 아파치 2.0 | Ollama, LM Studio, OpenAI 호환 | 24GB VRAM 또는 36GB 통합 | Coming soon |
| 거위 | ~ 52,900 | 아파치 2.0 | 올라마 1급; 현재 리눅스 재단 | 24GB VRAM 또는 36GB 통합 | Coming soon |
| 도움 | ~ 48,300 | 아파치 2.0 | Ollama, OpenAI 호환; 도구 호출 없음 | 24GB VRAM 또는 36GB 통합 | Coming soon |
| 제드 자형의 것 | 버전 1.0, 2026년 4월 | 아파치 2.0 | LM 스튜디오, 올라마, llama.cpp | 24GB VRAM 또는 36GB 통합 | Coming soon |
| GitHub 코파일럿 CLI | 폐쇄형 소스 | 독점 콘텐츠이므로 구독이 필요하지 않습니다. | 올라마, vLLM, 파운드리 로컬 | 32GB VRAM 또는 64GB 통합 메모리; 128K 컨텍스트 메모리 | Coming soon |
벤더 주도 활동
모든 실리콘 및 OS 제조사는 로컬 AI 관련 제품을 출시하고 있으며, 명칭이 혼란스럽고 사장되는 경우가 많기 때문에 이 분야는 별도의 항목으로 분류하는 것이 타당합니다. 2026년까지의 추세는 일관적입니다. 제조사들은 서드파티 스택과의 경쟁을 멈추고 오히려 서드파티 스택에 필요한 소프트웨어를 제공하기 시작했습니다. NVIDIA는 자체 로컬 AI 제품 두 가지를 모두 단종하고 Ollama, llama.cpp, ComfyUI용 최적화 소프트웨어를 배포하고 있습니다. AMD는 LM Studio와 공동 브랜딩을 하고 있으며, Qualcomm은 다른 회사의 앱을 포팅하여 NPU 기능을 구현했습니다.
벤더 툴이 Ollama와 LM Studio와 차별화되는 한 가지 중요한 점은 바로 NPU에 접근 할 수 있다는 것입니다. llama.cpp는 NPU 백엔드를 지원하지 않기 때문에 스냅드래곤이나 라이젠 기반의 AI 머신에서는 이러한 툴들이 뉴럴 엔진 활용률을 0%로 만들어 버립니다. 40~60 TOPS의 성능을 기대하고 구매했더라도, 벤더 툴을 통해서만 그 성능을 활용할 수 있는 것입니다. 하지만 기대치를 현실적으로 설정해야 합니다. 현재 NPU는 최대 7B 모델 정도까지만 지원하며, 핵심은 처리량보다는 상시 가동되는 소규모 모델 작업에서 배터리 수명을 확보하는 것입니다. 속도 면에서는 외장 GPU가 NPU를 항상 능가합니다.
| 공급 업체 | 그것이 무엇인가? | 타입 | 필요한 하드웨어 | Status | 안내서 |
|---|---|---|---|---|---|
| AMD 레모네이드 | 서버, GUI 및 SDK; 별점 약 5,400개, Apache 2.0 | 앱 + 서버 | 16GB RAM, NPU는 Ryzen AI 300+입니다. NVIDIA, Apple, CPU에서도 작동합니다. | 활동 중이며, 약 2주에 한 번씩 배송합니다. | Coming soon |
| 인텔 오픈비노 제네아이 | 런타임 및 SDK; 별점 약 10,700개 | SDK | 코어 울트라, 아크 A/B 시리즈; 16GB RAM | 활성, 2026년 8월 2026.3 버전 | Coming soon |
| Apple Foundation 모델 | 운영체제에서 노출되는 온디바이스 모델 | OS 프레임워크 | 애플 실리콘; 이미 설치되어 있습니다. | 활성 상태이며, WWDC 2026의 모든 제공업체에 개방되어 있습니다. | Coming soon |
| 마이크로소프트 파운드리 로컬 | 로컬 추론 SDK 및 CLI; 별점 약 2,400개 | SDK | Windows, macOS, Linux; NPU/GPU/CPU | GA 2026년 4월; 엄선된 모델 카탈로그 | Coming soon |
| AMD 가이아 | Ryzen AI용 로컬 LLM 앱; 별점 약 1,400개, MIT | 앱 + SDK | 최소 사양: 라이젠 AI 300 시리즈; RAM 16GB (64GB 권장) | 활성 버전, v0.20.0 (2026년 6월) | Coming soon |
| 인텔 AI 플레이그라운드 | 데스크톱 앱; 별점 약 900개 | 앱 | Arc A 시리즈 8GB 이상, Arc B 시리즈, Core Ultra | 2년이 지났지만 여전히 베타 버전입니다. | Coming soon |
| 퀄컴 지니엑스 | 스냅드래곤 NPU용 온디바이스 GGUF 런타임 | 런타임 | 스냅드래곤 X/X 엘리트, 8 엘리트 | 개발자 미리보기, 2026년 7월 | Coming soon |
| 엔비디아 프로젝트 G-Assist | 시스템 제어를 위한 온디바이스 8B 어시스턴트 | 앱 | RTX 20 시리즈 이상, 6GB VRAM | 활성화되어 있지만 아직 사전 출시 상태로 표시되어 있습니다. | Coming soon |
명칭에 대한 참고 사항입니다. NVIDIA의 "RTX AI Garage"는 제품처럼 들리지만 제품이 아니라 블로그 시리즈입니다. Microsoft의 기술 스택도 여러 번 이름이 바뀌었습니다. Copilot Runtime API는 Windows AI API가 되었고, Azure AI Foundry는 Microsoft Foundry가 되었으며, DirectML은 현재 보안 수정만 제공하는 유지 관리 모드입니다. Qualcomm AI Hub는 물리적 장치를 원격으로 프로비저닝하는 클라우드 서비스이며, 로컬에서 실행하는 프로그램이 아닙니다.
일반적으로 고장나는 부분
로컬 모델이 "작동하지 않는다"는 보고의 대부분은 모델 문제가 아니라 구성 문제입니다. 특히 네 가지 요인이 이러한 보고의 상당 부분을 차지하며, 하드웨어 사용자라면 실리콘 자체를 탓하기 전에 이 네 가지 사항을 모두 알아야 합니다.
1. Ollama는 기본적으로 4,096개 토큰 컨텍스트를 사용합니다. 이 값을 초과해도 오류를 발생시키지 않고 조용히 잘립니다. 에이전트 루프도 조용히 종료됩니다. 하지만 제대로 작동하는 대부분의 애플리케이션에는 이보다 더 많은 컨텍스트가 필요합니다. OpenHands는 최소 22개를 요구하고 32개를 권장하며, Codex는 32개, Copilot CLI는 128개, Cline은 262,144개를 요구합니다. 이 설정 오류가 온라인에서 찾아볼 수 있는 오류 보고서의 가장 흔한 원인일 가능성이 높습니다.
2. KV 캐시 양자화는 특히 툴 호출 성능을 저하시키며 , 일반적인 출력 품질이 눈에 띄게 저하되기 전에 이미 이러한 현상이 발생합니다. llama.cpp 문서에서 이에 대해 직접적으로 경고하고 있습니다. 에이전트를 실행 중인 경우, 이 기능을 비활성화하십시오.
3. 도구 개수는 완만한 경사가 아니라 절벽과 같습니다. 대략 5~6개 이상의 도구가 범위 내에 있으면 문제가 발생하는데, 일부 모델은 유효한 JSON 도구 호출을 조용히 중단하고 대신 응답 본문에 XML을 삽입하기 시작하며, 이를 하네스는 "도구 미사용"으로 인식합니다. 한 인기 에이전트는 기본적으로 11개의 도구를 제공하여 2026년 초까지 자체 권장 모델이 제대로 작동하지 않도록 만들었습니다. 실질적인 결과는 직관과 반대입니다. 많은 MCP 서버에 부하를 주는 것은 프론티어 모델 과는 달리 로컬 모델에 심각한 악영향을 미칩니다.
4. Q4_K_M은 실질적인 최저 기준입니다. 이 기준치 이하에서는 툴콜 신뢰도가 전반적인 품질보다 더 빠르게 떨어지므로, 모델은 겉으로는 괜찮아 보이지만 실제로는 아무런 기능도 수행하지 못하는 상태가 됩니다.
메모리가 제약 조건입니다.
이 페이지의 모든 도구에서 실행 가능 여부를 결정하는 핵심 질문은 가속기가 사용할 수 있는 메모리 용량입니다. 다음은 에이전트 기반 작업에서 가장 자주 언급되는 조합이며, 저희는 연구실에서 이를 검증할 계획입니다.
| 하드웨어 | 모델 | 발자국 | 보고된 처리량 |
|---|---|---|---|
| RTX 5090, 32GB | Qwen3.6-35B-A3B Q4_K_M | ~ 21GB | 160-180 토크/초, 262K 컨텍스트 |
| RTX 5090, 32GB | Qwen3-Coder-30B-A3B Q4_K_M | ~ 19GB | 24GB급에서 50-90 tok/s |
| RTX 5090, 32GB | Devstral Small 24B Q4_K_M | ~ 14GB | 공구 호출을 위해 특별히 제작됨 |
| RTX 프로 6000, 96GB | GPT-OSS 120B MXFP4 | ~ 63GB | 단일 워크스테이션 카드에 탑재된 100B급 GPU, 저희 연구실 리뷰에서 사용한 제품입니다. |
| RTX PRO 5000 노트북, 24GB GDDR7 | Qwen3-Coder-30B-A3B Q4_K_M | ~ 19GB | 저희가 테스트한 노트북 GPU 중 가장 큰 성능을 자랑하는 30B급 GPU(ThinkPad P16 3세대)는 충분한 여유 용량을 갖추고 있습니다. |
| 96-128GB 통합, M 시리즈 | gpt-oss-120b Q6_K | ~ 93GB | 14-20 토크/초; 오픈웨이트 모델 중 가장 깔끔한 툴콜 JSON 응답 속도 |
마케팅에서는 언급하지 않지만, 가장 용량이 큰 오픈 소스 모델들은 워크스테이션용이 아닙니다. GLM-5.2는 약 744B 파라미터를 가지고 있으며, FP8 기준으로 약 744GB의 저장 공간이 필요한데, 이는 8개의 GPU가 탑재된 데이터센터 노드에 해당합니다. Kimi K2와 DeepSeek V4도 마찬가지입니다. 이러한 프로그램들을 데스크톱에서 실행하라고 하는 가이드는 모두 잘못된 정보입니다.
위의 처리량 수치는 공개된 제3자 테스트 및 벤더 자료에서 가져온 것이며, StorageReview 연구소의 자체 측정 결과는 아닙니다. 각 플랫폼이 가이드 프로세스를 거치는 대로 자체 측정 결과로 대체될 예정입니다.
클라우드 우선 도구, 그리고 이 순위에 포함되지 않은 이유
대부분의 AI 사용자는 인기 있고 사용하기 쉬운 온라인 AI 도구에 익숙합니다. 로컬 에이전트는 로컬 모델이 아닙니다. 이러한 도구들은 모두 사용자의 컴퓨터에서 실행되지만, 모든 추론 호출은 공급업체의 클라우드 서버로 전송됩니다.
| 수단 | 로컬 모델 지원 | 주의 사항 |
|---|---|---|
| 커서 | 아니 | 공식 문서에 따르면 모든 요청은 Cursor 서버를 통해 처리되며, 사용자 지정 키는 주요 클라우드 제공업체에서만 작동하고, 탭 자동 완성 기능은 항상 Cursor 모델을 사용합니다. 2026년 SpaceX에 인수되었습니다. |
| 데빈 데스크탑(구 Windsurf) | 아니 | 2026년 6월에 이름이 변경되었습니다. 모든 모델은 클라우드에서 호스팅됩니다. |
| 구글 반중력 | 아니 | 문서에는 Ollama, LM Studio 또는 사용자 지정 엔드포인트를 사용할 수 없다고 명시적으로 나와 있습니다. |
| 제미니 CLI | 아니 | 지역 지원은 커뮤니티 포크에서만 존재합니다. |
| 코도 | 아니 | "온프레미스"는 자체 호스팅 인프라를 의미하며, 여전히 클라우드 모델이라고 부릅니다. |
| IDE의 GitHub Copilot | 일부의 | 채팅은 로컬 모델을 사용할 수 있지만, 인라인 자동 완성 기능은 BYOD(Bring Your Own Key) 환경에서도 클라우드 기반으로 유지됩니다. |
| ChatGPT | 아니 | 데스크톱 및 모바일 앱은 OpenAI 클라우드 모델의 클라이언트입니다. OpenAI의 open-weight gpt-oss 모델은 로컬에서도 실행되지만, ChatGPT 앱이 아닌 위에 언급된 런타임을 통해 실행됩니다. |
| 클로드 | 아니 | Claude 앱과 Cowork는 Anthropic의 클라우드 모델에서 실행됩니다. Claude 코드는 Ollama의 Anthropic 호환 API를 통해 로컬 모델을 가리킬 수 있지만, 이는 공식적으로 지원되는 구성은 아닙니다. |
| 일반 에이전트 보조원 | 아니 | 이 수업의 도구들은 사용자의 컴퓨터에서 실행되지만, 추론 과정에서는 클라우드 모델에 의존합니다. |
"커서(Cursor)를 올라마(Ollama)에 연결하는 방법"에 대한 가이드가 널리 퍼져 있지만, 커서 공식 문서에서는 이와 상반되는 내용을 다루고 있습니다. 오프라인 사용이 필수적인 경우, 이 차이점이 매우 중요합니다.
이미지 및 비디오 생성은 어떻게 되나요?
로컬 이미지 생성은 로컬 AI 분야에서 가장 큰 커뮤니티 중 하나입니다. ComfyUI 하나만으로도 GitHub 스타 수 기준으로 위에 순위가 매겨진 대부분의 도구들을 능가하며, 로컬 비디오 생성은 현재 가장 많은 VRAM을 요구하는 소비자 워크로드로 떠오르고 있습니다. 이 분야는 이 목록에 네 번째 카테고리를 추가하는 것보다 별도의 순위표가 필요하며, 실제로 그렇게 될 것입니다. 그때까지는 이 페이지의 하드웨어 논리가 그대로 적용됩니다. 이미지 및 비디오 작업은 언어 모델보다 훨씬 더 메모리 제약이 심하며, 동일한 등급 체계가 적용됩니다.
이 페이지는 어떻게 작동하나요?
세 가지 규칙이 있습니다. 첫째, 현재 순위는 GitHub 스타 수를 기준으로 합니다. 이상적인 방법은 아니지만, 객관적이고 검증 가능하며, 테스트하지 않은 것을 테스트한 것처럼 가장할 필요가 없습니다. 비공개 소스 도구는 임의로 점수를 매기는 대신 비공개라고 표시합니다. 자체 테스트를 통해 확실한 선호 도구가 나타나면, 측정 결과를 반영하여 순위를 조정할 것이며, 그 사실을 알려드리겠습니다. 둘째, 모든 항목에는 최소 메모리 요구 사항이 명시되어 있습니다. 이 수치가 모델 로드 여부를 결정하기 때문입니다. 셋째, 가이드 항목은 저희의 약속입니다. 각 플랫폼에 대해 저희 하드웨어에서 측정한 수치와 함께 실제 설정 과정을 안내하는 가이드를 제공하며, 게시되면 여기에 링크를 추가합니다.
로컬 LLM 도구 FAQ
어떤 로컬 LLM 도구부터 시작해야 할까요?
터미널 환경에 익숙하다면 Ollama를, 창 형태의 컨트롤을 선호한다면 LM Studio를, 별도의 설치 없이 바로 사용할 수 있는 Jan을 추천합니다. 세 프로그램 모두 무료이며, 완전히 오프라인에서 실행되고, 내부적으로 llama.cpp를 사용하기 때문에 모델 동작 방식은 동일합니다. 차이점은 속도가 아니라 인터페이스에 있습니다.
NVIDIA ChatRTX, GPT4All, 그리고 Continue.dev는 어떻게 되었나요?
놀랍게도 많은 동료들과 함께 그들은 사라졌습니다. 이는 오래된 권장 사항을 따르기 전에 알아야 할 가장 중요한 사실입니다. NVIDIA ChatRTX는 2026년 1월 21일에 지원이 중단되었고, 저장소는 아카이브되었으며, 지원 포럼은 잠겼고, 대체 도구는 아직 발표되지 않았습니다. GPT4All 은 가장 까다로운 경우입니다. 지난 12개월 동안 커밋이 없었고 마지막 릴리스는 2025년 2월이었지만, 저장소는 아카이브되지 않았고 여전히 많은 별점을 받고 있어 활동 중인 것처럼 보입니다. GPT4All은 제한된 양자화 형식만 지원했으며 대부분의 최신 모델 릴리스를 로드할 수 없습니다. 2년간 로컬 모델 코딩의 표준 권장 사항이었던 Continue.dev 는 Cursor에 인수되어 2026년 6월에 서비스가 종료되었습니다. Roo Code는 2026년 5월에, Void는 2026년 6월에, Twinny는 2025년 11월에, Reor는 2026년 3월에 서비스가 종료되었습니다. Khoj는 2026년 4월에 호스팅 서비스를 종료했지만 자체 호스팅 버전은 유지됩니다. 벤더 측면에서는 Intel IPEX-LLM이 2026년 1월에 서비스가 종료되었고 알려진 보안 문제가 있는 것으로 표시되었으며 마이그레이션 경로는 공개되지 않았습니다. NVIDIA RTX AI Toolkit은 2025년 11월에 지원이 중단되었습니다.
로컬 LLM을 실행하려면 VRAM이 얼마나 필요합니까?
채팅의 경우, 8GB 시스템 RAM으로는 3B 모델을 실행할 수 있고, 16GB로는 CPU만으로도 7~8B 모델을 무난하게 실행할 수 있습니다. 실질적인 속도를 위해서는 VRAM 또는 통합 메모리에 탑재된 모델을 사용하는 것이 좋습니다. 16GB는 7~14B급 모델을, 24GB는 4분기에 30B급 모델을 지원하며, 32GB 이상부터는 에이전트 코딩 작업에서 더 이상 불편함을 느끼지 않게 됩니다. 그 이상에서는 대역폭보다 용량이 더 중요하기 때문에 96~128GB 통합 메모리를 탑재한 시스템에서는 일반 소비자용 그래픽 카드로는 처리할 수 없는 모델을 실행할 수 있습니다.
로컬 LLM 도구가 내 NPU를 사용하나요?
일반적으로는 그렇지 않습니다. Ollama.cpp에는 NPU 백엔드가 없으므로 Ollama와 LM Studio는 스냅드래곤이나 라이젠 AI 머신에서 뉴럴 엔진 사용률을 0%로 유지하고 CPU 또는 GPU에서 실행합니다. 현재 NPU를 사용하려면 퀄컴 지니엑스, NPU 런타임을 제공하는 AMD 레모네이드, 인텔 오픈비노, 또는 운영체제 프레임워크를 통한 애플의 뉴럴 엔진과 같은 벤더사의 방식을 따라야 합니다. NPU를 사용하는 이점은 속도 향상보다는 배터리 수명 연장과 저전력 상시 작동이라는 점을 알아두는 것이 좋습니다. 또한 현재 NPU는 최대 70억 원대 모델에 불과하며, 외장 GPU는 처리량 면에서 항상 NPU를 능가합니다.
로컬 AI를 Windows에서 실행해야 할까요, 아니면 Linux에서 실행해야 할까요?
이 페이지의 데스크톱 앱은 Windows와 macOS에서 원활하게 작동합니다. LM Studio, Jan, AnythingLLM, Ollama는 모두 네이티브로 설치되고, GPU 드라이버는 일반적인 경로에서 구할 수 있으며, 터미널이 필요한 작업은 없습니다. Linux는 그보다 한 단계 아래 운영체제에서 제 역할을 합니다. 프로덕션 서버 엔진인 vLLM과 SGLang은 Linux 우선 개발 방식이며, 멀티 GPU 서버는 Linux를 전제로 하고, AMD의 Ryzen AI NPU 지원을 포함한 최신 가속 기술들이 다른 운영체제보다 먼저 Linux에 적용됩니다. Ryzen AI NPU 지원은 Linux에서 출시되었으며 최신 커널을 필요로 합니다. 하지만 운영체제 간 격차는 예전보다 좁아졌습니다. AMD는 2026년에 ROCm 릴리스를 Windows와 Linux에서 통합했고, WSL2는 나머지 대부분의 운영체제를 지원합니다. 덕분에 Open WebUI와 같은 Docker 기반 도구들이 Windows 환경에서도 문제없이 실행됩니다. 실용적인 규칙은 다음과 같습니다. 데스크톱 앱 표를 참고하여 설치하는 경우 현재 사용 중인 운영체제를 그대로 사용하고, 전용 서버 환경을 구축하거나 모든 가속 기술을 활용하려는 경우에는 Linux를 사용하는 것이 좋습니다.
로컬 모델이 코딩에 있어 클라우드 모델을 대체할 만큼 충분히 좋은가요?
이는 전적으로 작업에 따라 다르며, 대부분의 클라우드 컴퓨팅 커버리지에서 인정하는 것보다 성능 차이는 훨씬 더 큽니다. 제한된 작업, 단일 파일 생성, 단위 테스트, 상용구 코드, 설명 코드 등의 작업에서는 고성능 워크스테이션을 사용하는 현재의 오픈 소스 모델이 최첨단 클라우드 모델과 거의 동등한 성능을 보입니다. 하지만 장기적인 에이전트 기반 작업, 대규모 저장소에 걸친 다중 파일 리팩토링과 같은 작업에서는 오픈 소스 모델이 확연히 뒤처지며, 그 실패 유형은 좋지 않습니다. 예를 들어, 아무런 작업도 수행하지 않는 것처럼 보이는 오류나, 실제로는 수행되지 않았는데도 작업이 완료되었다고 보고되는 경우입니다. 개인 정보 보호, 에어갭 요구 사항 또는 비용 절감을 이유로 로컬 컴퓨팅을 고려한다면 현재로서는 충분히 실행 가능합니다. 하지만 성능 향상을 이유로 한다면 아직은 적합하지 않습니다.
모델을 로컬에서 실행하는 것이 클라우드 서비스를 사용하는 것보다 더 안전할까요?
데이터 상주 측면에서는 그렇습니다. 그게 바로 핵심이죠. 하지만 소프트웨어 보안 측면에서는 자동으로 그렇게 되는 건 아닙니다. 2026년 3월에 CVSS 9.6 등급을 받은 로컬 AI 앱이라도 모델의 스트리밍 출력으로 인해 호스트 시스템에서 코드를 실행하도록 유도될 수 있습니다. 데스크톱 앱이 안전하지 않은 기본 설정으로 패키징되었기 때문입니다. 로컬 환경은 데이터가 제자리에 유지된다는 의미입니다. 하지만 소프트웨어가 안전하다고 보장하는 것은 아니며, 이 범주에 속하는 소프트웨어는 빠르게 변화하는 코드를 많이 사용합니다.
AI 에이전트 샌드박스란 무엇이며, 로컬 AI에 필요한가요?
샌드박스는 일반적으로 컨테이너나 경량 가상 머신과 같은 격리된 환경으로, AI 에이전트가 자신이 생성한 명령과 코드를 실행하는 곳입니다. 따라서 오류나 악의적인 명령이 호스트 시스템에 영향을 미치지 않습니다. 에이전트는 단순히 질문에 답하는 것뿐만 아니라 셸 명령을 실행하고, 파일을 편집하고, 웹 브라우징을 하며, 이러한 모든 작업은 조작 가능한 모델 출력에 의해 좌우되기 때문에 샌드박스가 필요합니다. 모델을 로컬에서 실행한다고 해서 이러한 상황이 바뀌는 것은 아닙니다. 샌드박스는 모델이 어디에 있는지가 아니라 에이전트가 하는 작업을 격리하는 것이며, 위에서 설명한 코드 실행 취약점은 바로 이러한 점을 로컬 우선 애플리케이션에서 보여주었습니다. 이 페이지에 소개된 일부 도구는 샌드박스 기능을 내장하고 있지만, 호스트 시스템에 대한 무제한 액세스 권한을 가진 에이전트를 실행하는 도구는 중요한 시스템에 사용하기 전에 신중하게 검토해야 합니다. 에이전트가 비즈니스 환경에 도입됨에 따라 샌드박스는 부연 설명이 아닌 핵심 기능으로 자리 잡을 것이며, 이러한 도구를 평가할 때 샌드박스 기능을 중요한 요소로 고려하게 될 것입니다.
로컬 하드웨어에서 수십 개의 하위 에이전트를 사용하는 에이전트 기반 워크로드를 실행할 수 있습니까?
이것이 바로 미지의 영역이며, 솔직히 말해서 단일 워크스테이션으로는 공간이 금방 부족해집니다. 멀티 에이전트 워크로드는 각각 고유한 컨텍스트를 가진 서브 에이전트를 생성하고, 추론 측면에서 각 활성 컨텍스트는 메모리에 자체 KV 캐시를 필요로 하므로, 메모리 사용량은 모델 크기뿐만 아니라 동시 실행 수에 따라 증가합니다. 이러한 캐시가 메모리 용량을 초과할 때 어떻게 처리해야 하는지는 또 다른 엔지니어링 문제입니다. Dell 및 Solidigm 하드웨어를 기반으로 구축된 플래시 메모리로의 KV 캐시 오프로드 에 대한 심층 분석 은 이 주제에 대한 저희가 발표한 최고의 연구입니다. 30B급 에이전트 세션 하나를 안정적으로 처리할 수 있는 시스템은 일반적으로 배치 서버를 통해 몇 개의 병렬 세션을 처리한 후 지연 시간이 증가합니다. 수십 개의 동시 서브 에이전트를 처리하려면 서버 영역이 필요하며, 많은 활성 컨텍스트를 저장할 수 있는 충분한 메모리와 지속적인 배치 처리를 위해 설계된 vLLM과 같은 서비스 엔진이 필요합니다. 또한 품질 한계도 존재합니다. 로컬 모델은 도구 수가 증가함에 따라 이미 신뢰성이 떨어지고, 오케스트레이션은 도구와 핸드오프를 더욱 증가시킵니다. 저희는 단일 에이전트 또는 소수 에이전트 작업은 현재 워크스테이션에서 처리할 수 있는 적절한 작업이며, 대규모 서브 에이전트 플릿은 인프라 작업이라고 생각합니다. 이러한 경계와 그 경계를 넘나드는 데 필요한 하드웨어에 대해서는 앞으로 더욱 심층적으로 연구할 계획입니다.




아마존