Tenstorrent는 최대 120억 개의 매개변수를 가진 모델을 데스크톱에서 완벽하게 실행할 수 있도록 설계된 액체 냉각 방식의 AI 워크스테이션인 TT-QuietBox 2(Blackhole)를 출시했습니다. 이 시스템은 완전한 오픈 소스 소프트웨어 스택과 RISC-V 기반 실리콘을 결합하여 랙, 서버실 또는 특수 전원 공급 장치가 필요 없는 테라플롭급 추론 플랫폼으로 자리매김하고 있습니다.
추론은 AI의 주요 작업 부하입니다.
QuietBox 2는 컴파일러 및 런타임 수준에서 실리콘 아키텍처에 대한 가시성을 포함하여 인프라를 직접 제어하려는 개발자 및 조직을 대상으로 합니다. 랙 규모의 시스템으로 전환하지 않고도 고성능 추론 기능이 필요한 연구실, 사무실 및 중소기업의 온프레미스 배포에 적합합니다.
텐스토렌트 CEO 짐 켈러는 이번 프로젝트가 연구실이나 사무실 환경에 적합한 개방형 테라플롭급 개발 시스템을 제공하기 위한 의도적인 노력이라고 설명하며, 기계 설계까지 포함한 플랫폼 전체가 개방형이라고 강조했습니다. 켈러는 AMD Zen, 애플 A4/A5, 테슬라 자율주행 칩의 아키텍트로 활동하는 등 화려한 경력을 자랑합니다.
개발자를 위한 사전 통합 워크로드
QuietBox 2는 언어, 멀티모달 및 과학 분야 전반에 걸쳐 즉시 배포할 수 있는 실제 워크로드 세트를 제공합니다.
LLM 및 코딩의 경우, GPT-OSS 120B는 기기에서 완전히 실행되며, 120억 개의 매개변수를 가진 전체 모델을 데스크톱에 상주시켜 개인적인 로컬 추론을 수행합니다. Llama 3.1 70B는 초당 476.5 토큰을 처리하는 것으로 보고되었으며, 이는 대화형 워크로드, 코드 지원 및 에이전트 파이프라인에 적합한 주목할 만한 수치입니다. Qwen3-32B는 클라우드 토큰 제한 없이 전체 코드베이스를 추론할 수 있는 로컬 코딩 에이전트로, 오프라인 개발 코파일럿 및 제한된 환경 배포를 위한 솔루션을 제공합니다.
창의적이고 멀티모달적인 측면에서 Flux는 이미지 생성을 로컬에서 처리하고, WAN 2.2는 기기 내에서 비디오 합성을 제공합니다. 두 사용 사례 모두 미디어 자산과 프롬프트를 사내에 보관하므로 지적 재산권 및 데이터 상주 요건이 엄격한 팀에 적합합니다.
과학 연구 분야에서 이 시스템은 생체 분자 머신러닝 워크로드인 Boltz-2와 같은 특수 모델을 대상으로 합니다. Tenstorrent에 따르면 Boltz-2는 단일 Blackhole 프로세서에서 686개 아미노산으로 구성된 단백질 구조를 49초 만에 예측하는데, 이는 최신 CPU에서 약 45분이 걸리는 것과 비교하면 매우 빠른 속도입니다. 이러한 결과는 QuietBox 2가 비용과 전력 효율성에 중점을 두면서도 플래그십 워크스테이션 GPU와 동등한 성능을 제공함을 보여줍니다. 단일 시스템에서 4개의 단백질 구조를 병렬로 예측할 수 있는 기능은 단일 작업 실행보다 약 4배 높은 처리량을 제공하며, 이는 연구실 및 생명공학 워크플로우에 매우 유용합니다.
기본 제공되는 카탈로그 외의 모델의 경우, Tenstorrent의 오픈 소스 AI 컴파일러인 TT-Forge는 PyTorch, ONNX, TensorFlow, JAX 및 PaddlePaddle에서 생성된 그래프를 지원하며, 이를 하드웨어에 직접 배포할 수 있습니다. 설계 원칙은 간단합니다. 표준 프레임워크에서 실행되는 모델이라면 QuietBox 2에서도 컴파일 및 실행이 가능해야 한다는 것입니다.
RISC-V 실리콘 및 메모리 아키텍처
하드웨어 측면에서 QuietBox 2는 책상에 놓기 적합한 크기의 케이스 안에 통합 메시 형태로 작동하는 4개의 Blackhole ASIC을 사용합니다. 이 ASIC들은 총 480개의 Tensix 코어를 제공하며, BlockFP8 정밀도에서 최대 2,654 TFLOPS의 성능을 발휘한다고 합니다. 또한 128GB의 GDDR6 고속 메모리와 256GB의 DDR5 시스템 메모리가 이를 뒷받침합니다.
이 아키텍처는 온칩 메모리를 통한 효율적인 텐서 이동을 우선시하는 데이터 흐름 방식을 채택하여 컴퓨팅 기능과 고밀도 SRAM을 단일 칩에 통합했습니다. SRAM과 GDDR6를 활용함으로써, 기존 CPU 및 GPU 플랫폼에서 지속적인 처리량을 제한하는 DRAM 대역폭 병목 현상을 해결하도록 설계되었습니다. Tenstorrent는 또한 고대역폭 메모리(HBM)에 대한 의존성을 명시적으로 배제했습니다. HBM을 사용하지 않음으로써 QuietBox 2는 현재 GPU급 가속기에 영향을 미치는 공급 및 가격 압력의 영향을 일부 완화할 수 있습니다.
이 워크스테이션은 우분투 24.04를 실행하며 표준 120V 벽면 콘센트에 연결하여 사용하므로 별도의 전원, 랙 또는 제어된 서버실이 필요하지 않습니다. 이러한 구성은 추론 성능이 랙급 사용 사례를 목표로 하지만 데이터센터 하드웨어보다는 고급 전문가용 데스크톱에 더 가깝습니다.
컴파일러부터 커널까지 오픈 소스
QuietBox 2의 핵심 설계 특징은 소프트웨어 스택 전체가 오픈 소스라는 점입니다. Tenstorrent는 이를 통해 시스템의 모든 수준에서 동작을 이해하고 감사해야 하는 팀에게 전체 스택 가시성을 제공한다고 홍보합니다.
TT-Forge는 그래프 축소, 변환 및 최적화 흐름에 대한 제어 기능을 제공하여 모델이 기본 하드웨어에 어떻게 매핑되는지 보여줍니다. TT-Metalium은 저수준 AI SDK 역할을 하며, 성능을 조정하거나 사용자 지정 연산자를 구현해야 하는 개발자에게 커널 수준 제어 및 결정론적 실행을 제공합니다. TT-LLK는 저수준 커널 소프트웨어를 처리하여 Tensix 코어에서 워크로드가 실행되는 방식을 더 자세히 파악할 수 있도록 합니다.
이러한 구조를 통해 개발자는 모델 그래프에서 커널 실행에 이르는 파이프라인을 검사하고, 하드웨어 경계에서 디버깅하고, 개별 구성 요소를 포크하거나 수정하고, 특수 워크로드에 맞게 스택을 조정할 수 있습니다. 데이터 관리 및 모델 실행 방식을 문서화해야 하는 규제 산업, 국가 주도의 AI 프로젝트, 연구 기관의 경우 이러한 수준의 투명성은 선택적인 추가 기능이 아니라 플랫폼의 핵심 요소입니다.
QuietBox 2는 Ubuntu 24.04가 사전 구성된 상태로 제공되며, 전체 오픈 소스 스택과 Tenstorrent의 개발 환경인 TT-Studio가 함께 설치됩니다. 목표는 실험 및 프로덕션 수준의 추론을 위해 시스템을 즉시 사용할 수 있도록 하는 것입니다.
전력, 발열 및 데스크톱 설치
2세대 QuietBox는 전력 효율성과 소음 감소에 중점을 두었습니다. Tenstorrent에 따르면, 설계 변경을 통해 이전 세대 대비 유휴 전력 소비량과 발열량이 약 50% 감소했습니다. 새로운 액체 냉각 방식의 섀시는 별도의 장비실이 아닌 책상 옆 환경에서 고부하 작업 시에도 조용하고 지속적인 작동을 보장하도록 설계되었습니다.
하드웨어 변경과 더불어 Tenstorrent는 더욱 빠른 초기 설정과 사용 가능한 성능 구현 시간 단축을 목표로 문서화 및 개발자 도구를 확장했습니다. 중소기업의 경우, 단일 120V 전원 플러그, 액체 냉각 시스템, 그리고 사전 설치된 스택의 조합을 통해 서버실 구축이나 IT 인력 증원 없이 랙급 추론 기능을 제공할 수 있도록 설계되었습니다.
이용 가능 여부 (Availability)
TT-QuietBox 2는 2026년 2분기에 전 세계적으로 출시될 예정이며, 가격은 9,999달러부터 시작합니다. 관심 있는 기업은 Tenstorrent 웹사이트( www.tenstorrent.com/waitlist/tt-quietbox )에서 대기자 명단에 등록할 수 있습니다.




아마존