최근 코미노(Comino)에서 리뷰용으로 최신 버전의 코미노 그란도(Comino Grando)를 보내주었습니다. 이 제품은 96GB VRAM을 탑재한 NVIDIA RTX PRO 6000 블랙웰 그래픽 카드 8개가 장착되어 총 768GB의 GPU 메모리를 제공합니다. 저희는 2024년에 6개의 RTX 4090 (총 144GB GPU 메모리)이 장착된 버전과 NVIDIA H100이 장착된 버전을 리뷰한 바 있습니다. 이번 최신 업데이트는 메모리 용량과 플랫폼이 처리할 수 있는 워크로드 범위 모두에서 상당한 세대적 도약을 보여줍니다.
그란도는 고밀도 GPU 컴퓨팅과 열 관리 사이의 중요한 상충 관계를 해결하기 위해 특별히 설계된 4U 플랫폼입니다. 일반적인 공랭식 섀시는 최신 전문가용 그래픽 카드의 600W 이상의 TDP 요구 사항을 지속적으로 감당하지 못하는 반면, 그란도는 근본적으로 다른 접근 방식을 취하여 6.5kW에 달하는 지속적인 열을 발산할 수 있는 액체 냉각 아키텍처를 기반으로 처음부터 설계되었습니다. 이는 기존 시스템에 대한 개조나 사후 고려 사항이 아닙니다. 역방향 마더보드 레이아웃부터 색상으로 구분된 퀵 커넥트 매니폴드 시스템에 이르기까지 섀시 전체가 냉각 루프를 중심으로 설계되었습니다.
그 결과, 4U 섀시 하나에 최대 TDP를 지원하는 전문가용 GPU 8개를 탑재하고, 3~38°C의 주변 환경에서 24시간 365일 가동해도 열 스로틀링이나 고속 공랭식 냉각으로 인한 소음 문제, 그리고 서비스 용이성 저하 없이 안정적인 성능을 제공하는 플랫폼이 탄생했습니다. AI 추론, 머신러닝 학습 또는 고성능 시뮬레이션 워크로드를 대규모로 배포하는 기업에게 Grando는 밀도, 발열 관리, 그리고 안정성 중 어느 하나를 선택할 필요가 없는 진정한 희소성을 제공합니다.
코미노 그란도 사양
아래 표는 코미노 그란도 플랫폼의 물리적 사양 및 지원되는 하드웨어 구성을 보여줍니다.
| 사양/특징 | 코미노 그란도 |
|---|---|
| 코미노 그란도 서버 및 랙형 워크스테이션 | |
| 냉각 용량 | 6.5kW (흡입 공기 온도 20°C 기준 최대 6,500W) |
| 마더 보드 | EATX 및 EBB까지 |
| GPU(서버) | 최대 8개; NVIDIA: RTX A6000, RTX 6000 ADA, RTX PRO 6000, A40, L40, L40S, A100, H100, H200 |
| GPU(랙형 워크스테이션) | 최대 6개; NVIDIA: 3090, 4090, 5080, 5090, RTX A6000, RTX 6000 ADA, RTX PRO 6000, A40, L40, L40S, A100, H100, H200; AMD: W7800, W7900 |
| CPU | 최대 2개; 싱글 소켓: Intel Xeon W-2400/2500 및 3400/3500, Intel Xeon Scalable 4세대, 5세대, XEON 6, AMD Threadripper PRO 5000WX, 7000WX, 9000WX, AMD EPYC 9004/9005 듀얼 소켓: 인텔 제온 스케일러블 4세대 및 5세대, 제온 6, AMD EPYC 9004/9005 |
| 램 | 2TB까지 |
| M2 드라이브 | 최대 8배 NVME |
| 스토리지 | 후면 패널 핫스왑 케이지: 최대 4개의 핫스왑 SSD(7mm 4개 또는 15mm 2개) 장착 가능, 4번째 파워서플라이 대신 최대 4개의 파워서플라이(7mm 4개 또는 15mm 2개) 추가 장착 가능; 내부 3.5인치 케이지는 최대 4개의 3.5인치 또는 4개의 2.5인치 15mm 또는 12개의 2.5인치 7mm로 구성될 수 있습니다. 내부 2.5인치 슬롯: 최대 4개의 2.5인치 7mm SSD 지원 |
| 전원 공급 및 작동 전압 | 최대 4개의 2000W 핫스왑 CRPS @ 180-264V 최대 4개의 1000W 핫스왑 CRPS @ 90-140V 이중화 모드: 4+0, 3+1, 2+2 |
| 소음 수준 | 39dB~70dB |
| 란 | 메인보드에서 최대 2 x 10Gbit/s, PCIe에서 최대 400Gbit/s 지원 |
| OS | 우분투 / 윈도우 11 (프로/홈) / 윈도우 서버 |
| 물리적 및 냉각 사양 | |
| 액체 냉각 | VRM이 내장된 CPU와 GDDR 및 VRM이 내장된 GPU |
| 저수지 | 코미노 커스텀 450ml (펌프 내장형) |
| 팬 | 3배속 초고유량 6200RPM (소음 심함) 또는 3배속 고유량 3000RPM (저소음) |
| 설치 | 19인치 랙 마운트형 또는 독립형 워크스테이션으로 사용 가능 |
| 필요한 랙 공간 | 4U |
| 중량 | 439 x 681 x 177mm (손잡이 및 돌출부 제외) |
| 중량(평량) | GPU 4개: 순중량 49kg, 총중량 67kg GPU 6개: 순중량 52kg, 총중량 70kg GPU 8개: 순중량 55kg, 총중량 72kg |
| 작동 및 보관 온도 범위 | 보관 온도: -5~50°C / 23~122°F 작동 온도 범위: 3~38°C / 38~100°F |
| 코미노 모니터링 시스템(CMS) | |
| 회사 개요 | 실시간 모니터링을 위한 센서 및 소프트웨어가 내장된 제어 보드 |
| 주요 장점 | 냉각 시스템 및 CPU/GPU 모니터링, 웹 인터페이스, 냉각 시스템 로그, 작업 그룹을 위한 중앙 집중식 모니터링 |
| 센서 및 연결된 장치 | 온도(공기 및 냉각수), 습도(%), 전압, 냉각수 유량, 냉각수 저장조 수위, 팬, 펌프, 마더보드, 디스플레이 및 버튼 |
| 통합 가능성 | REST API를 통해 모니터링 시스템을 구축하고 센서 데이터를 모니터링 소프트웨어(예: Zabbix, Grafana) 또는 데이터베이스(예: InfluxDB)로 전송합니다. |
| CMS 기술 요구사항 | |
| OS | Windows 11/10
Ubuntu 22.04/20.4 (Ubuntu의 경우 필수 조건: 대상 시스템에 nvidia-smi 및 sensors 유틸리티가 설치되어 있어야 합니다.) |
| 웹 브라우저 | 모질라 파이어폭스, 구글 크롬, 크로뮴, 애플 사파리, 마이크로소프트 엣지 (주의: 인터넷 익스플로러 11은 지원되지 않습니다) |
| 하드 디스크 드라이브 | 300MB |
| 컨트롤러 펌웨어 버전 | 1.0.6 이상 |
| 컨트롤러 PCB 버전 | 2.xx.xx |
설계, 제작 및 GPU 밀도
섀시 레이아웃 및 배치
그란도 서버는 17.3 x 26.8 x 6.97인치(4U)의 크기로 공간 최적화의 진수를 보여줍니다. 기존 서버와 달리 마더보드의 후면을 섀시 전면에 배치하여 일반적인 내부 레이아웃을 뒤집었습니다. 이를 통해 RAM 모듈 및 VRM과 같은 공랭식 부품이 후면의 수랭식 라디에이터에 도달하기 전에 가능한 한 가장 차가운 공기를 흡입할 수 있습니다.
본체 섀시는 견고한 스틸 구조에 내외부 모두 무광 블랙 파우더 코팅 마감을 적용하여 최고 수준의 품질 기준을 충족합니다. 이러한 세심한 선택은 튜브, 케이블, 방열판, PCB 솔더 마스크에까지 이어져 깔끔하고 전문적인 디자인을 완성합니다. 또한, 19인치 랙 마운트형 또는 독립형 데스크톱형으로 설치하여 다양한 환경에서 원활하게 사용할 수 있습니다. 구성에 따라 무게는 148~159파운드(약 67~72kg)입니다.
GPU 콜드 플레이트 및 워터 블록
코미노가 자체 개발한 구리 워터 블록은 그란도의 고밀도 냉각의 핵심이며, GPU 다이뿐만 아니라 메모리 및 전압 조절기와 같은 다른 구성 요소까지 냉각합니다. 각 GPU는 기성품 카드 형태로 출고되며, 코미노는 여기에 맞춤형 냉각판 어셈블리를 장착합니다. 실제로 이러한 얇은 프로파일 디자인 덕분에 각 카드는 단일 슬롯 크기만 차지하므로 4U 섀시 하나에 6개 또는 최대 8개의 전문가용 GPU를 나란히 장착할 수 있습니다. 저희 리뷰 제품에는 TDP가 각각 600W인 NVIDIA RTX PRO 6000 블랙웰 카드 8개가 장착되어 있었으며, 최대 부하 시 총 4,800W의 냉각 용량이 필요했습니다.
코미노의 8개 싱글 슬롯 GPU 밀도를 공랭식으로 구현하는 것은 거의 불가능합니다. 기본 NVIDIA RTX PRO 6000 카드는 각각 두 슬롯을 차지하고 상당한 공기 흐름을 필요로 하기 때문입니다. 반면, 이 커스텀 쿨링 카드는 각각 한 슬롯만 차지합니다. 콜드 플레이트는 견고하게 제작되어 카드 무게가 상당하지만, 이는 이 수준의 품질과 냉각 성능에 걸맞은 수준입니다.
각 GPU 쌍은 전용 서브 매니폴드를 통해 연결되며, 이 서브 매니폴드는 두 카드를 하나의 입출구 연결로 통합하여 메인 냉각수 매니폴드에 연결합니다. 이러한 쌍으로 구성된 방식은 전체 루프 구조를 단순화하고 메인 매니폴드의 연결 수를 줄이며, 기술자가 퀵 커넥트 커플링 한 쌍만 분리하여 두 카드를 한 번에 제거할 수 있도록 하여 유지보수를 더욱 간소화합니다.
물 분배 및 매니폴드
시스템의 중심에는 각 GPU 및 CPU 콜드 플레이트에 냉각수를 공급하고 라디에이터로 냉각수가 되돌아가는 경로를 제공하는 대형 냉각수 분배 매니폴드가 있습니다. 매니폴드와 GPU 및 CPU 사이의 모든 연결에는 코미노(Comino)의 "TheQ" 퀵 커넥트 커플링이 사용됩니다. 이 스테인리스 스틸 재질의 누수 방지 피팅은 빨간색과 파란색 링으로 색상이 구분되어 있어 루프의 뜨거운 쪽과 차가운 쪽을 명확하게 식별할 수 있으므로 설치 또는 서비스 시 혼동을 방지합니다.
분리 시 접촉면에 잔여물이 거의 남지 않아 기술자는 450ml 용량의 저수조나 나머지 수랭 시스템의 냉각수를 빼지 않고도 개별 GPU 또는 CPU를 제거하거나 교체할 수 있습니다. 이처럼 Grando는 고성능 수랭 플랫폼에 공랭 시스템의 간편한 유지 관리 기능을 제공합니다.
CPU 냉각 및 메모리
CPU와 전압 조절기는 냉각 루프에 직접 연결된 전용 콜드 플레이트의 이점을 누리며, 고강도 멀티 GPU 작업 부하 시 프로세서가 병목 현상을 일으키는 것을 방지합니다. 저희 리뷰 제품은 AMD EPYC 9474F 48코어 프로세서 하나가 장착된 AMD Turin/Genoa 메인보드와 함께 제공되었습니다. 콜드 플레이트는 그래픽 카드 콜드 플레이트와 동일한 품질로, 견고한 구리로 가공되었으며 스테인리스 스틸 하드웨어로 고정되어 있습니다.
CPU 양쪽에는 최대 2TB의 RAM 구성을 지원하는 8개의 DRAM 슬롯이 있습니다. 저희 리뷰 제품에는 512GB의 DDR5 RAM이 장착되어 있었습니다. 섀시의 GPU 및 CPU 영역 위쪽에는 지지대가 있어 GPU와 같은 민감한 부품을 안전하게 고정하고 운송 중 섀시의 견고성을 유지합니다.
라디에이터 및 팬
냉각은 섀시 후면에 장착된 대형 140mm 트리플 라디에이터와 최대 6,200RPM의 회전 속도와 최대 1,000m³/h의 풍량을 제공하는 140mm 고속 팬 3개로 이루어집니다. 두꺼운 라디에이터의 촘촘한 핀 구조는 플랫폼에 설계된 열 관리 여유 공간을 보여주며, 본 테스트 구성에서는 최대 6.5kW의 지속적인 열을 효과적으로 발산하도록 설계되었습니다.
아마도 가장 놀라운 점은 이러한 작업 부하와 팬 속도에도 불구하고 장치가 허용 가능한 소음 수준을 유지한다는 것입니다. 최대 속도에서도 소음 수준은 70dB 이상에 그칩니다. 이는 워크스테이션 기준으로 시끄러운 수준이지만, 소형 전기 용광로에 버금가는 열을 방출하는 시스템임을 감안하면 상당히 억제된 수준입니다. 이는 코미노의 액체 냉각 루프가 구성 요소에서 발생하는 열을 얼마나 효과적으로 발산하는지를 보여줍니다.
전면 패널 및 원격 측정 디스플레이
전면 패널의 LED 디스플레이는 펌프 상태, 주변 공기 온도, 냉각수 온도 및 팬 속도를 포함한 주요 원격 측정 데이터를 실시간으로 표시합니다. 사용자는 냉각 모듈의 조명 버튼을 사용하여 메뉴를 탐색할 수 있으며, 짧게 누르면 사용 가능한 데이터를 스크롤할 수 있습니다. PB2 버튼을 길게 누르면 명령, 서비스 설정 및 이벤트 로그를 포함한 추가 메뉴 분기가 열립니다. 또한 전면 I/O 패널에는 디스플레이 출력을 위한 VGA 포트와 함께 시리얼 포트, 여러 개의 USB 포트 및 주변 장치 연결을 위한 네트워크 포트가 있습니다.
전력 및 스토리지 아키텍처
전력 공급 및 이중화
이러한 수준의 컴퓨팅 성능을 지원하려면 그에 걸맞게 강력한 전력 공급이 필수적입니다. Grando는 최대 4개의 핫스왑 방식의 1000W 또는 2000W CRPS 모듈을 이중화 구성으로 지원하며, 180~264V에서 최대 8.0kW의 전력을 공급합니다. 7+0, 3+1, 2+2 이중화 모드를 지원하여 PSU 장애 발생 시에도 AI 및 HPC 워크로드를 24시간 내내 안정적으로 실행할 수 있습니다.
저희가 리뷰한 제품은 Great Wall 2000W 80 Plus Platinum 핫스왑 파워 서플라이 4개가 장착되어 총 8.0kW 구성으로 배송되었습니다.
각 GPU로의 전원 공급은 GPU 어레이와 메인 케이블 라인 사이에 장착된 중앙 집중식 12핀 전원 분배 보드를 통해 이루어집니다. Grando는 이 분배 보드를 사용하여 들어오는 전원을 통합한 다음, 공간 효율적인 방식으로 각 GPU로 전원을 분기합니다.
PCIe, 스토리지 및 네트워킹
Grando는 슬롯 대역폭을 저하시키지 않고 6개의 GPU를 안정적으로 지원하며, 최대 밀도를 위해 8개의 카드 구성까지 확장 가능합니다. Comino에 탑재된 ASRock Rack GENOAD8X-2T/BCM 마더보드는 7개의 x16 슬롯과 1개의 x8 슬롯을 제공하여, 8개의 GPU 중 7개는 최대 x16 대역폭으로, 나머지 1개는 x8 대역폭으로 작동합니다. 이는 단일 소켓 CPU가 지원할 수 있는 PCIe 레인 수와 Comino가 PCIe 스위치 플레이트의 크기, 비용 및 복잡성을 추가하지 않으려는 의도 사이의 절충안입니다. 듀얼 소켓 마더보드를 사용하면 더 많은 PCIe 레인을 확보할 수 있지만, 두 번째 소켓이 공간 제약이 있는 폼 팩터에서 PCIe 슬롯이 차지하는 공간을 차지하게 되므로 슬롯 수는 더 줄어듭니다.
단일 소켓 시스템에서 8개의 GPU를 구동하면 사용 가능한 PCIe 레인의 대부분을 소모하게 되므로 몇 가지 제약 사항이 발생합니다. AMD Genoa 기반의 리뷰 장치는 총 128개의 PCIe Gen 5 레인을 제공합니다. 8개의 GPU가 이 중 120개의 레인을 사용하므로 나머지 8개의 레인은 각 M.2 SSD 슬롯에 4개씩 분배됩니다. 따라서 8개의 GPU와 후면의 두 개의 MCIO 커넥터를 통해 연결된 모든 NVMe 드라이브를 동시에 사용할 수 없습니다. 8개의 GPU를 모두 사용하는 구성에서는 스토리지용으로 사용할 수 있는 M.2 슬롯이 2개뿐입니다. 최대 GPU 밀도와 함께 추가 NVMe 용량이 필요한 시스템 관리자는 후면 패널 케이지를 통해 핫스왑 NVMe 스토리지를 추가하면 추가 PCIe 레인을 소모하여 시스템의 일부 GPU 용량이 제한될 수 있다는 점을 유의해야 합니다.

ASRock Rack GENOAD8X-2T/BCM 마더보드의 블록 다이어그램으로 CPU, PCIe Gen 5 슬롯, DIMM 채널, M.2 슬롯, BMC, USB, SATA 및 네트워크 연결부를 보여줍니다.
앞서 언급했듯이 스토리지 역시 모듈식으로 확장 가능하지만, 구성에 따라 GPU용 PCIe 레인 예산이 달라질 수 있으므로 사용 목적에 맞게 미리 고려하는 것이 좋습니다. 리뷰 장치의 후면 패널에는 2.5인치 SSD를 최대 4개까지 지원하는 2.5인치 드라이브 케이지가 있으며, 4x7mm 또는 2x15mm 구성으로 장착할 수 있습니다. 또한, 네 번째 파워 서플라이 슬롯 대신 최대 4개의 SSD를 장착할 수 있는 추가 구성 옵션도 제공됩니다. 리뷰 장치는 8개의 GPU를 모두 사용하기 위해 4개의 파워 서플라이 베이가 필요했기 때문에 두 개의 핫스왑 베이 중 첫 번째 베이만 사용할 수 있었습니다. 내부에는 최대 4개의 3.5인치 드라이브, 4개의 2.5인치 15mm 드라이브 또는 최대 12개의 2.5인치 7mm 드라이브를 장착할 수 있는 3.5인치 케이지가 있으며, 구성에 따라 4개의 추가 2.5인치 7mm SSD 슬롯을 사용할 수 있습니다.
네트워킹을 위해 마더보드에는 Broadcom BCM57416 기반의 RJ45 10Gb/s 포트 2개와 전용 기가비트 이더넷 IPMI 관리 포트가 기본으로 제공됩니다. 관리자는 최대 400Gb/s를 지원하는 PCIe NIC를 설치하여 고대역폭 패브릭 연결을 통해 대역폭을 더욱 확장할 수 있습니다. 단, 추가 PCIe NIC는 GPU 슬롯을 차지하므로 시스템에서 지원할 수 있는 최대 GPU 개수가 줄어들 수 있다는 점에 유의해야 합니다.
원격 관리 및 시스템 인텔리전스
하드웨어를 보호하고 성능을 최적화하기 위해 시스템에는 코미노 모니터링 시스템(CMS)이 포함되어 있습니다. 별도의 자율 제어 보드가 CMS를 구동하며 메인 운영 체제와는 독립적으로 서버의 "두뇌" 역할을 합니다. 실제로 이 제어 보드는 공기 및 냉각수 온도, 습도, 냉각수 유량, 저수조 수위 등을 실시간으로 추적하는 다양한 센서의 데이터를 읽습니다. 특히, 이러한 자율 설계 덕분에 CMS는 누출이나 펌프 고장을 감지하면 자체 진단을 수행하고 비상 정지 기능을 작동시켜 고가의 내부 하드웨어 손상을 방지할 수 있습니다.
웹 기반 GUI는 일상적인 관리를 처리하여 관리자에게 CPU와 GPU의 냉각 성능, 가동 시간 및 실시간 에너지 소비량에 대한 명확한 가시성을 제공합니다. 엔터프라이즈 규모 배포의 경우, CMS는 Zabbix, Grafana, InfluxDB와 같은 중앙 집중식 모니터링 도구와 REST API를 통해 연결됩니다. 이러한 기능들을 통해 관리자는 3년의 서비스 간 호환성을 유지하고 고온 환경에서도 열 스로틀링 없이 서버를 최고 효율로 운영할 수 있습니다.
인공지능을 넘어서: 창의적이고 공학적인 응용 분야
본 테스트는 AI 추론 워크로드에 초점을 맞추었지만, 그란도는 상당한 로컬 GPU 컴퓨팅 성능이 필요한 크리에이티브 전문가와 엔지니어에게도 실용적인 역할을 합니다. 8개의 RTX PRO 6000 카드에 탑재된 총 768GB의 VRAM은 기존 워크스테이션 구성으로는 따라올 수 없는 성능을 제공합니다.
특수효과 아티스트와 모션 그래픽 전문가는 방대한 텍스처 세트를 사용하는 복잡한 장면을 VRAM에서 완전히 렌더링할 수 있어 8K 영상이나 고폴리곤 환경을 사용하는 제작 환경에서 흔히 발생하는 디스크 스왑 병목 현상을 없앨 수 있습니다. 전산 유체 역학이나 구조 시뮬레이션을 실행하는 CAD 엔지니어는 모델을 여러 번 분할 실행하지 않고도 전례 없이 복잡한 어셈블리를 처리할 수 있습니다. 멀티 스트림 8K RAW 타임라인으로 작업하는 비디오 편집자, 전체 해상도에서 머신러닝 기반 노이즈 감소를 적용하는 컬러리스트, 클라우드 팜 가용성을 기다리지 않고 로컬에서 패스 트레이싱 최종본을 렌더링하는 3D 아티스트 모두 이러한 GPU 메모리 및 컴퓨팅 밀도의 이점을 누릴 수 있습니다.
Grando는 8개의 GPU를 모두 사용할 필요가 없습니다. Comino는 4개, 6개, 8개의 GPU 구성으로 플랫폼을 제공하며, 모든 변형 모델을 즉시 배송할 수 있습니다. 소규모 스튜디오, 독립 크리에이터 및 엔지니어링 팀은 현재 필요에 맞춰 투자 규모를 조정하는 동시에 작업량이 증가함에 따라 명확한 업그레이드 경로를 유지할 수 있습니다.
플랫폼 선택 시 고려해야 할 사항: 밀도 vs. 확장성
그란도의 컴팩트한 디자인은 표준 4U 크기 내에서 뛰어난 GPU 밀도와 열 관리를 제공하지만, 이러한 밀도에는 배포 전에 이해해야 할 아키텍처상의 절충점이 수반됩니다.
이 섀시는 EATX 및 EEB 폼팩터의 마더보드를 지원하지만, 기존 듀얼 소켓 플랫폼에서 볼 수 있는 확장형 서버 보드는 지원하지 않습니다. 따라서 GPU 어레이 외의 주변 장치에 사용할 수 있는 PCIe 레인 수가 제한됩니다. 8개의 GPU를 사용한 구성에서 AMD EPYC 프로세서의 128개 PCIe Gen 5 레인은 거의 모두 GPU에 사용되어 온보드 10GbE 포트 외에 추가 NVMe 스토리지나 고속 네트워킹에 사용할 수 있는 대역폭이 매우 부족합니다.
이는 Dell, HPE, Supermicro에서 검토한 8개 GPU 플랫폼과는 대조적입니다. 이러한 시스템은 더 큰 섀시, 듀얼 소켓 구성 및 PCIe 스위치 토폴로지를 사용하여 훨씬 더 많은 주변 장치 연결을 지원합니다. 일반적으로 전체 GPU 구성 외에도 4~8개의 추가 NIC 또는 DPU를 수용할 수 있으며, 8개 이상의 핫스왑 NVMe 베이를 갖추고 있어 고대역폭 패브릭 인터커넥트가 필요한 분산 추론 워크로드에 적합합니다.
하지만 이러한 확장된 기능에는 상당한 비용이 수반됩니다. 전력 소모량은 8kW를 초과하고, 열 부하로 인해 전용 데이터 센터 냉각 인프라가 필요합니다. 소음 수준 때문에 특수 목적의 머신룸 외에는 설치할 수 없으며, 기업용 GPU 플랫폼의 지속적인 공급 제약으로 인해 납기가 6개월에서 18개월까지 걸리는 경우가 많습니다.
그란도는 다른 위치를 차지합니다. 신속한 배포, 관리 가능한 운영 환경, 그리고 대규모 분산 학습보다는 추론 또는 크리에이티브 워크로드를 우선시하는 조직에게는 이러한 절충안이 오히려 유리할 수 있습니다. 하드웨어가 지금 당장 필요하고 실제로 작업 가능한 환경을 원하는 팀은, 플랫폼이 도착하더라도 현실적으로 배포할 수 없는 상황에서 기다리는 것보다 그란도의 고밀도 접근 방식이 더 실용적이라고 생각할 수 있습니다.
코미노 그란도 성능 테스트 결과
시스템 구성
- 섀시 : 코미노 그란도
- 마더 보드 : ASRock 랙 GENOAD8X-2T/BCM
- CPU : AMD EPYC 9474F 48C
- 메모리 : 512GB DDR5
- GPU : 8 x NVIDIA RTX PRO 6000
- 스토리지 : M.2 SSD
클로드 코드 서빙 – 미니맥스 M2.5
기존의 단순 LLM 추론 벤치마크를 넘어, 로컬에서 호스팅되는 모델을 사용하여 여러 개의 동시 Claude Code 세션을 처리하는 에이전트 기반 코딩 워크플로에서 이 하드웨어의 성능을 평가하고자 했습니다. 이 사용 사례는 개발팀 생산성과 직접적으로 연결됩니다. 즉, 단일 노드에서 제공되는 AI 코딩 도우미를 얼마나 많은 엔지니어가 동시에 사용할 수 있으며, 그 후 사용자 경험이 저하되는지를 확인하는 것입니다.
이를 검증하기 위해, 중간 정도 난이도의 코딩 문제(예: LRU 캐시 구현, CLI 할 일 관리 애플리케이션 구축, 마크다운 변환기 작성, REST API 구축) 데이터셋을 생성하고, 각 Claude Code 세션을 별도의 Docker 컨테이너에서 로컬 vLLM 서버를 대상으로 실행하는 벤치마크 환경을 구축했습니다. 세션과 추론 엔드포인트 사이에는 투명 프록시가 위치하여 각 Claude Code 인스턴스에 대한 요청별 메트릭을 수집합니다. 사용된 모델은 MiniMax M2.5이며, 시스템의 8개 NVIDIA RTX PRO 6000 GPU에서 vLLM을 통해 제공되었습니다. M2.5는 공개 순위표에서 최고 순위를 차지하는 코딩 모델은 아니지만, 개발자를 포함한 많은 사용자가 로컬에서 실행하는 성능 좋은 모델입니다.
기준점으로, 프로덕션 API 접근에 가장 널리 사용되는 라우팅 서비스 중 하나인 OpenRouter.ai를 통해 Anthropic의 Claude Opus 4.6 평균 출력 처리량을 사용합니다. 이 기준치는 API 요청당 초당 약 37개의 토큰입니다.
우리는 두 가지 핵심 지표를 측정했습니다. 첫째는 Claude Code 세션당 초당 평균 출력 토큰 수(각 개발자가 경험하는 수치)이고, 둘째는 모든 세션에 걸쳐 초당 집계된 출력 토큰 수(서버가 생성하는 총 작업량)입니다.
실험 결과에 따르면, 단일 동시 Claude Code 세션은 사용자당 67.3 tok/s의 처리량과 총 64.7 tok/s의 처리량을 제공합니다. 두 개의 세션에서는 사용자당 처리량이 57.4 tok/s로 다소 감소하는 반면, vLLM의 배치 처리 기능이 오버헤드를 상쇄하기 시작하면서 총 처리량은 95.1 tok/s로 증가합니다. 네 개의 동시 세션에서는 사용자당 49.2 tok/s의 처리량을 유지하여 대화형 코딩 워크플로에 여전히 매우 빠른 응답 속도를 제공하며, 총 처리량은 177.2 tok/s에 도달합니다. 여덟 개의 세션은 총 처리량이 가장 높은 최적 지점으로, 최대 206.7 tok/s를 기록하고, 사용자당 처리량은 38.7 tok/s로 안정되어 실시간 코드 생성 및 반복 작업에 충분한 성능을 제공합니다.
동시 세션이 16개에 도달하면 시스템은 전형적인 배치 처리의 한계를 보여줍니다. 인스턴스별 처리량은 31.1 tok/s로 떨어지고, 총 출력은 105.8 tok/s로 감소합니다. 이는 이 정도의 동시 처리량 수준에서 230B MiniMax M2.5 모델이 8개의 GPU가 감당할 수 있는 한계에 도달하여 각 사용자에게 의미 있는 지연 시간을 발생시키고 있음을 시사합니다. 8개 세션에서 16개 세션으로 증가할 때 총 출력 감소는 스케줄링 비효율성 때문이 아니라, 대규모 MoE 아키텍처가 높은 동시 디코딩 부하에 노출될 때 발생하는 메모리 대역폭 요구량 증가를 반영합니다.
개발자 툴링을 위한 자체 호스팅 AI 인프라를 평가하는 조직에게 Grando는 강력한 선택지가 될 수 있습니다. 최첨단 230B 모델을 실행하는 Grando는 최대 8개의 동시 Claude Code 세션을 안정적으로 처리하며, 진정한 인터랙티브 경험을 제공하는 수준의 처리량을 자랑합니다. 최대 집계 출력 시 사용자당 속도는 38 tok/s를 초과합니다. 4~8명의 엔지니어 팀이 거의 최적의 처리량으로 운영하더라도 응답 속도 저하를 거의 느끼지 못할 것입니다.
액체 냉각 방식 덕분에 기존 GPU 서버가 작동할 수 없는 환경에서도 이 수준의 컴퓨팅 성능을 실용화할 수 있습니다. 시스템은 스타트업 사무실, 소규모 기계실, 또는 개방형 작업 공간의 한쪽 구석에 설치해도 될 만큼 조용하게 작동합니다. 비슷한 GPU 밀도를 가진 공랭식 시스템은 일반적으로 90dB 이상의 소음을 발생시키는데, 이는 전용 데이터 센터 공간이나 최소한 방음 처리가 잘 된 밀폐된 서버실이 필요할 정도로 시끄럽습니다. Grando는 사용하는 팀과 원활하게 공존할 수 있습니다. 완벽한 데이터 지역성, 토큰당 API 비용이 없는 점, 그리고 모델 선택에 대한 완벽한 제어 기능을 통해 데이터 센터 인프라 구축이나 단계적인 비용 증가 없이도 개발팀 성장에 맞춰 확장 가능한 자체 호스팅 환경을 제공합니다.
vLLM 온라인 제공 – LLM 추론 성능
vLLM은 LLM(로지스틱 회귀 모델)을 위한 가장 인기 있는 고처리량 추론 및 서비스 엔진 중 하나입니다. vLLM 온라인 서비스 벤치마크는 동시 요청 환경에서 이 추론 엔진의 실제 서비스 성능을 평가합니다. 실행 중인 vLLM 서버에 요청을 전송하여 프로덕션 워크로드를 시뮬레이션하며, 요청 속도, 입력 및 출력 길이, 동시 클라이언트 수 등의 매개변수를 구성할 수 있습니다. 이 벤치마크는 처리량(초당 토큰 수), 첫 번째 토큰 출력 시간, 출력 토큰당 시간(TPOT) 등의 주요 지표를 측정하여 사용자가 다양한 부하 조건에서 vLLM의 성능을 파악할 수 있도록 지원합니다.
우리는 다양한 아키텍처, 매개변수 스케일, 양자화 전략에 걸친 포괄적인 모델 제품군에서 추론 성능을 테스트하여 다양한 동시성 프로필에서 처리량을 평가했습니다.
결과 요약
| 모델 | 정밀성 | 동일 (256/256) | 사전 충전량 많음(8k/1k) | 디코드 작업량 많음 (1k/8k) |
|---|---|---|---|---|
| Comino Grando (8개의 RTX PRO 6000 Blackwell 탑재) - vLLM 추론 결과 (tok/s, BS=256에서 최고치) | ||||
| GPT-OSS 20B | ep_dp1 | 17,280 | 32,061 | 11,187 |
| GPT-OSS 120B | ep_dp1 | 11,726 | 21,636 | 7,570 |
| 라마 3.1 8B 지시 | FP8 | 12,109 | 20,137 | 7,353 |
| 라마 3.1 8B 지시 | FP4 | 11,954 | 20,206 | 7,239 |
| 라마 3.1 8B 지시 | BF16 | 11,752 | 17,346 | 6,155 |
| Qwen3 코더 30B A3B | FP8 | 10,985 | 16,659 | 4,907 |
| Qwen3 코더 30B A3B | BF16 | 10,588 | 16,680 | 4,829 |
| 미스트랄 스몰 3.1 24V | BF16 | 8,925 | 11,846 | 4,975 |
| 미니맥스 M2.5(230B) | ep_dp1 | 5,753 | 7,357 * | 2,555 |
| 모든 값은 tok/s 단위이며, BS=256에서의 최대 처리량입니다. *MiniMax M2.5 프리필 헤비(prefill-heavy)는 BS=128에서 최대치(7,357 tok/s)를 기록했으며, BS=256에서는 7,141 tok/s였습니다. | ||||
GPT-OSS 120B 및 20B
GPT-OSS 모델 제품군은 코미노 그란도에서 120B 및 20B 구성 모두에서 테스트되었습니다.
GPT-OSS 120B
동일한 작업 부하(256/256) 조건에서 120B 모델은 BS=1에서 268.85 tok/s의 처리량을 제공하고, BS=64에서 6,666.23 tok/s에 도달하며, BS=256에서 최고 11,726.04 tok/s를 기록합니다. 사전 충전량이 많은 조건(8k/1k)에서는 1,375.69 tok/s에서 시작하여 BS=64에서 16,374.19 tok/s, BS=128에서 17,944.55 tok/s까지 상승하고, BS=256에서 최고 21,636.41 tok/s를 기록합니다. 디코딩 작업이 많은 경우(1k/8k) 처리량은 BS=1일 때 196.28 tok/s에서 BS=256일 때 7,569.97 tok/s로 증가하며, 낮은 동시 접속 수준에서 지연 시간이 잘 제어됩니다.
GPT-OSS 20B
20B 모델은 동일한 작업 부하 조건에서 BS=1일 때 334.80 tok/s의 처리량을 제공하고, BS=64일 때 10,303.56 tok/s에 도달하며, BS=256일 때 최고 17,280.12 tok/s를 기록합니다. 프리필이 많은 환경에서는 2,007.90 tok/s에서 시작하여 BS=64일 때 24,990.46 tok/s, BS=128일 때 26,866.25 tok/s까지 상승하며, BS=256일 때 최고 32,060.72 tok/s를 기록하여 두 모델 크기 모두에서 가장 높은 절대 프리필 처리량을 보였습니다. 디코딩 중심의 경우 BS=1일 때 286.08 tok/s에서 BS=256일 때 11,187.36 tok/s로 증가하여 최대 동시 접속 시 120B 대비 약 1.5배의 디코딩 처리량을 제공하면서도 전반적으로 더 낮은 지연 시간을 유지합니다.
Qwen3 Coder 30B A3B 명령어 및 FP8 명령어
Qwen3-Coder-30B-A3B-Instruct 모델은 BF16 및 FP8 정밀도 모두에서 테스트되었습니다.
Qwen3-Coder-30B-A3B-Instruct(BF16)
동일한 작업 부하(256/256) 조건에서 BF16 모델은 BS=8에서 1,902.32 tok/s의 처리량을 보이고, BS=64에서 6,683.58 tok/s에 도달하며, BS=256에서 최고 10,587.56 tok/s를 기록합니다. 사전 충전량이 많은 조건(8k/1k)에서는 BS=1에서 1,256.03 tok/s로 시작하여 BS=64에서 14,400.57 tok/s, BS=128에서 15,308.35 tok/s까지 상승하고, BS=256에서 최고 16,679.52 tok/s를 기록합니다. 디코딩 작업이 많은 경우(1k/8k) 처리 속도는 BS=1일 때 169.19 tok/s에서 BS=256일 때 4,828.82 tok/s로 증가하며, 낮은 동시 접속 수준에서는 지연 시간이 잘 제어됩니다.
Qwen3-Coder-30B-A3B-Instruct(FP8)
FP8 모델은 대부분의 시나리오에서 BF16과 유사한 처리량을 제공하며, 동일한 워크로드에서 BS=64일 때 6,478.54 tok/s, BS=256일 때 최대 10,984.61 tok/s를 기록하여 최대 동시 접속 시 BF16보다 약간 향상된 성능을 보입니다. 사전 처리량이 많은 시나리오에서는 BS=1일 때 987.48 tok/s로 시작하여 BS=64일 때 14,036.46 tok/s, BS=128일 때 15,156.69 tok/s까지 증가하고, BS=256일 때 최대 16,658.98 tok/s를 기록합니다. 디코딩 중심 구성은 BS=1일 때 130.70 tok/s에서 BS=256일 때 4,906.51 tok/s로 증가하며, 최대 동시 접속 시 BF16보다 약간 앞서지만 나머지 동시 접속 범위에서는 두 구성의 성능이 거의 동일하게 유지됩니다.
미스트랄 스몰 3.1 24B 인스트럭션 2503
동일한 작업 부하(256/256) 조건에서, 모델은 BS=8에서 1,598.79 tok/s를 처리하고, BS=64에서 4,713.84 tok/s에 도달하며, BS=256에서 8,925.12 tok/s까지 크게 확장됩니다. 사전 충전량이 많은 조건(8k/1k)에서는 BS=1에서 897.84 tok/s로 시작하여 BS=64에서 9,632.58 tok/s, BS=128에서 11,488.13 tok/s까지 증가하고, BS=256에서 11,846.15 tok/s로 최고치를 기록합니다. 디코딩 작업이 많은 경우(1k/8k) 디코딩 처리량은 BS=1일 때 124.98 tok/s에서 BS=64일 때 2,653.82 tok/s로 증가한 후, 더 높은 동시성 수준에서 눈에 띄게 가속화되어 BS=128에서 4,262.53 tok/s에 도달하고 BS=256에서 4,975.06 tok/s로 최고치를 기록합니다. 이는 모델이 동시성 규모 확장에 따라 강력한 디코딩 처리량을 유지할 수 있음을 반영합니다.
라마 3.1 8B 지시
Llama-3.1-8B-Instruct 모델은 Comino에서 세 가지 정밀도 구성으로 테스트되었으며, 이를 통해 양자화가 이 모델 크기의 처리량에 어떤 영향을 미치는지 명확하게 확인할 수 있었습니다.
Llama 3.1 8B 지침 BF16
동일한 작업 부하(256/256) 조건에서 BF16 모델은 BS=8에서 2,776.42 tok/s, BS=64에서 7,369.01 tok/s, BS=256에서 최고 11,751.56 tok/s의 처리 속도를 보입니다. 프리필 작업이 많은 조건(8k/1k)에서는 BS=1에서 1,645.29 tok/s로 시작하여 BS=64에서 14,990.47 tok/s, BS=128에서 17,140.71 tok/s까지 증가하고, BS=256에서 최고 17,345.80 tok/s를 기록합니다. 디코딩 작업이 많은 조건(1k/8k)에서는 BS=1에서 234.78 tok/s에서 BS=256에서 6,154.73 tok/s까지 처리 속도가 증가합니다.
Llama 3.1 8B 명령어 FP8
FP8 양자화는 모든 시나리오에서 의미 있는 성능 향상을 제공합니다. 동일한 워크로드에서 BS=64일 때 7,530.39 tok/s에 도달하고 BS=256일 때 최대 12,108.98 tok/s를 기록합니다. 프리필 작업이 많은 경우 BS=64일 때 16,546.53 tok/s, BS=128일 때 19,306.49 tok/s까지 상승하며, BS=256일 때 최대 20,137.35 tok/s를 기록하여 최대 동시 접속 시 BF16 대비 약 16%의 성능 향상을 보입니다. 디코딩 작업이 많은 경우 BS=256일 때 최대 7,353.40 tok/s를 기록하며 BF16보다 약 19% 높은 성능을 나타냅니다.
Llama 3.1 8B 명령어 FP4
FP4는 높은 동시 처리량 수준에서 FP8과 매우 유사한 처리량을 제공하지만, 낮은 배치 크기에서는 약간 뒤처집니다. 동일한 작업 부하에서 배치 크기 256일 때 최대 처리량은 11,954.40 tok/s이며, 사전 채우기 작업이 많은 경우 배치 크기 256일 때 최고 처리량은 20,205.57 tok/s로, 최대 동시 처리량에서 FP8을 근소하게 앞섭니다. 디코딩 작업이 많은 경우 배치 크기 256일 때 최고 처리량은 7,239.29 tok/s로, FP8과 몇 퍼센트 차이밖에 나지 않아 처리량을 크게 희생하지 않고 메모리 효율성을 우선시할 때 FP4가 매력적인 선택지가 될 수 있습니다.
미니맥스 M2.5
코미노 그란도에서 테스트한 MiniMax-M2.5 230B는 우리가 사용한 모델 중 가장 크고 까다로운 모델이었습니다.
동일한 작업 부하(256/256) 조건에서, 모델은 BS=1일 때 16.35 tok/s로 시작하여 BS=64에서 2,751.25 tok/s에 도달하고, 동시 접속자 수가 증가함에 따라 크게 확장되어 BS=256에서 5,753.24 tok/s로 정점을 찍습니다. 사전 채우기 작업이 많은 조건(8k/1k)에서는 BS=1일 때 606.97 tok/s로 시작하여 BS=32에서 5,351.02 tok/s, BS=64에서 6,557.92 tok/s까지 꾸준히 증가하고, BS=128에서 7,357.26 tok/s로 정점을 찍은 후 BS=256에서 7,140.74 tok/s로 약간 감소합니다. 이는 BS=128 이상에서는 사전 채우기 처리량이 포화 상태에 가까워짐을 시사합니다. 디코딩 작업이 많은 경우(1k/8k)는 BS=1에서 82.21 tok/s에서 BS=64에서 1,485.28 tok/s까지 꾸준히 증가하며, BS=256에서 2,554.87 tok/s로 최고치를 기록하는데, 이는 지속적인 디코딩 작업 부하에서 230B MoE 아키텍처의 예상 메모리 대역폭 요구 사항을 반영합니다.
맺음말
코미노 그란도는 8개의 NVIDIA RTX PRO 6000 GPU의 잠재력을 최대한 발휘하도록 설계된 시스템입니다. 메인보드 레이아웃을 뒤집은 구조부터 쿨링 시스템, 통합 모니터링 스택에 이르기까지 모든 주요 설계 요소는 GPU가 열이나 전력 제약 없이 최대 600W TDP로 지속적으로 작동할 수 있도록 보장하기 위한 것입니다.
그란도를 매력적으로 만드는 것은 특정 기능 하나가 아니라 시스템 전체의 완벽한 조화입니다. 액체 냉각 시스템은 단순히 덧붙인 것이 아니라 핵심 아키텍처입니다. 전원 공급은 이중화되어 있고 핫스왑이 가능하며, 600W 카드 8개의 4,800W 부하를 감당할 수 있도록 설계되었고 여유 용량도 충분합니다. 모니터링 시스템은 단순히 온도만 보고하는 것이 아니라, 문제가 발생할 경우 하드웨어를 자동으로 보호합니다. 어느 하나 소홀히 여겨진 부분이 없습니다.
성능 수치는 이러한 응집력을 뒷받침합니다. Llama 3.1 8B부터 230B MiniMax M2.5에 이르기까지 다양한 모델에서 Grando는 자체 호스팅 플랫폼으로서 우수한 처리량을 보여주었습니다. Claude Code 동시 실행 테스트를 통해 실질적인 가치를 더욱 명확히 확인할 수 있었습니다. 8명의 엔지니어가 로컬에서 호스팅되는 230B 모델을 대상으로 동시에 에이전트 코딩 세션을 실행하여 대화형 속도를 유지할 수 있으며, 최대 집계 출력 시 사용자당 처리량은 38 tok/s를 초과합니다. 4~8명으로 구성된 팀은 눈에 띄는 성능 저하 없이 거의 최적의 처리량으로 작업할 수 있습니다.
이 구성의 가치는 AI 추론을 넘어섭니다. GPU당 96GB의 VRAM과 고밀도 멀티 GPU 확장성을 갖춘 이 플랫폼은 VFX 렌더링, 대규모 시뮬레이션, 복잡한 CAD 파이프라인을 포함한 고성능 크리에이티브 및 엔지니어링 워크로드에도 적합합니다. 또한, 4개 GPU 또는 2개 GPU 구성으로 축소할 수 있어 워크스테이션급의 고밀도 성능이 필요한 소규모 스튜디오 및 팀에서도 사용할 수 있습니다.
그란도가 이전에 검토했던 엔터프라이즈급 8GPU 플랫폼과 가장 큰 차이점을 보이는 부분은 바로 구축의 실용성입니다. 이러한 시스템들은 더 많은 PCIe 레인 여유 공간, 더 많은 NIC 슬롯, 그리고 더욱 폭넓은 스토리지 연결성을 제공하지만, 전용 데이터 센터 인프라가 필요하고, 8kW가 넘는 전력을 소모하며, 출시까지 1년 이상 소요될 수 있습니다. 그란도는 주변 장치 확장성을 다소 희생하는 대신, 사용자와 같은 공간에서 사용해도 될 만큼 조용하게 작동하고, 주변 환경으로의 발열도 적으며, 지금 바로 출시할 수 있다는 장점을 제공합니다. 최대의 패브릭 연결성보다 빠른 구축과 관리 가능한 운영 환경을 우선시하는 기업에게는 이러한 절충안이 매력적일 것입니다.
제품 페이지 – 코미노 그란도
코미노 구성 도구 – 페이지
순위표: Comino Grando RTX PRO 6000은 로컬 AI용 최고 데스크톱 순위표 에서 Extreme Pick 상을 수상했습니다.




아마존