Storagereview는 최근 리뷰인 " GPU 속도의 스토리지"를 포함하여 여러 프로젝트에서 Graid와 협력해 왔으며, Graid는 계속해서 우리를 감탄하게 합니다. 이번 팟캐스트에서 Brian은 그의 친구이자 Graid Technology의 OEM 및 채널 비즈니스 개발 수석 이사인 Kelley Osburn과 이야기를 나눕니다.
켈리는 OEM 및 채널 판매 전략 개발 및 실행, 주요 파트너십 및 관계 관리, 그리고 회사의 시장 입지 및 매출 확대를 담당합니다. 플래시 메모리, 데이터 스토리지, 가상화, 클라우드, DevOps, 컨테이너/쿠버네티스 분야의 전문 지식을 활용하여 고객과 파트너에게 부가 가치 솔루션을 제공합니다.
Graid Technology는 최소한의 인프라 변경으로 AI 워크로드를 위한 엔터프라이즈급 RAID 기능을 제공합니다. 전용 하드웨어 RAID 카드나 맞춤형 어플라이언스 대신, AE는 소프트웨어 라이선스로 제공되며 기존 NVIDIA GPU의 일부만 사용합니다. 이를 통해 기업은 추가 PCIe 슬롯을 사용하거나, 인프라를 변경하거나, 학습 및 추론 워크로드의 GPU 성능에 큰 영향을 미치지 않고도 엔터프라이즈급 스토리지 성능과 안정성을 확보할 수 있습니다.
브라이언과 켈리는 Graid 솔루션의 기능, 오늘날의 AI 환경에서 Graid 솔루션이 왜 중요한지, 그리고 미래에 대해 자세히 설명합니다.
기존 랙에 GPU를 추가하지 않고도 AI 워크로드의 RAID 성능을 개선하는 데 관심이 있다면 이 팟캐스트가 도움이 될 것입니다.
팟캐스트 전체를 들을 시간이 없다면 5분 분량으로 나누어 놓았으니, 필요한 정보를 쉽게 찾아볼 수 있습니다.
청취자 가이드
왜 Graid인가요? 문제 해결! [00-05]
- 기존 RAID/MD-RAID는 NVMe로 인해 한계에 부딪혔습니다. PCIe Gen4/5/6—심각한 x16 레인 병목 현상.
- 안전하지 않은 임시방편: RAID 0 + 스냅샷/체크포인트는 위험과 관리 부담을 증가시킵니다.
- MD-RAID의 CPU 기반 수학은 앱에서 사이클을 전환합니다. GPU는 병렬 패리티/EC에서 탁월합니다. 수학.
- Grid는 GPU로 부하를 분산하고 피어 투 피어 경로를 사용하므로 데이터가 카드를 우회합니다(x16 초크 없음).
- 일화: 16~44개의 드라이브 서버는 기존 HW RAID의 물리적 레인 불일치를 확대합니다.
앞지르다 “x16 제한” [05-10]
- 저렴한 GPU(A2000/A400)는 데이터 페리가 아닌 교통 경찰 역할을 합니다. P2P NVMe 라우팅입니다.
- 실제 빌드: ~24개 드라이브로 ~200GB/s, 새로운 경로로 서버당 ~300GB/s를 처리합니다.
- 설계상의 균형: 최대 성능을 위해서는 x4 드라이브가 약 24개 필요하고, x2 드라이브가 40개 이상이면 용량/IOPS가 유리합니다.
- 소형 폼 팩터: 저가형 에디션은 최대 12개의 드라이브를 지원하므로 AI 데스크톱에 이상적입니다.
- 농담: "x16보다 어떻게 더 빠를 수 있나요?" 데이터가 GPU를 통과하지 않기 때문입니다.
AI Edition: 기존 컴퓨팅 GPU 사용 [12-15]
- Grid 실행 H100/Blackwell은 이미 소유하고 있습니다. RAID GPU를 위한 추가 슬롯은 없습니다.
- 작은 설치 공간: H100에서 144개 SM 중 약 6개, 유휴 상태일 때 "중단"하여 리소스를 확보합니다.
- GPU 직접 스토리지는 NVMe에서 GPU 메모리로 데이터를 직접 이동합니다(지연 시간/홉 수 감소).
- 400/800G NIC 및 기타 가속기를 위한 중간 라이저 슬롯을 유지하세요.
- 일화: "짐승에게 먹이를 주세요." GPU가 IO로 인해 굶주리는 것을 방지하세요.
실험실 영향 및 가장자리 패턴 [15-20]
- 추론 중에는 초당 토큰에 미치는 영향이 크지 않으며, 저장과 AI가 동시에 최대치를 기록하는 경우는 드뭅니다.
- 엣지 배포: 대규모 캡처, 경량 훈련 및 추론을 위한 2개의 GPU가 장착된 단일 2U.
- 기존 GPU를 Graid와 공유하여 IO 슬롯을 보존합니다.
- 예: YOLO 스타일 야생 동물, 소매 및 기타 즉시 사용 가능한 추론 모델.
- 팁: 버스트 파이프라인에서 저장소 부족을 방지하려면 저장소 크기를 조정하세요.
무결성, 네임스페이스 및 규모 [20-25]
- RAID는 에지에서 더욱 중요합니다. 복원력이 뛰어나 오류 발생 시에도 GPU의 생산성을 유지할 수 있습니다.
- 일시적인 오류: 잘못된 읽기를 감지하고, 즉석 패리티를 기반으로 재구성하고, 데이터를 다시 배치합니다.
- 대규모 네임스페이스: 61/122/256TB급 드라이브는 대규모 보호 풀을 가치 있게 만듭니다.
- NVMe-oF JBOF(RoCE/RDMA)를 통해 확장합니다. 24-96개 이상의 원시 장치에는 여전히 다음이 필요합니다. 소프트웨어 RAID.
- 로드맵: 유연한 보호 도메인을 위한 더 많은 드라이브 수 + 삭제 코딩.
AI를 넘어: 데이터베이스, 스트리밍, 분석 [26-30]
- 데이터베이스/HFT: Redis, Aerospike와 Oracle은 빠르고 일관된 쓰기 기능의 이점을 얻습니다.
- Splunk/로그 수집: 지속적인 처리량으로 인해 저하 및 역압이 방지됩니다.
- 미디어: 여러 대의 8K 스트림 서버를 사용하면 작업 부하에 필요한 총 서버 수를 줄일 수 있습니다.
- 밀도/전력 제약으로 인해 콜로케이션에서 RU당 더 높은 성능이 요구됩니다.
- 재구축: 패리티가 GPU를 통해 흐르고, 지연 시간이 약간 증가하고, 앱에서 거의 보이지 않습니다.
로드맵, PCIe Gen6, 참여 방법 [30-35]
- 소프트웨어 우선: Gen4를 Gen5로 옮기면 Graid가 데이터 경로에 없으므로 성능이 향상됩니다.
- Gen6 플래시(~28GB/s x4)는 병목 지점을 제거해야 할 필요성을 더욱 높입니다.
- 피어투피어 + GPU 오프로드 수학은 HW 교체 없이 새로운 PCIe 세대를 열어줍니다.
- 구매 방법: Dell 카탈로그, Supermicro OEM, 채널(CDW), Amazon.
- Graid를 만나보세요: GTC 워싱턴과 샌호세에 부스를 둔 NVIDIA Inception 파트너입니다.




아마존