StorageReview.com

NVIDIA Run:ai: 엔터프라이즈 GPU 효율성 극대화

AI  ◇  기업

AI 인프라는 자원 소모가 심한 것으로 악명 높으며, 기업들은 GPU 활용 최적화라는 과제에 끊임없이 직면해 왔습니다. 델 테크놀로지스는 자사의 AI 팩토리 플랫폼을 통해 NVIDIA가 최근 인수한 오케스트레이션 솔루션인 Run:ai를 통합하여 이러한 문제를 해결하고 있습니다 . 델은 최근 블로그 게시물 에서 Run:ai가 어떻게 자원 활용을 극대화하고 AI 결과물을 가속화하여 기업들이 대규모로 GPU 자원을 배포하고 관리하는 방식을 혁신하는지 강조했습니다.

Dell NVIDIA 클러스터

Dell NVL72 클러스터

Run:ai는 정확히 무엇인가요?

Run:ai는 쿠버네티스 기반의 오케스트레이션 플랫폼으로, GPU 중심 워크로드를 위해 특별히 설계되었습니다. 2018년에 설립된 Run:ai는 GPU의 비효율적인 사용이라는 업계의 만연한 과제를 해결하며 주목을 받았습니다. 기존에는 AI 워크로드에 할당된 GPU가 유휴 상태이거나 활용도가 낮은 경우가 많았습니다. Run:ai는 GPU 리소스를 동적으로 풀링하고 지능적으로 스케줄링하여 부분적인 GPU 할당, 효율적인 다중 GPU 배포, 그리고 하이브리드, 클라우드 및 온프레미스 환경 전반의 원활한 관리를 가능하게 함으로써 이 문제를 해결합니다.

엔비디아 런:AI가 뭐예요?

NVIDIA는 Run:ai가 AI 인프라를 획기적으로 변화시킬 잠재력을 갖고 있음을 인식하고 2024년 12월 약 7억 달러에 이 회사를 인수했습니다 . 특히 NVIDIA는 Run:ai를 최종적으로 오픈소스로 공개하겠다고 발표하며, 자사 하드웨어 플랫폼을 넘어 광범위한 생태계 확산을 촉진하겠다는 의지를 밝혔습니다. 이러한 움직임은 업계 전반의 혁신과 효율성 향상을 더욱 가속화할 것으로 기대됩니다.

리소스 관리에 대한 심층적인 기술적 관점을 원하는 사용자를 위해 NVIDIA 문서에서는 Run:ai가 GB200 NVL72 시스템에서 워크로드를 오케스트레이션하는 데 얼마나 중요한지 자세히 설명합니다. 이 문서에서는 중요한 문제점을 지적합니다. Kubernetes는 NVIDIA의 MNNVL 아키텍처를 기본적으로 인식하지 못하기 때문에 이러한 고성능 도메인 전반에 걸쳐 워크로드를 관리하고 스케줄링하는 것이 더 복잡해집니다. Run:ai는 NVLink 도메인을 자동으로 감지하고 분산 워크로드 제출을 간소화하여 이러한 복잡성을 해소합니다. 이를 통해 Pod가 NVLink 인터커넥트가 있는 노드에 올바르게 배치되므로 하드웨어에 대한 심층적인 지식이나 각 작업에 대한 수동 구성이 필요하지 않습니다. 이러한 기능은 플랫폼이 밀집된 교육 환경에서 운영을 간소화하고 조직이 GB200 NVL72와 같은 고급 하드웨어 구성의 성능을 최대한 활용할 수 있도록 지원하는 방법을 보여줍니다.

이것이 기업에 중요한 이유

특히 생성형 AI 및 대규모 언어 모델과 같이 GPU 집약적인 워크로드를 실행하는 조직의 경우, GPU 활용률 저하는 투자 낭비라는 상당한 위험을 초래합니다. Run:ai는 이러한 비효율성을 직접적으로 해결하며, NVIDIA에 따르면 이 플랫폼을 활용하는 조직은 GPU 활용률이 최대 5배까지 향상될 수 있습니다.

이러한 수준의 최적화는 ROI를 향상시킬 뿐만 아니라 운영 효율성을 근본적으로 개선합니다. 이전에는 제한된 리소스와 복잡한 스케줄링 프로세스로 제약을 받았던 팀들이 이제 하드웨어에 대한 추가 자본 지출 없이 더 많은 모델을 동시에 배포하고, 빠르게 확장하고, 더욱 공격적으로 실험할 수 있는 도구를 갖추게 되었습니다. 이러한 방법론은 대규모 HPC 배포에서는 일반적이지만, GPU 활용도를 극대화하는 데 필요한 수준의 효율성은 기업에서는 상대적으로 낮습니다.

광범위한 산업 모멘텀

여러 주요 인프라 제공업체가 이 플랫폼을 채택하고 있으며, 이는 기업 IT 환경 전반에 걸쳐 성장세가 확대되고 있음을 보여줍니다.

델 은 Run:ai를 비롯한 NVIDIA 기술을 핵심으로 하는 AI 팩토리 프레임워크를 지속적으로 확장하고 있습니다. 델의 Run:ai 활용 사례는 기업이 분산된 수동 리소스 할당 방식에서 벗어나 다중 테넌트 환경 전반에서 효율성을 높이는 동적이고 자동화된 스케줄링으로 전환하는 방법을 보여줍니다.

HPE는 GreenLake Marketplace의 일부로 Run:ai를 제공하며, 이를 Ezmeral 플랫폼과 통합하여 고급 GPU 스케줄링, 부분 할당 및 하이브리드 인프라 오케스트레이션을 지원합니다. 이를 통해 고객은 더욱 정밀하고 확장 가능한 방식으로 AI 워크로드를 배포하고 관리할 수 있습니다.

시스코는 Run:ai를 자사의 UCS X-시리즈 서버 및 Intersight 클라우드 운영 플랫폼과 통합했습니다. 이 솔루션은 할당량 관리, GPU 부분 공유 및 실시간 모니터링 기능을 통해 온프레미스 환경에서 대규모 AI 배포를 지원합니다.

NVIDIA Run:AI 파트너

Run:ai 파트너 중 일부만 소개했습니다. NVIDIA는 위에서 볼 수 있듯이 광범위한 로고 목록을 보유하고 있습니다. 전반적으로 주요 OEM 및 클라우드 플랫폼 제공업체들이 더욱 혁신적이고 효율적인 AI 인프라 솔루션을 제공하기 위해 Run:ai와 협력하고 있습니다.

 

StorageReview에 참여

뉴스레터 | 유튜브 | 팟캐스트 ( 아이튠즈 / 스포티파이) | 인스타그램 | 트위터 | 틱톡 | RSS 피드

브라이언 빌러

Brian은 오하이오주 신시내티에 있으며 StorageReview.com의 수석 분석가이자 사장입니다.