StorageReview.com

IBM과 AMD, IBM 클라우드에서 Zyphra의 Frontier 모델 학습 지원

AI  ◇  기업

IBM과 AMD는 샌프란시스코에 기반을 둔 오픈소스 AI 연구 및 제품 회사인 Zyphra에 첨단 AI 인프라를 제공하기 위한 다년간의 협력 계약을 체결했습니다. 이 계약에 따라 IBM은 최첨단 멀티모달 기반 모델 학습을 위해 IBM 클라우드에 AMD Instinct MI300X GPU 로 구성된 대규모 전용 ​​클러스터를 제공하여 , 현재 이용 가능한 가장 야심찬 생성형 AI 학습 환경 중 하나를 구축할 예정입니다.

협업을 통한 추진력

이번 협력의 가장 중요한 측면 중 하나는 퍼블릭 클라우드 GPU 인프라에 엔터프라이즈급 규모를 도입하는 것입니다. 이 프로젝트는 AMD Instinct MI300X GPU를 사용하는 IBM 클라우드 최초의 대규모 전용 ​​학습 클러스터를 구축하는 것을 목표로 합니다. AMD Pensando Pollara 400 AI NIC와 Pensando Ortano DPU를 추가하여 데이터 플레인 가속 및 효율적인 동서 네트워킹을 통해 고처리량 학습 워크로드에 최적화된 네트워크 패브릭을 구축함으로써 성능을 더욱 강화했습니다. IT 관리자와 CTO에게 이 구성은 엔터프라이즈 배포에서 요구되는 확장성, 오케스트레이션 및 SLA를 유지하면서 GPU 집약적인 AI 학습 작업을 관리형 클라우드 서비스로 실행할 수 있는 가능성을 제시합니다.

AMD 인스팅트 mi300x

오픈 생태계의 추진력 또한 중요합니다. Zyphra는 고립된 채 개발하는 것이 아니라 오픈 소스 및 오픈 사이언스 정신을 바탕으로 운영되고 있습니다. Zyphra는 자사의 인프라를 활용하여 신경망 아키텍처, 장기 기억 시스템, 그리고 지속적 학습 기법 연구를 수행하고 있습니다. 이러한 방식은 AI 전반에 유익할 뿐만 아니라, 기업들에게 기존의 블랙박스 모델보다 더 높은 투명성, 재현성, 그리고 라이선스 관련 명확성을 제공합니다. 오픈소스라는 측면은 AI 투자 전략을 평가하면서도 불투명하고 독점적인 솔루션에 대한 경계심을 갖는 기업들에게 다운스트림 기회를 창출할 수 있습니다.

또 다른 핵심 요소는 공급망과 로드맵의 연계입니다. 대규모 GPU 용량 확보는 AI 개발에서 가장 심각한 병목 현상 중 하나가 되었습니다. Zyphra는 IBM 및 AMD와 협력하여 제품 로드맵 및 납품 일정에 대한 초기 협업을 진행하여 신속한 배포 일정과 함께 가속기에 대한 안정적인 접근을 확보했습니다. 초기 클러스터는 9월에 가동되었으며, 2026년 용량 확장을 위한 계획적인 계획을 수립했습니다. 기업 기술 리더들에게 이는 GPU 로드맵 계획에 대한 미래 지향적인 접근 방식을 시사합니다. 단기 실험과 시간이 지남에 따라 더 복잡한 모델 학습 주기로 확장할 수 있는 역량의 균형을 맞추는 것입니다.

IBM Cloud

 

지프라 프로그램

Zyphra는 최근 1억 달러 규모의 시리즈 A 투자 유치를 확정했습니다. 이는 Zyphra의 사명에 대한 투자자들의 신뢰를 보여주는 초기 지표입니다. Zyphra는 이 자금을 바탕으로 오픈 소스 및 오픈 사이언스 원칙에 기반한 선도적인 "슈퍼 인텔리전스" 연구실을 설립할 계획입니다. IBM 클라우드의 새로운 인프라는 이러한 노력의 핵심입니다. AMD Instinct 가속기로 구동되는 Zyphra의 모델은 언어, 비전, 오디오 모달리티를 아우르며, 범용 슈퍼 에이전트인 Maia를 뒷받침하는 파이프라인으로 통합됩니다. 이를 통해 워크플로우 자동화, 관련 정보 표시, 전반적인 생산성 향상을 통해 기업의 지식 근로자를 지원하도록 설계된 플랫폼이 탄생할 것입니다.

지파

IBM 및 AMD와의 기술 협약을 통해 Zyphra는 훈련 요구 사항이 증가함에 따라 컴퓨팅 역량을 확장할 수 있습니다. 인프라를 고정된 자산으로 취급하는 대신, 이 협업은 지속적인 확장, GPU 공급, 클라우드 오케스트레이션, 그리고 고급 네트워킹을 하나의 통합 솔루션으로 통합하는 데 중점을 둡니다. 이러한 상위 호환성은 예측 가능한 비용을 발생시키고 모델에 대한 안정적인 액세스를 유지하면서도 더 크고 정교한 모델을 훈련하려는 AI 기업들에게 중요한 차별화 요소입니다.

건축 하이라이트

배포의 핵심은 컴퓨팅입니다. AMD Instinct MI300X GPU는 대규모 환경에서 멀티모달 AI 학습에 필요한 대량의 데이터 흐름을 처리하도록 설계된 고성능 고대역폭 메모리 아키텍처를 제공합니다. 각 GPU 클러스터는 고밀도 부동 소수점 워크로드에 최적화되어 있으며, 기업이 운영 비용을 평가할 때 점점 더 중요하게 고려하는 와트당 성능 지표에 맞춰 조정됩니다.

네트워킹과 데이터 플레인 또한 이 이야기의 핵심입니다. AMD Pensando Pollara 400 AI NIC와 Ortano DPU를 활용하여 Zyphra 환경은 수천 개의 GPU에 워크로드를 더욱 효율적으로 분산시켜 대규모 클러스터의 동서 트래픽에서 발생하는 병목 현상을 해소합니다. 하드웨어 오프로드는 네트워크 처리량을 가속화하고 정책 관리, 원격 측정 및 보안 적용을 지원하여 높은 수요 상황에서도 워크로드가 예측 가능하게 실행되도록 보장합니다.

AMD 펜산도 DPU

IBM Cloud는 기반 계층에서 보안, 거버넌스 및 규정 준수를 위한 엔터프라이즈급 기능을 갖춘 오케스트레이션 환경을 제공합니다. 이러한 기능을 통해 Zyphra는 엔터프라이즈 AI가 데이터 주권, 감사 가능성 및 서비스 연속성과 관련하여 점점 더 엄격해지는 요구 사항을 충족해야 하는 환경을 헤쳐나갈 수 있습니다. 실제로 IBM Cloud는 CTO가 프로덕션급 배포 환경에서 기대하는 운영 제어 기능을 제공하여 AMD의 컴퓨팅 및 네트워킹 스택을 보완합니다.

Zyphra의 관점에서 볼 때, 이번 협력은 컴퓨팅 가속기부터 네트워킹 패브릭까지 완전히 통합된 스택을 최초로 성공적으로 구현한 사례로, AMD 실리콘을 탑재한 IBM 클라우드에서 완벽하게 구동됩니다. Zyphra의 경영진은 이 인프라를 개방적이고 기업 친화적인 환경에서 프런티어 모델을 구축하는 발판으로 보고 있으며, 더 나아가 초지능의 개발 및 적용 방식에 영향을 미치겠다는 더 큰 포부를 가지고 있습니다.

Zyphra의 CEO 겸 회장인 크리틱 푸탈라스는 AMD 및 IBM 클라우드와의 협력이 컴퓨팅부터 네트워킹까지 아우르는 풀스택 학습 플랫폼을 IBM 클라우드에 성공적으로 통합한 최초의 사례라고 강조했습니다. Zyphra는 AMD 실리콘을 활용한 프론티어 모델 개발을 주도하여 오픈소스 및 엔터프라이즈급 슈퍼 인텔리전스를 발전시키는 것을 목표로 합니다.

IBM 클라우드 총괄 매니저인 앨런 피콕은 기존 기업과 신생 기업 모두 더 나은 ROI를 달성하기 위해 AI 워크로드를 빠르고 효율적으로 확장하는 것의 중요성을 강조했습니다. 그는 IBM이 AMD와 협력하여 모델 학습을 가속화하는 확장 가능하고 비용 효율적인 AI 인프라를 개발함으로써 Zyphra의 전략적 성장을 지원하고 있다고 강조했습니다.

AMD는 이번 협력을 AI 인프라 설계의 이정표로 삼았습니다. 필립 귀도(Philip Guido) 부사장 겸 최고상업책임자(CCO)는 IBM의 기존 엔터프라이즈 클라우드 생태계와 AMD의 컴퓨팅 가속 기술의 통합을 업계의 모범 사례로 제시했습니다. AMD에게 이번 계약은 고성능 컴퓨팅 분야뿐만 아니라 대규모 추론 효율과 멀티모달 작업을 지원하는 시스템을 통해 실제 AI 결과를 구현하는 데 있어서도 자사의 리더십을 강조하는 것입니다.

운영 모델

이 배포의 첫 번째 단계는 9월 초에 서비스를 시작했으며, 이를 통해 Zyphra는 IBM Cloud에서 대용량 AMD Instinct MI300X 클러스터에 가장 먼저 접근한 조직 중 하나가 되었습니다. 이러한 즉각적인 가용성은 대규모 멀티모달 모델 학습에 대한 단기 수요를 충족하여 Zyphra가 신속하게 반복 작업을 시작할 수 있도록 지원합니다.

앞으로 이 협력은 2026년 컴퓨팅 및 네트워킹 리소스 확장의 토대를 마련할 것입니다. 이러한 단계적 출시는 AI 워크로드 확장의 현실을 반영합니다. 즉, 데이터 세트 크기, 모델 복잡성, 그리고 실험 주기에 따라 학습 요구 사항이 지속적으로 증가할 것입니다. 멀티모달 AI의 발전을 모니터링하는 CTO들은 2026년 확장을 용량 계획에 대한 전략적 약속으로 간주하여 Zyphra, IBM, AMD가 장기적인 협력 관계를 유지할 수 있도록 할 것입니다.

전략

Zyphra 협력은 IBM과 AMD 간의 더욱 광범위한 전략적 제휴를 기반으로 합니다. 작년에 양사는 IBM 클라우드에 AMD Instinct MI300X 가속기를 서비스로 구축하기 시작했으며, 안정적인 성능, 전력 효율성, 그리고 엔터프라이즈급 서비스 제공을 위한 노력을 강조했습니다. 서비스 중심 구축에서 대규모 전용 ​​클러스터로 전환함으로써 Zyphra 프로그램은 더욱 맞춤화되고 용량이 풍부한 클라이언트 솔루션으로의 발전을 보여줍니다.

IBM과 AMD는 양자 중심 슈퍼컴퓨팅과 같은 차세대 아키텍처 분야로 협력을 확대하고 있습니다. IBM은 양자 시스템 및 알고리즘 분야에서 세계적인 리더십을 확보하고 있으며, AMD는 고성능 컴퓨팅 및 AI 가속 전문 기술을 제공합니다. 이 통합 로드맵은 대규모 컴퓨팅의 한계를 뛰어넘고, 오늘날의 GPU와 미래의 양자 프로세서를 아우르는 통합 엔터프라이즈 인프라라는 장기적인 비전을 더욱 강화하도록 설계되었습니다.

IT 및 CTO의 결과

교육 효율성과 총소유비용(TCO)이 가장 중요한 고려 사항입니다. 기업은 MI300X와 Pensando가 대규모 멀티모달 워크로드에서 얼마나 효과적으로 확장되는지, 특히 GPU당 초당 토큰 수, 상호 연결 성능, 작업당 비용 예측 가능성과 같은 주요 지표를 면밀히 모니터링해야 합니다.

통합 패턴 또한 주목할 만합니다. Zyphra 구축은 데이터 스테이징, 체크포인팅, 관측 가능성 및 피처 저장소가 IBM Cloud 내에서 어떻게 통합되는지 보여줍니다. AI 로드맵을 평가하는 조직에게 이러한 패턴은 참조 아키텍처로 활용될 수 있습니다.

보안과 거버넌스 또한 핵심입니다. 표준 모델은 종종 수십억 개의 매개변수와 페타바이트 규모의 데이터를 포괄하므로, IT 리더는 프로그래밍 가능한 NIC와 DPU가 다중 GPU 클러스터 내에서 보안 격리, 원격 측정 및 세부적인 정책 시행에 어떻게 기여하는지 평가해야 합니다.

하이브리드 및 멀티클라우드 유연성은 또 다른 차원을 보여줍니다. Zyphra의 환경은 현재 IBM Cloud에서 실행되지만, 최적화된 NIC, DPU, 오케스트레이션 계층과 같은 아키텍처 옵션은 하이브리드 환경을 지원하도록 설계되었습니다. 이는 기업에게 여러 클라우드에서 워크로드 이식성, 데이터 지역성, 복원력을 통해 ROI를 유지할 수 있는 잠재적인 청사진을 제공합니다.

마지막으로, IT 의사 결정권자들은 Zyphra의 오픈소스 릴리스를 주시해야 합니다. 오픈 사이언스에 전념하는 기업으로서 Zyphra는 학습 레시피, 모델 및 벤치마크를 공유할 것으로 예상됩니다. 이를 통해 기업은 도메인별 모델 미세 조정, 검색 증강 생성(RAG) 파이프라인 구축, 또는 프로덕션 워크로드에서 멀티모달 AI 접근 방식의 효율성 평가 등을 위한 평가 기회를 얻을 수 있습니다.

주요 테이크 아웃

기업 IT 분야의 기술 의사 결정권자들에게 Zyphra 구축은 단일 고객사 확보 이상의 의미를 지닙니다. GPU 공급, 네트워킹 오프로드, 그리고 엔터프라이즈 클라우드 인프라가 어떻게 조화를 이루어 프런티어 AI 모델 학습을 위한 지속 가능한 파이프라인을 구축할 수 있는지 보여주는 참고 사례입니다. IBM Cloud가 오케스트레이션을 담당하고 AMD 실리콘이 고밀도 컴퓨팅 및 고급 네트워킹을 제공하는 이 협업은 대규모 학습 환경에서 성능, 비용, 그리고 안정성에 대한 기대치를 새롭게 정의합니다.

StorageReview에 참여

뉴스레터 | 유튜브 | 팟캐스트 ( 아이튠즈 / 스포티파이) | 인스타그램 | 트위터 | 틱톡 | RSS 피드

해롤드 프리츠

저는 IBM이 Selectric을 만든 이후로 기술 산업에 종사해 왔습니다. 하지만 내 배경은 글쓰기입니다. 그래서 저는 프리세일즈 사업에서 벗어나 제 뿌리로 돌아가서 약간의 글을 쓰지만 여전히 기술 분야에 참여하기로 결정했습니다.