에퀴닉스는 NVIDIA와의 파트너십을 확장하고 Together AI와 새로운 협력을 체결하여 Equinix Inference Exchange를 출시했습니다. 기업 환경에 최적화된 분산형 AI 추론 아키텍처로 설계된 이 플랫폼은 컴퓨팅 워크로드를 핵심 데이터 저장소, 최종 사용자 및 운영 애플리케이션에 더 가깝게 이동시키는 것을 목표로 합니다. 에퀴닉스 호라이즌 행사에서 Equinix Fabric One과 함께 발표된 이 프로젝트는 NVIDIA의 엔터프라이즈 하드웨어 아키텍처, Together AI의 오픈 소스 모델 플랫폼, 그리고 에퀴닉스의 글로벌 상호 연결 인프라를 결합하여 지연 시간, 데이터 주권 및 네트워크 병목 현상을 해결합니다.
분산 추론 및 데이터 중력 문제 해결
기업의 AI 프로젝트가 프로토타입 검증 단계에서 고처리량 생산 단계로 전환됨에 따라, 추론 배치 위치는 전체 비용, 응답 지연 시간 및 규정 준수 상태에 큰 영향을 미칩니다. 모델 실행 위치를 데이터 소스에 더 가깝게 이동하면 퍼블릭 클라우드 간 데이터 백홀링 비용을 절감하는 동시에 예측 가능한 지연 시간 프로파일을 제공할 수 있습니다. 그러나 서로 다른 환경에 분산된 인프라를 관리하는 것은 운영 오버헤드와 네트워킹 복잡성을 야기합니다.
에퀴닉스는 77개 주요 도시에 걸쳐 280개 이상의 데이터 센터, 230개의 클라우드 온램프, 그리고 10,500개 이상의 상호 연결된 기업 네트워크를 활용하여 이러한 운영상의 어려움을 해결합니다. 상위 10대 AI 모델 제공업체 중 8곳과 상위 10대 AI 클라우드 중 9곳이 이미 에퀴닉스 시설에서 운영되고 있으므로, 이 플랫폼은 분산된 AI 파이프라인을 위한 중립적인 통합 계층 역할을 합니다.
아키텍처 및 스택 통합
Equinix Inference Exchange 스택은 컴퓨팅, 소프트웨어 및 물리적 인프라에 걸쳐 세 가지 계층으로 구성됩니다.
Equinix는 기본 물리적 및 상호 연결 기반을 관리합니다. 여기에는 전력 공급, 고급 액체 냉각 기능, 시설 운영, 그리고 Equinix Fabric을 통한 네트워크, 공용 클라우드 및 SaaS 플랫폼과의 프라이빗 상호 연결이 포함됩니다.
NVIDIA는 컴퓨팅 및 참조 검증 계층을 제공하여 높은 토큰 처리량과 쿼리당 추론 비용 절감을 위해 설계된 엔터프라이즈 AI 인프라를 제공합니다.
Together AI는 200개 이상의 오픈 소스 모델을 지원하는 추론 서비스 소프트웨어 계층을 제공합니다. 이 플랫폼은 일반적인 컴퓨팅 효율성을 위한 공유 멀티테넌트 환경과 격리된 용량이 필요한 워크로드를 위한 전용 단일 테넌트 토폴로지를 모두 지원합니다.
Equinix Fabric을 통해 트래픽을 라우팅함으로써 플랫폼은 지역 사용자의 최초 토큰 획득 시간(TTFT) 지표를 줄이는 동시에 온프레미스 스토리지와 모델 엔드포인트 간에 프라이빗 피어링 경로를 설정합니다.
엔터프라이즈 배포 목표 및 가용성
이 플랫폼은 세 가지 주요 배포 토폴로지를 지원합니다. 메트로-엣지 추론의 경우, 기업은 로컬 메트로 허브에서 모델을 실행하여 중앙 집중식 관리 및 전용 상호 연결을 유지하면서 지연 시간이 짧은 API 응답을 제공할 수 있습니다. 오픈 소스 모델 마이그레이션의 경우, 이 아키텍처는 폐쇄형 독점 API에서 오픈 소스 기반 모델로의 전환을 위한 마찰 없는 경로를 제공하여 벤더 종속성을 줄이고 기존 네트워크 인프라를 활용할 수 있도록 합니다. 국가 주도 AI 및 규정 준수 요구 사항의 경우, 분산형 레이아웃을 통해 규제 대상 기업은 추론 실행 및 데이터 처리를 특정 지리적 경계 내에서 유지하여 엄격한 데이터 상주 및 거버넌스 요구 사항을 충족할 수 있습니다.
에퀴닉스, 엔비디아, 투게더 AI의 경영진은 이번 통합을 통해 컴퓨팅 성능과 운영 민첩성의 균형을 맞춘 벤더 중립적인 고처리량 추론 패브릭이 구축되었다고 언급했습니다.
Equinix Inference Exchange는 2027년 1분기에 기업용으로 정식 출시될 예정입니다.




아마존