StorageReview.com

Qumulo y Cisco impulsan la liquidez de las GPU con un acelerador de IA en la nube actualizado.

Cloud  ◇  Empresa

Qumulo anunció Cloud AI Accelerator, una nueva arquitectura diseñada para mejorar la eficiencia de la infraestructura de IA empresarial eliminando los cuellos de botella en el movimiento de datos. La plataforma presenta conjuntos de datos distribuidos a los recursos de GPU en tiempo real a través de regiones, nubes y entornos híbridos sin necesidad de replicación ni almacenamiento temporal.

Esta versión se basa en una ineficiencia bien documentada en la infraestructura de IA empresarial. Citando el Informe sobre el estado de la optimización de Kubernetes de 2026 de Cast AI, Qumulo señala que la utilización promedio de GPU en las empresas ronda el 5 %, mientras que el 95 % restante de la capacidad de cómputo acelerado permanece inactivo, ya que los datos deben prepararse, replicarse y ubicarse antes de que puedan comenzar las cargas de trabajo. El CEO de Qumulo, Doug Gourlay, describió el problema en el anuncio: «Todas las empresas con las que hablamos se centran en la disponibilidad de GPU, pero la disponibilidad es solo la mitad del problema. El problema de fondo es la utilización, y el culpable es la gravedad de los datos».

Repensando la ubicación de los datos para cargas de trabajo de IA

Los enfoques tradicionales para la infraestructura de IA ubican el almacenamiento junto con los clústeres de GPU, a menudo utilizando sistemas flash de alto rendimiento estrechamente integrados con la computación. Si bien este modelo es eficaz durante el entrenamiento o la inferencia, no gestiona los períodos de inactividad debidos a la preparación de datos. Además, crea silos de almacenamiento fragmentados, ya que las empresas replican conjuntos de datos en diferentes entornos para mantenerlos cerca de la computación.

El enfoque de Qumulo modifica el modelo al desacoplar la ubicación de los datos de la ubicación de procesamiento. En lugar de transferir los datos a las GPU, el Acelerador de IA en la Nube permite que las GPU accedan a los datos directamente en su ubicación. Esto se logra mediante una arquitectura de datos distribuida que proporciona acceso consistente y en tiempo real a los conjuntos de datos, independientemente de su ubicación física.

Gráfico de la plataforma de datos en la nube de Qumulo

La empresa describe esta capacidad como una forma de “liquidez de GPU”, que permite programar las cargas de trabajo en función de la capacidad de cómputo disponible, en lugar de las restricciones de ubicación de los datos. En la práctica, esto permite a las empresas utilizar recursos de GPU en múltiples nubes o regiones sin necesidad de preposicionar los datos.

Arquitectura: Estructura de datos y capa de almacenamiento en caché

Cloud AI Accelerator integra tres productos de Qumulo que antes se comercializaban por separado. Cloud Native Qumulo (CNQ) es el sistema de archivos de Qumulo que se ejecuta de forma nativa en AWS, Azure, Google Cloud y Oracle Cloud Infrastructure. Cloud Data Fabric (CDF), lanzado en febrero de 2025, proporciona un repositorio central de archivos y objetos con cachés coherentes en el borde. NeuralCache, añadido a CDF en abril de 2025, aplica aprendizaje automático al almacenamiento en caché predictivo de lectura y escritura, y Qumulo afirma que reduce los tiempos de carga de datos de la GPU hasta en un 64 %. Cloud AI Accelerator se presentó por primera vez en noviembre de 2025; la versión del 26 de mayo añade conectividad directa a Microsoft AI Foundry, AWS Bedrock y Google Vertex AI, formaliza el posicionamiento de "liquidez de GPU" y combina el producto con Cisco para implementaciones híbridas.

Qumulo cloud data fabric

La ruta de datos se ejecuta a nivel de bloque desde los sitios de origen (clústeres locales, regiones en la nube, réplicas entre regiones o almacenamiento respaldado por CNQ S3) hasta la caché DRAM de la CPU del acelerador y, posteriormente, directamente a las GPU. Esta arquitectura mantiene una única fuente de información veraz en entornos locales, de borde y multinube, y evita la replicación masiva, lo que reduce tanto la sobrecarga de almacenamiento como la complejidad de la sincronización.

Este diseño también permite la integración con servicios de IA gestionados. Las empresas pueden conectar conjuntos de datos existentes directamente a plataformas como Microsoft AI Foundry, AWS Bedrock y Google Vertex AI sin necesidad de copiar los datos a esos entornos.

Impacto operativo: Reducción del tiempo de inactividad y la complejidad.

La principal ventaja operativa reside en la eliminación de las demoras en la preparación de datos. En muchos flujos de trabajo de IA, la preparación de datos puede tardar días o semanas, lo que retrasa el entrenamiento de los modelos y reduce la utilización efectiva de la GPU. Al permitir el acceso inmediato a los conjuntos de datos, el Acelerador de IA en la Nube permite que las cargas de trabajo comiencen tan pronto como haya capacidad de procesamiento disponible.

Esto también reduce la necesidad de mantener múltiples entornos de almacenamiento. En lugar de crear silos de datos separados para cada clúster de GPU o región de nube, las organizaciones pueden operar desde un único conjunto de datos lógico. Esto simplifica la gestión de datos y reduce la proliferación de infraestructuras.

Desde el punto de vista de los costos, el modelo se centra en el gasto de GPU inactivas. Al eliminar la necesidad de precargar datos en el almacenamiento conectado a la GPU, las empresas pueden reducir el tiempo que las GPU pasan esperando datos, lo que mejora el retorno de la inversión general en computación acelerada.

Integración de Cisco para infraestructura de IA híbrida

Cisco es el socio estratégico para la comercialización de esta solución híbrida. Cisco UCS proporciona la infraestructura informática local, mientras que las soluciones de red y seguridad de Cisco integran la arquitectura de datos. Juntos, Qumulo y Cisco posicionan la oferta como una infraestructura que se adapta en minutos a la disponibilidad cambiante de las GPU, lo que, según argumentan, es lo que hace que la liquidez de las GPU sea práctica a escala empresarial.

Esta integración es fundamental en ambos sentidos. Proporciona a Qumulo una vía validada para integrarse en entornos Cisco UCS y ofrece a Cisco una solución de almacenamiento para clientes de IA híbrida que desean que los datos permanezcan en sus instalaciones mientras la capacidad de procesamiento se escala en proveedores de hiperescalabilidad. La red de alto rendimiento y baja latencia es el elemento clave, ya que el acceso a los datos in situ depende de una transmisión consistente entre los sitios.

Modelo de disponibilidad y despliegue

Qumulo Cloud AI Accelerator ya está disponible en AWS, Microsoft Azure, Google Cloud y Oracle Cloud Infrastructure, con soporte para implementación híbrida en entornos Cisco UCS. Qumulo y Cisco estarán presentes en Cisco Live 2026 en Las Vegas, en el stand n.° 4018, del 31 de mayo al 4 de junio, donde se exhibirá su oferta conjunta.

Este lanzamiento refleja un cambio más amplio en el diseño de la infraestructura de IA hacia arquitecturas centradas en los datos. A medida que la capacidad de procesamiento acelerado sigue superando la infraestructura que la alimenta, mejorar su utilización dependerá de reducir el tiempo que las GPU pasan esperando datos. La apuesta de Qumulo es que hacer que el conjunto de datos sea universalmente accesible, en lugar de móvil, es un enfoque más duradero que añadir más memoria flash a cada clúster de GPU.

Interactuar con StorageReview

Boletín informativo | YouTube | Podcast iTunes/Spotify | Instagram | Twitter | TikTok | RSS Feed

harold fritts

He estado en la industria de la tecnología desde que IBM creó Selectric. Mi experiencia, sin embargo, es la escritura. Así que decidí dejar el negocio de preventa y volver a mis raíces, escribir un poco pero seguir involucrado en tecnología.