ArmazenamentoReview.com

Qumulo e Cisco promovem liquidez de GPU com acelerador de IA em nuvem atualizado.

Na nuvem  ◇  Empreendimento

A Qumulo anunciou o Cloud AI Accelerator, uma nova arquitetura projetada para melhorar a eficiência da infraestrutura de IA empresarial, eliminando gargalos na movimentação de dados. A plataforma apresenta conjuntos de dados distribuídos para recursos de GPU em tempo real em diferentes regiões, nuvens e ambientes híbridos, sem a necessidade de replicação ou armazenamento temporário.

O lançamento se baseia em uma ineficiência bem documentada na infraestrutura de IA empresarial. Citando o Relatório de Otimização do Kubernetes de 2026 da Cast AI, a Qumulo aponta para uma utilização média de GPUs em empresas de cerca de 5%, com os 95% restantes da capacidade computacional acelerada ociosa, pois os dados precisam ser preparados, replicados e posicionados antes que as cargas de trabalho possam ser iniciadas. O CEO da Qumulo, Doug Gourlay, descreveu o problema no anúncio: “Todas as empresas com as quais conversamos estão focadas na disponibilidade de GPUs, mas a disponibilidade é apenas metade do problema. A questão mais profunda é a utilização, e o culpado é a gravidade dos dados.”

Repensando o posicionamento de dados para cargas de trabalho de IA

As abordagens tradicionais para infraestrutura de IA alocam armazenamento junto a clusters de GPUs, frequentemente utilizando sistemas flash de alto desempenho fortemente acoplados à computação. Embora eficaz durante treinamento ou inferência ativos, esse modelo não lida bem com períodos ociosos devido à preparação de dados. Além disso, cria silos de armazenamento fragmentados, já que as empresas replicam conjuntos de dados em diferentes ambientes para mantê-los próximos aos recursos de computação.

A abordagem da Qumulo muda o modelo ao desacoplar a localização dos dados da localização do processamento. Em vez de mover os dados para as GPUs, o Cloud AI Accelerator permite que as GPUs acessem os dados localmente. Isso é possível graças a uma infraestrutura de dados distribuída que fornece acesso consistente e em tempo real aos conjuntos de dados, independentemente de sua localização física.

Gráfico da plataforma de dados em nuvem Qumulo

A empresa descreve essa capacidade como a habilitação da “liquidez de GPU”, permitindo que as cargas de trabalho sejam agendadas com base na capacidade computacional disponível, em vez de restrições de localização de dados. Na prática, isso permite que as empresas usem recursos de GPU em várias nuvens ou regiões sem a necessidade de pré-posicionamento de dados.

Arquitetura: Malha de Dados e Camada de Cache

O Cloud AI Accelerator é uma integração de três produtos da Qumulo que antes eram comercializados separadamente. O Cloud Native Qumulo (CNQ) é o sistema de arquivos da Qumulo que funciona nativamente na AWS, Azure, Google Cloud e Oracle Cloud Infrastructure. O Cloud Data Fabric (CDF), lançado em fevereiro de 2025, fornece um repositório central de arquivos e objetos com caches coerentes na borda. O NeuralCache, adicionado ao CDF em abril de 2025, aplica aprendizado de máquina ao cache preditivo de leitura e gravação, e a Qumulo afirma que ele reduz o tempo de carregamento de dados da GPU em até 64%. O próprio Cloud AI Accelerator foi lançado em novembro de 2025; a versão de 26 de maio adiciona conectividade direta com o Microsoft AI Foundry, AWS Bedrock e Google Vertex AI, formaliza o posicionamento de "liquidez de GPU" e integra o produto com a Cisco para implantações híbridas.

Qumulo cloud data fabric

O fluxo de dados ocorre em nível de bloco, desde os sites de origem (clusters locais, regiões na nuvem, réplicas entre regiões ou armazenamento com suporte CNQ S3) até o cache DRAM da CPU do acelerador e, em seguida, diretamente para as GPUs. Essa arquitetura mantém uma única fonte de verdade em ambientes locais, de borda e multicloud, evitando a replicação em massa, o que reduz a sobrecarga de armazenamento e a complexidade da sincronização.

Este design também suporta a integração com serviços de IA gerenciados. As empresas podem conectar conjuntos de dados existentes diretamente a plataformas como Microsoft AI Foundry, AWS Bedrock e Google Vertex AI, sem precisar copiar os dados para esses ambientes.

Impacto operacional: Redução do tempo ocioso e da complexidade

O principal benefício operacional é a eliminação dos atrasos na preparação de dados. Em muitos fluxos de trabalho de IA, a preparação de dados pode levar dias ou semanas, atrasando o treinamento do modelo e reduzindo a utilização efetiva da GPU. Ao permitir o acesso imediato aos conjuntos de dados, o Cloud AI Accelerator possibilita que as cargas de trabalho sejam iniciadas assim que houver disponibilidade de recursos computacionais.

Isso também reduz a necessidade de manter vários ambientes de armazenamento. Em vez de criar silos de dados separados para cada cluster de GPU ou região de nuvem, as organizações podem operar a partir de um único conjunto de dados lógico. Isso simplifica o gerenciamento de dados e reduz a expansão da infraestrutura.

Do ponto de vista de custos, o modelo visa reduzir o tempo ocioso das GPUs. Ao eliminar a necessidade de pré-carregar dados no armazenamento conectado à GPU, as empresas podem reduzir o tempo que as GPUs passam aguardando dados, melhorando o retorno geral do investimento em computação acelerada.

Integração da Cisco para infraestrutura de IA híbrida

A Cisco é a parceira conjunta de entrada no mercado para a estratégia de implantação híbrida, com o Cisco UCS fornecendo a infraestrutura de computação local e a Cisco oferecendo soluções de rede e segurança que envolvem a estrutura de dados. Juntas, a Qumulo e a Cisco posicionam a oferta como uma infraestrutura que se adapta em minutos à disponibilidade variável de GPUs, o que, segundo elas, torna a liquidez de GPUs viável em escala empresarial.

Essa integração é crucial em ambas as direções. Ela oferece à Qumulo um caminho validado para ambientes Cisco UCS e fornece à Cisco uma solução de armazenamento para clientes de IA híbrida que desejam manter os dados em infraestruturas locais enquanto a computação é escalada em hiperescaladores. Redes de alta taxa de transferência e baixa latência são o elemento fundamental aqui, já que o acesso aos dados depende de um transporte consistente entre os sites.

Modelo de disponibilidade e implantação

O Qumulo Cloud AI Accelerator já está disponível na AWS, Microsoft Azure, Google Cloud e Oracle Cloud Infrastructure, com suporte para implantação híbrida em ambientes Cisco UCS. A Qumulo e a Cisco estarão presentes no Cisco Live 2026 em Las Vegas, no estande nº 4018, de 31 de maio a 4 de junho, onde a oferta conjunta será apresentada.

O lançamento reflete uma mudança mais ampla no design da infraestrutura de IA em direção a arquiteturas centradas em dados. À medida que a capacidade de computação acelerada continua a superar a infraestrutura que a alimenta, a melhoria da utilização dependerá da redução do tempo que as GPUs passam aguardando dados. A aposta da Qumulo é que tornar o conjunto de dados universalmente acessível, em vez de móvel, é a abordagem mais duradoura do que adicionar mais memória flash a cada cluster de GPUs.

Envolva-se com a StorageReview

Newsletter | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Feed RSS

Haroldo Fritts

Estou na indústria de tecnologia desde que a IBM criou a Selectric. Minha formação, porém, é escrever. Então decidi sair do negócio de pré-vendas e voltar às minhas raízes, escrevendo um pouco, mas ainda envolvido com tecnologia.