A Storagereview já trabalhou com a Graid em diversos projetos, incluindo nossa análise mais recente, " Storage at GPU Speed" (Armazenamento na Velocidade da GPU), e eles continuam a nos impressionar. Neste podcast, Brian conversa com sua amiga, Kelley Osburn, Diretora Sênior de Desenvolvimento de Negócios para OEMs e Canais da Graid Technology.
Kelley é responsável por desenvolver e executar a estratégia de vendas OEM e de canal, gerenciar parcerias e relacionamentos importantes e expandir a presença de mercado e a receita da empresa. Ele utiliza sua expertise em memória flash, armazenamento de dados, virtualização, nuvem, DevOps e contêineres/Kubernetes para fornecer soluções de valor agregado aos nossos clientes e parceiros.
A Graid Technology oferece funcionalidade RAID de nível empresarial para cargas de trabalho de IA com alterações mínimas na infraestrutura. Em vez de uma placa RAID de hardware dedicada ou de um dispositivo personalizado, o AE é oferecido como uma licença de software e utiliza apenas uma pequena parte de uma GPU NVIDIA existente. Isso permite que as organizações alcancem desempenho e confiabilidade de armazenamento de nível empresarial sem consumir slots PCIe adicionais, exigir alterações na infraestrutura ou impactar significativamente o desempenho da GPU para cargas de trabalho de treinamento e inferência.
Brian e Kelley analisam a funcionalidade da solução Graid, por que ela é essencial no cenário atual de IA e o que o futuro reserva.
Se você estiver interessado em melhorar o desempenho do RAID para cargas de trabalho de IA sem adicionar mais GPUs aos seus racks existentes, este podcast pode ajudar.
Se você não tiver tempo para ouvir o podcast inteiro, nós o dividimos em segmentos de cinco minutos para que você possa facilmente alternar entre eles e obter as informações necessárias.
Guia do ouvinte
Por que Graid? Problema resolvido! [00 – 05]
- O RAID/MD-RAID tradicional atingiu um obstáculo com o NVMe e PCIe Gen4/5/6 — gargalos rígidos de x16 pistas.
- Soluções paliativas inseguras: RAID 0 + snapshots/checkpoints aumentam o risco e a sobrecarga administrativa.
- A matemática limitada pela CPU no MD-RAID desvia ciclos de aplicativos; GPUs se destacam em paridade paralela/EC matemática.
- O Graid é descarregado para a GPU e usa caminhos ponto a ponto, de modo que os dados ignoram a placa (sem bloqueio x16).
- Anedota: servidores de 16 a 44 unidades ampliam a incompatibilidade de faixas físicas do RAID de hardware legado.
Ultrapassando “limites x16” [05-10]
- GPUs acessíveis (A2000/A400) atuam como guardas de trânsito, não como transportadores de dados — roteamento NVMe ponto a ponto.
- Construções reais: ~200 GB/s com ~24 unidades; novos caminhos impulsionam ~300 GB/s/servidor.
- Compensações de design: ~24 unidades x4 para desempenho máximo; mais de 40 unidades x2 favorecem capacidade/IOPS.
- Formato pequeno: a edição de baixo custo suporta até ~12 unidades, ideal para desktops de IA.
- Brincadeira: “Como pode ser mais rápido que x16?” — porque os dados não passam pela GPU.
Edição AI: use GPUs de computação existentes [12 – 15]
- Execute Graid em H100/Blackwell, você já tem; sem slot extra para uma GPU RAID.
- Pequena pegada: ~6/144 SMs no H100; “desaparecem” quando ociosos para liberar recursos.
- O GPU Direct Storage move dados do NVMe diretamente para a memória da GPU (menor latência/saltos).
- Mantenha slots mid-riser para NICs 400/800G e outros aceleradores.
- Anedota: “Alimente a Besta”. Evite que as GPUs morram de fome no IO.
Impacto do laboratório e padrões de borda [15 – 20]
- Impacto modesto de tokens/s durante a inferência; armazenamento e IA raramente atingem o pico ao mesmo tempo.
- Implantações de ponta: 2U único com 2 GPUs para captura, treinamento leve e inferência em escala.
- Preserve slots de E/S compartilhando GPUs existentes com o Graid.
- Exemplos: modelos de inferência de vida selvagem no estilo YOLO, varejo e outros modelos prontos para uso.
- Dica: dimensione o armazenamento para evitar escassez sob tubulações estouradas.
Integridade, namespaces e escala [20 – 25]
- O RAID é mais relevante na borda: a resiliência mantém as GPUs produtivas durante falhas.
- Erros transitórios: detecte leituras ruins, reconstrua a partir da paridade em tempo real e realoque dados.
- Grandes namespaces: unidades de 61/122/256 TB tornam grandes pools protegidos valiosos.
- Dimensionamento por meio de JBOFs NVMe-oF (RoCE/RDMA); 24-Mais de 96 dispositivos brutos ainda requerem RAID de software.
- Roteiro: Maiores contagens de unidades + codificação de eliminação para domínios de proteção flexíveis.
Além da IA: bancos de dados, streaming, análises [26 – 30]
- Bancos de dados/HFT: Redis, Aerospike e Oracle se beneficiam de gravações rápidas e consistentes.
- Ingestão de Splunk/log: a taxa de transferência sustentada evita quedas e contrapressão.
- Mídia: Servidores de fluxo múltiplo de 8K podem reduzir a contagem total de servidores para uma carga de trabalho.
- Restrições de densidade/potência favorecem maior desempenho por RU em colocations.
- Reconstruções: a paridade flui pela GPU; ligeiro aumento de latência, raramente visível no aplicativo.
Roteiro, PCIe Gen6, como se envolver [30-35]
- Software em primeiro lugar: mover Gen4 para Gen5 aumenta o desempenho, já que o Graid não está no caminho de dados.
- O flash Gen6 (~28 GB/s x4) amplia a necessidade de remover pontos de estrangulamento.
- A matemática peer-to-peer + GPU offload desbloqueia novas gerações de PCIe sem rotatividade de hardware.
- Como comprar: catálogo Dell, Supermicro OEM, canais (CDW) e Amazon.
- Conheça a Graid: uma parceira da NVIDIA Inception com estandes na GTC Washington e San Jose.




Amazon