StorageReview.com

Podcast n.° 141: Graid ofrece funcionalidad RAID empresarial para cargas de trabajo de IA

Empresa

Storagereview ha colaborado con Graid en numerosos proyectos, incluyendo nuestra reseña más reciente, Almacenamiento a velocidad GPU, y siguen impresionándonos. En este podcast, Brian conversa con su amiga Kelley Osburn, Directora Sénior de Desarrollo de Negocios OEM y de Canales en Graid Technology.

Kelley es responsable de desarrollar y ejecutar la estrategia de ventas para OEM y canales, gestionar alianzas y relaciones clave, y expandir la presencia en el mercado y los ingresos de la empresa. Aprovecha su experiencia en memoria flash, almacenamiento de datos, virtualización, nube, DevOps y contenedores/Kubernetes para ofrecer soluciones de valor añadido a nuestros clientes y socios.

Graid Technology ofrece funcionalidad RAID de nivel empresarial para cargas de trabajo de IA con cambios mínimos en la infraestructura. En lugar de una tarjeta RAID de hardware dedicada o un dispositivo personalizado, AE se ofrece como licencia de software y utiliza solo una pequeña parte de una GPU NVIDIA existente. Esto permite a las organizaciones lograr un rendimiento y una fiabilidad de almacenamiento de nivel empresarial sin consumir ranuras PCIe adicionales, requerir cambios en la infraestructura ni afectar significativamente el rendimiento de la GPU para cargas de trabajo de entrenamiento e inferencia.

Brian y Kelley profundizan en la funcionalidad de la solución Graid, por qué es fundamental en el panorama de inteligencia artificial actual y qué depara el futuro.

Si está interesado en mejorar el rendimiento RAID para cargas de trabajo de IA sin agregar más GPU a sus racks existentes, este podcast le brindará la solución.

Si no tienes tiempo de escuchar el podcast completo, lo hemos dividido en segmentos de cinco minutos para que puedas navegar fácilmente y obtener la información que necesitas.

Guía del oyente

¿Por qué Graid? ¡Problema resuelto! [00 – 05]

  • El RAID/MD-RAID tradicional se topó con un muro con NVMe y PCIe Gen4/5/6: cuellos de botella graves en carriles x16.
  • Medidas provisionales inseguras: RAID 0 + instantáneas/puntos de control aumentan el riesgo y la sobrecarga administrativa.
  • Las matemáticas limitadas por la CPU en MD-RAID desvían los ciclos de las aplicaciones; las GPU se destacan en paridad paralela/EC matemáticas.
  • Graid descarga a la GPU y utiliza rutas peer-to-peer, por lo que los datos pasan por alto la tarjeta (sin estrangulador x16).
  • Anécdota: Los servidores de 16 a 44 unidades magnifican la falta de coincidencia de carriles físicos del RAID de hardware heredado.

Superando “Límites x16” [05 10-]

  • Las GPU asequibles (A2000/A400) actúan como un policía de tránsito, no como un transbordador de datos: enrutamiento NVMe punto a punto.
  • Compilaciones reales: ~200 GB/s con ~24 unidades; las nuevas rutas impulsan ~300 GB/s/servidor.
  • Compensaciones de diseño: ~24 unidades x4 para un rendimiento máximo; 40+ unidades x2 favorecen la capacidad/IOPS.
  • Factor de formato pequeño: la edición de bajo costo admite hasta aproximadamente 12 unidades, ideal para computadoras de escritorio con IA.
  • Broma: "¿Cómo puede ser más rápido que x16?" —porque los datos no pasan por la GPU.

Edición de IA: utilice las GPU de cómputo existentes [12 – 15]

  • Ejecutar Graid en H100/Blackwell, ya lo tienes; no hay ranura adicional para una GPU RAID.
  • Huella pequeña: ~6/144 SM en H100; “se desconecta” cuando está inactivo para liberar recursos.
  • El almacenamiento directo de GPU mueve datos desde NVMe a la memoria de GPU directamente (menor latencia/saltos).
  • Mantenga ranuras de nivel medio para NIC de 400/800G y otros aceleradores.
  • Anécdota: "Alimenta a la Bestia". Evita que las GPU se mueran de hambre en E/S.

Impacto del laboratorio y patrones de borde [15 – 20]

  • Impacto modesto en tokens por segundo durante la inferencia; el almacenamiento y la IA rara vez alcanzan su pico al mismo tiempo.
  • Implementaciones de borde: 2U único con 2 GPU para captura, tren ligero e inferencia a escala.
  • Preserve las ranuras de E/S compartiendo las GPU existentes con Graid.
  • Ejemplos: modelos de inferencia listos para usar, de estilo YOLO, de vida silvestre y de venta minorista, entre otros.
  • Consejo: Dimensione el almacenamiento para evitar la inanición debido a tuberías reventadas.

Integridad, espacios de nombres y escala [20 – 25]

  • RAID es más relevante en el borde: la resiliencia mantiene las GPU productivas durante las fallas.
  • Errores transitorios: detecta lecturas incorrectas, reconstruye desde la paridad sobre la marcha y reubica los datos.
  • Espacios de nombres grandes: las unidades de clase 61/122/256 TB hacen que los grupos protegidos de gran tamaño sean valiosos.
  • Escalado a través de NVMe‑oF JBOF (RoCE/RDMA); 24–Más de 96 dispositivos sin procesar aún requieren RAID de software.
  • Hoja de ruta: mayor cantidad de unidades + codificación de borrado para dominios de protección flexibles.

Más allá de la IA: bases de datos, streaming y análisis [26 – 30]

  • Bases de datos/HFT: Redis, Aerospike y Oracle se benefician de escrituras rápidas y consistentes.
  • Ingesta de Splunk/log: el rendimiento sostenido evita caídas y contrapresión.
  • Medios: Los servidores de transmisión multi-8K pueden reducir la cantidad total de servidores para una carga de trabajo.
  • Las restricciones de densidad/potencia favorecen un mayor rendimiento por RU en las colocaciones.
  • Reconstrucciones: la paridad fluye a través de la GPU; ligero aumento de latencia, rara vez visible en la aplicación.

Hoja de ruta, PCIe Gen6, cómo participar [30 35-]

  • Software primero: mover Gen4 a Gen5 mejora el rendimiento ya que Graid no está en la ruta de datos.
  • La memoria flash Gen6 (~28 GB/s x4) aumenta la necesidad de eliminar puntos de estrangulamiento.
  • Las matemáticas peer-to-peer + descargadas de GPU desbloquean nuevas generaciones de PCIe sin pérdida de hardware.
  • Cómo comprar: Catálogo de Dell, Supermicro OEM, canales (CDW) y Amazon.
  • Conozca a Graid: un socio de NVIDIA Inception con stands en GTC Washington y San José.

Interactuar con StorageReview

Boletín informativo | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Canal RSS

harold fritts

He estado en la industria de la tecnología desde que IBM creó Selectric. Mi experiencia, sin embargo, es la escritura. Así que decidí dejar el negocio de preventa y volver a mis raíces, escribir un poco pero seguir involucrado en tecnología.