StorageReview.com

IBM Spyre Accelerator: Inferencia de baja latencia para IA generativa y agente en IBM Z, LinuxONE y Power

Empresa  ◇  Server

IBM ha presentado IBM Spyre Accelerator, un motor de inferencia de baja latencia diseñado para IA generativa y agente, donde la capacidad de respuesta, la seguridad y el tiempo de actividad son esenciales. Spyre está diseñado para empresas que buscan integrar la IA con sus sistemas de registro existentes, permitiendo que los datos confidenciales permanezcan en la plataforma sin comprometer el rendimiento.

La disponibilidad general comienza el 28 de octubre para IBM z17 y LinuxONE 5, y Power11 estará disponible a principios de diciembre. El acelerador es un SoC de 5 nm y 32 núcleos, integrado en una tarjeta PCIe de 75 vatios. IBM admite clústeres de hasta 48 tarjetas por sistema IBM Z o LinuxONE y hasta 16 tarjetas por sistema IBM Power, lo que permite el escalado horizontal para la inferencia multimodelo junto con cargas de trabajo transaccionales, como la detección de fraudes, la automatización del comercio minorista y la calificación de riesgos. Spyre representa la producción de la investigación del Centro de Hardware de IA de IBM, optimizada para implementaciones locales donde la localización de datos, la seguridad y la eficiencia energética son requisitos fundamentales.

Acelerador IBM Spyre

De las tuberías lógicas a la IA agente

Los flujos de trabajo empresariales se están alejando de las cadenas lógicas deterministas hacia una IA agencial que percibe el contexto, planifica y actúa en tiempo real. Estos sistemas agenciales requieren inferencia de baja latencia y una calidad de servicio predecible, incluso cuando los sistemas centrales mantienen altos volúmenes de transacciones. El enfoque de IBM consiste en ubicar hardware de inferencia dedicado directamente en las plataformas donde ya residen los datos críticos. Mantener los datos en IBM Z, LinuxONE y Power reduce el riesgo y la sobrecarga de cumplimiento normativo al evitar la salida innecesaria de datos y el procesamiento externo. Ejecutar inferencia generativa y agencial cerca de los datos también minimiza la red de retorno y la variabilidad inducida por la red, que es a menudo donde se infiltra la latencia de cola. El objetivo general es incorporar la toma de decisiones basada en IA a los flujos OLTP, por lotes y de mensajería existentes sin comprometer el rendimiento, las ventanas de cambio ni los niveles de servicio.

Arquitectura de Spyre

Spyre es un sistema en chip (SoC) comercial desarrollado a partir de prototipos creados por IBM Research. Construido con un proceso de 5 nm con 25.6 millones de transistores y 32 núcleos aceleradores, está optimizado para la inferencia concurrente de baja latencia en lugar del entrenamiento de modelos. El dispositivo se entrega como una tarjeta PCIe complementaria de 75 vatios, lo que ofrece a los equipos de infraestructura un modelo de implementación y servicio familiar.

Arquitectura del acelerador IBM Spyre

IBM ha diseñado configuraciones de escalabilidad horizontal que permiten hasta 48 tarjetas en un sistema IBM Z o LinuxONE 5 y hasta 16 tarjetas en un sistema IBM Power11, lo que permite la gestión multimodelo y el aislamiento de inquilinos en una única plataforma. En cuanto al software, Spyre se integra con la pila empresarial de IBM para la gestión de modelos, la seguridad y la observabilidad, mientras que Power añade un catálogo con un solo clic para agilizar la implementación de servicios. Esta combinación está diseñada para acelerar la obtención de valor, manteniendo los servicios de IA dentro de los límites operativos y de cumplimiento normativo existentes.

Integración de plataforma

IBM Z y LinuxONE: ubicación conjunta con Telum II

En z17 y LinuxONE 5, Spyre opera junto con el complejo de procesadores Telum II para mantener la inferencia corresidente con los datos transaccionales y los flujos de eventos. Esta configuración preserva los dominios de seguridad y los registros de auditoría existentes, esenciales en entornos regulados. Al ejecutar la inferencia localmente, las organizaciones minimizan las conexiones a aceleradores externos y evitan que la latencia adicional afecte los SLA de las transacciones. El sistema puede escalar hasta 48 tarjetas, admitiendo múltiples modelos y cargas de trabajo simultáneamente. Proporciona un aislamiento lógico para satisfacer las necesidades de diversas unidades de negocio o requisitos regulatorios. Esto es especialmente relevante para flujos de pago, prevención de fraude, gestión de reclamaciones y eventos de la cadena de suministro, donde cada milisegundo cuenta y no es deseable ampliar el perímetro de cumplimiento.

IBM Power11: Servicios de IA basados ​​en catálogos y sinergia MMA

En los servidores Power11, Spyre se integra con un catálogo de servicios de IA diseñado para una rápida adopción en las infraestructuras Power establecidas. Los administradores pueden implementar servicios con un solo clic, adaptándose a la forma en que los clientes de Power tradicionalmente operan middleware, análisis y aplicaciones de línea de negocio. La integración de Spyre con el acelerador MMA integrado de Power mejora la conversión de datos y el rendimiento del preprocesamiento, etapas cruciales para las canalizaciones de IA generativa y las integraciones de procesos complejos.

IBM cita un ejemplo de rendimiento: con un tamaño de solicitud de 128, el sistema puede procesar más de ocho millones de documentos para la integración de bases de conocimiento en aproximadamente una hora. Para las empresas que desarrollan sistemas RAG o realizan búsquedas empresariales a gran escala, la prioridad es acelerar la preparación e ingesta de datos, más que solo la etapa de inferencia. El ajuste general se dirige a sectores mixtos, como la fabricación, el comercio minorista, la atención médica y las implementaciones con un alto nivel de ERP, donde la previsibilidad del rendimiento y la capacidad de servicio son clave.

Del Centro de hardware de IA de IBM a las implementaciones de campo

Spyre demuestra cómo IBM transforma la investigación en productos prácticos. La tecnología comenzó como un prototipo desarrollado por IBM Research y posteriormente maduró mediante implementaciones iterativas de clústeres en el campus de Yorktown Heights y colaboraciones con el Centro de Sistemas de Inteligencia Artificial Emergentes de la Universidad de Albany. Posteriormente, IBM Infrastructure materializó el diseño para IBM Z, LinuxONE y Power, alineando el silicio con los requisitos empresariales, como seguridad, fiabilidad, gestión del ciclo de vida y facilidad de servicio. Los ejecutivos de IBM describen a Spyre como una infraestructura para IA multimodelo, con énfasis en el escalado seguro y resiliente de cargas de trabajo generativas y agénticas en plataformas que ya cuentan con datos y transacciones clave.

El valor de Spyre es inseparable de la estrategia operativa de IBM. Al ejecutar inferencias donde se crean y gestionan los datos, las organizaciones limitan la salida de datos y reducen la complejidad del cumplimiento normativo. IBM Z y LinuxONE ofrecen capacidades de criptografía, aislamiento, registro y auditoría que ya forman parte integral de los marcos regulatorios de muchos clientes. Power aporta una robusta pila de seguridad y gestión, ideal para análisis mixtos y entornos transaccionales. La compatibilidad con clústeres, el particionamiento lógico y las herramientas de observabilidad de primera mano se alinean con las normas operativas de mainframe y Power, lo que permite implementar, supervisar y gestionar servicios de IA como cualquier otra carga de trabajo de primer nivel. Para muchos compradores de los sectores financiero, sanitario y público, estas garantías operativas prevalecen sobre las pruebas TOPS sin procesar o los benchmarks sintéticos.

Consideraciones de rendimiento y escalabilidad

Aunque IBM no ha publicado detalles completos sobre el rendimiento de cada modelo, los indicadores arquitectónicos son evidentes. Spyre se centra en rutas de inferencia de baja latencia optimizadas para bucles de agente y canalizaciones basadas en eventos, donde la concurrencia y el control de la latencia de cola son más importantes que el rendimiento máximo por sí solo. El escalado horizontal mediante clústeres de tarjetas PCIe permite a los equipos dimensionar las implementaciones para el servicio multimodelo, el aislamiento de inquilinos y el crecimiento futuro sin necesidad de rediseñar la plataforma.

En Power, la combinación MMA-Spyre acelera la preparación y conversión de datos, lo que suele dominar el tiempo de extremo a extremo para RAG y la búsqueda empresarial. Las empresas deben estructurar las pruebas de concepto para reflejar las condiciones de producción: tamaños de modelo y ventanas de tokens, concurrencia de solicitudes, interacción con cargas transaccionales y telemetría para la latencia de cola en contención.

Barry Baker, director de operaciones de IBM Infrastructure y director general de IBM Systems, destacó el enfoque de la compañía en el desarrollo de infraestructura para cargas de trabajo de IA emergentes. Destacó el papel del Acelerador Spyre en la mejora de los sistemas para soportar IA multimodelo, incluyendo la IA generativa y la inteligencia artificial. Añadió que esta innovación busca permitir a los clientes escalar cargas de trabajo de IA críticas de forma segura, resiliente y eficiente, a la vez que maximizan el valor de los datos empresariales.

Mukesh Khare, director general de IBM Semiconductors, señala que IBM lanzó su Centro de Hardware de IA en 2019 para abordar las crecientes demandas computacionales de la IA, incluso antes del reciente auge de la IA. Celebra la comercialización del primer chip del centro, diseñado para mejorar el rendimiento de los mainframes y servidores de IBM.

Casos de uso

Los equipos de servicios financieros pueden utilizar Spyre para la detección de fraude en tiempo real, que opera directamente con los conjuntos de datos de la plataforma, lo que permite actualizar modelos y políticas sin ampliar el perímetro de auditoría. En el sector minorista y logístico, los asistentes de agente pueden coordinar las decisiones de inventario y cumplimiento con tiempos de respuesta consistentes, manteniendo la inferencia local en los sistemas operativos. Las organizaciones sanitarias y gubernamentales pueden implementar resúmenes generativos y soporte de decisiones dentro de estrictas restricciones de privacidad y residencia, evitando la transferencia de datos que, de otro modo, generaría trabajo de cumplimiento adicional. En entornos industriales y con un alto nivel de ERP, Spyre puede impulsar la automatización de procesos y la detección de anomalías cerca de SAP, Oracle y los sistemas de telemetría de planta que se ejecutan en Power, lo que garantiza un comportamiento determinista y la facilidad de mantenimiento.

El equipo de liderazgo de Infraestructura de IBM presenta a Spyre como una infraestructura fundamental para la transición a la IA, diseñada para soportar cargas de trabajo generativas y de agencia multimodelo a escala empresarial con sólidas garantías de seguridad y resiliencia. El equipo de liderazgo de IBM Semiconductors describe a Spyre como el primer hito de comercialización del Centro de Hardware de IA, anticipando un ritmo continuo de innovación en hardware para los clientes de mainframes y servidores de IBM.

Resumen Final

Spyre es la solución local de IBM para la inferencia de baja latencia en entornos que no pueden comprometer la seguridad, la fiabilidad ni la localización de los datos. La escalabilidad del hardware, las integraciones nativas de la plataforma y el modelo operativo se alinean con los sistemas IBM Z, LinuxONE y Power que buscan IA generativa con el mismo alcance que las transacciones principales. El siguiente paso para los compradores es la evidencia: pruebas de concepto que validen las ventajas de latencia, concurrencia y gobernanza bajo cargas de trabajo reales. Si el rendimiento en campo se ajusta a las especificaciones, Spyre ofrece una vía pragmática para integrar IA generativa y generativa directamente en sistemas de misión crítica.

Disponibilidad

Spyre estará disponible para IBM z17 y LinuxONE 5 a partir del 28 de octubre. Los sistemas IBM Power11 recibirán Spyre a principios de diciembre. Este lanzamiento escalonado ofrece a los clientes de mainframe y LinuxONE la vía más temprana para la inferencia en la plataforma, y ​​los sistemas Power seguirán poco después.

Interactuar con StorageReview

Boletín informativo | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Canal RSS

harold fritts

He estado en la industria de la tecnología desde que IBM creó Selectric. Mi experiencia, sin embargo, es la escritura. Así que decidí dejar el negocio de preventa y volver a mis raíces, escribir un poco pero seguir involucrado en tecnología.