IBM ha presentato IBM Spyre Accelerator, un motore di inferenza a bassa latenza progettato per l'intelligenza artificiale generativa e agentiva, dove reattività, sicurezza e uptime sono requisiti imprescindibili. Spyre è progettato per le aziende che desiderano integrare l'intelligenza artificiale con i propri sistemi di archiviazione esistenti, consentendo ai dati sensibili di rimanere sulla piattaforma senza compromettere le prestazioni.
La disponibilità generale inizierà il 28 ottobre per IBM z17 e LinuxONE 5, mentre Power11 seguirà all'inizio di dicembre. L'acceleratore è un SoC a 32 core da 5 nm, integrato in una scheda PCIe da 75 watt. IBM supporta cluster fino a 48 schede per sistema IBM Z o LinuxONE e fino a 16 schede per sistema IBM Power, consentendo la scalabilità orizzontale per l'inferenza multi-modello adiacente ai carichi di lavoro transazionali, come il rilevamento delle frodi, l'automazione della vendita al dettaglio e il risk scoring. Spyre rappresenta la produzione della ricerca dell'AI Hardware Center di IBM, ottimizzata per implementazioni on-premise in cui la località dei dati, la sicurezza e l'efficienza energetica sono requisiti fondamentali.
Dalle pipeline logiche all'intelligenza artificiale agentiva
I flussi di lavoro aziendali si stanno spostando dalle catene logiche deterministiche all'intelligenza artificiale agentica che percepisce il contesto, pianifica e agisce in tempo reale. Questi sistemi agentici richiedono inferenza a bassa latenza e una qualità del servizio prevedibile, anche se i sistemi core mantengono elevati volumi di transazioni. L'approccio di IBM consiste nel posizionare hardware di inferenza dedicato direttamente sulle piattaforme in cui risiedono già i dati critici. Mantenere i dati su IBM Z, LinuxONE e Power riduce il rischio e il sovraccarico di conformità evitando l'uscita di dati non necessaria e l'elaborazione esterna. L'esecuzione di inferenza generativa e agentica in prossimità dei dati riduce inoltre al minimo il backhaul e la variabilità indotta dalla rete, che è spesso il punto in cui si insinua la latenza di coda. L'obiettivo generale è quello di integrare il processo decisionale basato sull'intelligenza artificiale nei flussi OLTP, batch e di messaggistica esistenti senza compromettere la produttività, le finestre di modifica o i livelli di servizio.
Architettura Spyre
Spyre è un sistema su chip (SoC) commerciale sviluppato a partire da prototipi creati da IBM Research. Basato su un processo a 5 nm con 25.6 miliardi di transistor e 32 core di accelerazione, è ottimizzato per l'inferenza simultanea a bassa latenza anziché per l'addestramento di modelli. Il dispositivo viene fornito come scheda aggiuntiva PCIe da 75 watt, offrendo ai team che si occupano di infrastrutture un modello di distribuzione e servizio familiare.
IBM ha progettato configurazioni scalabili che consentono fino a 48 schede in un sistema IBM Z o LinuxONE 5 e fino a 16 schede in un sistema IBM Power11, consentendo il servizio multi-modello e l'isolamento dei tenant all'interno di un'unica piattaforma. Dal punto di vista software, Spyre si integra con lo stack aziendale di IBM per il servizio di modelli, la sicurezza e l'osservabilità, mentre Power aggiunge un catalogo con un solo clic per accelerare l'implementazione dei servizi. La combinazione è progettata per accelerare il time-to-value mantenendo i servizi di intelligenza artificiale entro i limiti operativi e di conformità esistenti.
Integrazione della piattaforma
IBM Z e LinuxONE: Co-location con Telum II
Su z17 e LinuxONE 5, Spyre opera insieme al complesso di processori Telum II per mantenere l'inferenza co-residente con i dati transazionali e i flussi di eventi. Questa soluzione preserva i domini di sicurezza e gli audit trail esistenti, essenziali negli ambienti regolamentati. Eseguendo l'inferenza localmente, le organizzazioni riducono al minimo i trasferimenti ad acceleratori esterni ed evitano che un'ulteriore latenza influisca sugli SLA delle transazioni. Il sistema può scalare fino a 48 carte, supportando più modelli e carichi di lavoro contemporaneamente. Fornisce un isolamento logico per soddisfare diverse unità aziendali o requisiti normativi. Ciò è particolarmente rilevante per i flussi di pagamento, la prevenzione delle frodi, la gestione dei reclami e gli eventi della supply chain, dove ogni millisecondo è prezioso e l'espansione del perimetro di conformità non è auspicabile.
IBM Power11: servizi di intelligenza artificiale basati su catalogo e sinergia MMA
Sui server Power11, Spyre si integra con un catalogo di servizi di intelligenza artificiale progettato per una rapida adozione all'interno di ambienti Power consolidati. Gli amministratori possono distribuire i servizi con un solo clic, allineandosi al modo in cui i clienti Power tradizionalmente gestiscono middleware, analisi e applicazioni line-of-business. L'abbinamento di Spyre con l'acceleratore MMA on-chip di Power migliora la conversione dei dati e la velocità di pre-elaborazione, fasi critiche per le pipeline di intelligenza artificiale generativa e le integrazioni di processi complessi.
IBM cita un esempio di throughput in cui, con una dimensione di prompt pari a 128, il sistema può elaborare oltre otto milioni di documenti per l'integrazione della knowledge base in circa un'ora. Per le aziende che sviluppano sistemi RAG o che conducono ricerche aziendali su larga scala, l'attenzione è rivolta all'accelerazione della preparazione e dell'ingestione dei dati, piuttosto che alla sola fase di inferenza. L'adattamento complessivo si rivolge a contesti misti, come la produzione, la vendita al dettaglio, la sanità e le implementazioni ERP intensive, dove la prevedibilità del throughput e la facilità di manutenzione sono fondamentali.
Dall'IBM AI Hardware Center alle distribuzioni sul campo
Spyre dimostra come IBM trasformi la ricerca in prodotti pratici. La tecnologia è nata come prototipo sviluppato da IBM Research, per poi maturare attraverso implementazioni iterative di cluster presso il campus di Yorktown Heights e collaborazioni con il Center for Emerging Artificial Intelligence Systems dell'Università di Albany. IBM Infrastructure ha successivamente prodotto il progetto per IBM Z, LinuxONE e Power, allineando il silicio ai requisiti aziendali quali sicurezza, affidabilità, gestione del ciclo di vita e facilità di manutenzione. I dirigenti IBM definiscono Spyre come un'infrastruttura per l'intelligenza artificiale multi-modello, sottolineando la scalabilità sicura e resiliente di carichi di lavoro generativi e agentici su piattaforme già affidabili con dati e transazioni core.
Il valore di Spyre è indissolubilmente legato alla posizione operativa di IBM. Eseguendo l'inferenza dove i dati vengono creati e gestiti, le organizzazioni limitano l'uscita dei dati e riducono la complessità della conformità. IBM Z e LinuxONE offrono funzionalità di crittografia, isolamento, registrazione e audit che sono già integrate nei quadri normativi di molti clienti. Power offre un robusto stack di sicurezza e gestione adatto ad ambienti di analisi e transazioni miste. Il supporto per il clustering, il partizionamento logico e gli strumenti di osservabilità proprietari si allineano alle norme operative di mainframe e Power, consentendo l'implementazione, il monitoraggio e la manutenzione dei servizi di intelligenza artificiale come qualsiasi altro carico di lavoro di primo livello. Per molti acquirenti nei settori finanziario, sanitario e pubblico, queste garanzie operative hanno la precedenza sui benchmark TOPS grezzi o sintetici.
Considerazioni su prestazioni e scalabilità
Sebbene IBM non abbia rilasciato dettagli completi sulle prestazioni per ciascun modello, gli indicatori architetturali sono evidenti. Spyre punta su percorsi di inferenza a bassa latenza ottimizzati per loop agentici e pipeline basate su eventi, dove la concorrenza e il controllo della latenza di coda sono più importanti del solo throughput di picco. La scalabilità orizzontale tramite cluster di schede PCIe consente ai team di dimensionare le distribuzioni per il servizio multi-modello, l'isolamento dei tenant e la crescita futura senza richiedere la riprogettazione della piattaforma.
Su Power, la combinazione MMA-Spyre accelera la preparazione e la conversione dei dati, che spesso determinano i tempi end-to-end per RAG e ricerca aziendale. Le aziende dovrebbero strutturare le proof of concept in modo da rispecchiare le condizioni di produzione: dimensioni dei modelli e finestre di token, concorrenza delle richieste, interazione con carichi transazionali e telemetria per la latenza di coda in fase di contesa.
Barry Baker, COO di IBM Infrastructure e GM di IBM Systems, ha sottolineato l'attenzione dell'azienda allo sviluppo di infrastrutture per i carichi di lavoro di intelligenza artificiale emergenti. Ha evidenziato il ruolo di Spyre Accelerator nel potenziare i sistemi per supportare l'intelligenza artificiale multi-modello, inclusa l'intelligenza artificiale generativa e agentica. Ha aggiunto che questa innovazione mira a consentire ai clienti di scalare i carichi di lavoro di intelligenza artificiale mission-critical in modo sicuro, resiliente ed efficiente, massimizzando al contempo il valore dei dati aziendali.
Mukesh Khare, Direttore Generale di IBM Semiconductors, sottolinea che IBM ha lanciato il suo AI Hardware Center nel 2019 per rispondere alle crescenti esigenze computazionali dell'intelligenza artificiale, ancor prima del recente boom dell'intelligenza artificiale. Celebra la commercializzazione del primo chip del centro, progettato per migliorare le prestazioni dei client mainframe e server di IBM.
Casi d'uso
I team dei servizi finanziari possono utilizzare Spyre per il rilevamento delle frodi in tempo reale, che opera direttamente sui set di dati sulla piattaforma, consentendo aggiornamenti dei modelli e delle policy senza espandere il perimetro di audit. Nel settore della vendita al dettaglio e della logistica, gli assistenti agenti possono coordinare le decisioni di inventario e di evasione degli ordini con tempi di risposta coerenti, mantenendo l'inferenza locale ai sistemi operativi. Le organizzazioni sanitarie e governative possono implementare riepiloghi generativi e supporto decisionale nel rispetto di rigorosi vincoli di privacy e residenza, evitando lo spostamento di dati che altrimenti comporterebbe ulteriori attività di conformità. Negli ambienti industriali e con un'elevata intensità di ERP, Spyre può supportare l'automazione dei processi e il rilevamento delle anomalie in prossimità di sistemi di telemetria SAP, Oracle e di impianto basati su Power, garantendo un comportamento deterministico e la manutenibilità.
La leadership di IBM Infrastructure presenta Spyre come infrastruttura fondamentale per la transizione verso l'intelligenza artificiale, progettata per supportare carichi di lavoro generativi e agentici multi-modello su scala aziendale con solide garanzie di sicurezza e resilienza. La leadership di IBM Semiconductors descrive Spyre come la prima pietra miliare nella commercializzazione dell'AI Hardware Center, anticipando un ritmo continuo di innovazione hardware per i clienti mainframe e server di IBM.
Conclusione
Spyre è la risposta on-premise di IBM per l'inferenza a bassa latenza in ambienti che non possono scendere a compromessi in termini di sicurezza, affidabilità o località dei dati. La scalabilità hardware, le integrazioni native della piattaforma e il modello operativo si allineano con le piattaforme IBM Z, LinuxONE e Power che puntano all'intelligenza artificiale (IA) agentica entro lo stesso raggio d'azione delle transazioni core. Il passo successivo per gli acquirenti è la prova: proof of concept che convalidano i vantaggi in termini di latenza, concorrenza e governance in carichi di lavoro reali. Se le prestazioni sul campo soddisfano le esigenze, Spyre offre un percorso pragmatico per integrare l'IA generativa e agentica direttamente nei sistemi mission-critical.
Disponibilità
Spyre sarà disponibile per IBM z17 e LinuxONE 5 a partire dal 28 ottobre. I sistemi IBM Power11 riceveranno Spyre all'inizio di dicembre. Questa release scaglionata offre ai clienti mainframe e LinuxONE la possibilità di accedere in tempi rapidi all'inferenza su piattaforma, mentre i sistemi Power seguiranno poco dopo.




Amazon