ArmazenamentoReview.com

IBM Spyre Accelerator: Inferência de baixa latência para IA generativa e agente no IBM Z, LinuxONE e Power

Empreendimento  ◇  servidor

A IBM lançou o IBM Spyre Accelerator, um mecanismo de inferência de baixa latência projetado para IA generativa e agêntica, onde a responsividade, a segurança e o tempo de atividade são essenciais. O Spyre foi desenvolvido para empresas que buscam integrar IA aos seus sistemas de registro existentes, permitindo que dados confidenciais permaneçam na plataforma sem comprometer o desempenho.

A disponibilidade geral começa em 28 de outubro para IBM z17 e LinuxONE 5, com o Power11 previsto para o início de dezembro. O acelerador é um SoC de 5 nm e 32 núcleos encapsulado em uma placa PCIe de 75 watts. A IBM suporta clusters de até 48 placas por sistema IBM Z ou LinuxONE e até 16 placas por sistema IBM Power, permitindo escalabilidade horizontal para inferência multimodelo adjacente a cargas de trabalho transacionais, como detecção de fraudes, automação de varejo e pontuação de risco. O Spyre representa a produtização da pesquisa do Centro de Hardware de IA da IBM, ajustada para implantações locais onde a localidade dos dados, a segurança e a eficiência energética são requisitos fundamentais.

Acelerador IBM Spyre

De pipelines lógicos à IA de agente

Os fluxos de trabalho corporativos estão migrando de cadeias lógicas determinísticas para uma IA agêntica que percebe o contexto, planeja e age em tempo real. Esses sistemas agênticos exigem inferência de baixa latência e uma qualidade de serviço previsível, mesmo que os sistemas principais mantenham altos volumes de transações. A abordagem da IBM é posicionar hardware de inferência dedicado diretamente nas plataformas onde os dados críticos já residem. Manter os dados no IBM Z, LinuxONE e Power reduz os riscos e a sobrecarga de conformidade, evitando saída desnecessária de dados e processamento externo. Executar inferência generativa e agêntica próxima aos dados também minimiza o backhaul e a variabilidade induzida pela rede, que é frequentemente onde a latência de cauda se instala. O objetivo geral é adicionar a tomada de decisão orientada por IA aos fluxos OLTP, em lote e de mensagens existentes sem comprometer a taxa de transferência, as janelas de alteração ou os níveis de serviço.

Arquitetura Spyre

O Spyre é um sistema em um chip (SoC) comercial desenvolvido a partir de protótipos criados pela IBM Research. Construído em um processo de 5 nm com 25.6 bilhões de transistores e 32 núcleos aceleradores, ele é otimizado para inferência simultânea de baixa latência, em vez de treinamento de modelos. O dispositivo é fornecido como uma placa PCIe adicional de 75 watts, oferecendo às equipes de infraestrutura um modelo de implantação e serviço familiar.

Arquitetura do IBM Spyre Accelerator

A IBM projetou configurações de escalonamento horizontal que permitem até 48 placas em um sistema IBM Z ou LinuxONE 5 e até 16 placas em um sistema IBM Power11, permitindo o serviço de vários modelos e o isolamento de locatários em uma única plataforma. Em termos de software, o Spyre integra-se à pilha corporativa da IBM para serviço de modelos, segurança e observabilidade, enquanto o Power adiciona um catálogo de um clique para acelerar a implantação de serviços. A combinação foi projetada para acelerar o tempo de retorno do investimento, mantendo os serviços de IA dentro dos limites operacionais e de conformidade existentes.

Integração de Plataforma

IBM Z e LinuxONE: Colocation com Telum II

No z17 e no LinuxONE 5, o Spyre opera em conjunto com o complexo de processadores Telum II para manter a inferência co-residente com dados transacionais e fluxos de eventos. Esse arranjo preserva os domínios de segurança e trilhas de auditoria existentes, essenciais em ambientes regulamentados. Ao executar a inferência localmente, as organizações minimizam as viagens a aceleradores externos e evitam que latência adicional afete os SLAs das transações. O sistema pode escalar até 48 cartões, suportando vários modelos e cargas de trabalho simultaneamente. Ele fornece isolamento lógico para atender a várias unidades de negócios ou requisitos regulatórios. Isso é especialmente relevante para fluxos de pagamento, prevenção de fraudes, tratamento de reclamações e eventos da cadeia de suprimentos, onde cada milissegundo conta e expandir o perímetro de conformidade não é desejável.

IBM Power11: Serviços de IA orientados por catálogo e sinergia de MMA

Nos servidores Power11, o Spyre integra-se a um catálogo de serviços de IA projetado para rápida adoção em ambientes Power já estabelecidos. Os administradores podem implantar serviços com um único clique, alinhando-se à forma como os clientes Power tradicionalmente operacionalizam middleware, análises e aplicativos de linha de negócios. A combinação do Spyre com o acelerador MMA on-chip do Power melhora a conversão de dados e a taxa de transferência de pré-processamento, etapas cruciais para pipelines de IA generativa e integrações de processos complexos.

A IBM cita um exemplo de throughput em que, com um prompt de 128, o sistema pode processar mais de oito milhões de documentos para integração de base de conhecimento em aproximadamente uma hora. Para empresas que desenvolvem sistemas RAG ou realizam buscas corporativas em larga escala, o foco está na aceleração da preparação e ingestão de dados, e não apenas na etapa de inferência. A adequação geral visa setores mistos, como manufatura, varejo, saúde e implantações com uso intensivo de ERP, onde o throughput previsível e a facilidade de manutenção são essenciais.

Do IBM AI Hardware Center às implantações de campo

O Spyre demonstra como a IBM transforma pesquisas em produtos práticos. A tecnologia começou como um protótipo desenvolvido pela IBM Research e, em seguida, amadureceu por meio de implantações iterativas em cluster no campus de Yorktown Heights e colaborações com o Centro de Sistemas Emergentes de Inteligência Artificial da Universidade de Albany. Posteriormente, a IBM Infrastructure produziu o design para IBM Z, LinuxONE e Power, alinhando o silício com requisitos corporativos como segurança, confiabilidade, gerenciamento do ciclo de vida e facilidade de manutenção. Os executivos da IBM caracterizam o Spyre como uma infraestrutura para IA multimodelo, enfatizando o escalonamento seguro e resiliente de cargas de trabalho generativas e agênticas em plataformas já confiáveis ​​com dados e transações essenciais.

O valor do Spyre é inseparável da postura operacional da IBM. Ao executar inferências onde os dados são criados e governados, as organizações limitam a saída de dados e reduzem a complexidade da conformidade. O IBM Z e o LinuxONE fornecem recursos de criptografia, isolamento, registro e auditoria que já são essenciais para as estruturas regulatórias de muitos clientes. O Power contribui com uma pilha robusta de segurança e gerenciamento adequada para análises mistas e propriedades transacionais. O suporte a clustering, o particionamento lógico e as ferramentas de observabilidade primária se alinham às normas operacionais do mainframe e do Power, permitindo que os serviços de IA sejam implantados, monitorados e atendidos como qualquer outra carga de trabalho de nível um. Para muitos compradores nos setores de finanças, saúde e setor público, essas garantias operacionais têm precedência sobre TOPS brutos ou benchmarks sintéticos.

Considerações sobre desempenho e escalabilidade

Embora a IBM não tenha divulgado detalhes abrangentes de desempenho para cada modelo, os indicadores arquitetônicos são evidentes. O Spyre visa caminhos de inferência de baixa latência otimizados para loops de agente e pipelines orientados a eventos, onde a simultaneidade e o controle da latência de cauda são mais importantes do que apenas o pico de rendimento. A expansão horizontal por meio de clusters de placas PCIe permite que as equipes dimensionem implantações para atendimento a vários modelos, isolamento de locatários e crescimento futuro sem a necessidade de redesenho da plataforma.

No Power, a combinação MMA-Spyre acelera a preparação e a conversão de dados, o que frequentemente domina o tempo de ponta a ponta para RAG e pesquisa corporativa. As empresas devem estruturar provas de conceito para espelhar as condições de produção: tamanhos de modelos e janelas de token, simultaneidade de solicitações, interação com cargas transacionais e telemetria para latência de cauda em contenção.

Barry Baker, COO de Infraestrutura da IBM e GM da IBM Systems, enfatizou o foco da empresa no desenvolvimento de infraestrutura para cargas de trabalho de IA emergentes. Ele destacou o papel do Spyre Accelerator no aprimoramento de sistemas para suportar IA multimodelo, incluindo IA generativa e de agente. Ele acrescentou que essa inovação visa permitir que os clientes escalem cargas de trabalho de IA de missão crítica com segurança, resiliência e eficiência, maximizando o valor dos dados corporativos.

Mukesh Khare, gerente geral da IBM Semiconductors, observa que a IBM lançou seu Centro de Hardware de IA em 2019 para atender às crescentes demandas computacionais da IA, mesmo antes do recente boom da tecnologia. Ele comemora a comercialização do primeiro chip do centro, projetado para aprimorar o desempenho dos clientes de mainframe e servidores da IBM.

Casos de uso

Equipes de serviços financeiros podem utilizar o Spyre para detecção de fraudes em tempo real, que opera diretamente em conjuntos de dados na plataforma, permitindo atualizações de modelos e políticas sem expandir o perímetro de auditoria. No varejo e na logística, assistentes de agente podem coordenar decisões de estoque e atendimento com tempos de resposta consistentes, mantendo a inferência local nos sistemas operacionais. Organizações de saúde e governamentais podem implantar resumos generativos e suporte à decisão dentro de rígidas restrições de privacidade e residência, evitando a movimentação de dados que, de outra forma, acionaria trabalho adicional de conformidade. Em ambientes industriais e com ERPs pesados, o Spyre pode potencializar a automação de processos e a detecção de anomalias perto de sistemas SAP, Oracle e de telemetria de planta executados no Power, garantindo comportamento determinístico e manutenibilidade.

A liderança da IBM Infrastructure apresenta o Spyre como uma infraestrutura fundamental para a transição para a IA, projetada para suportar cargas de trabalho generativas e agênticas multimodelo em escala empresarial, com fortes garantias de segurança e resiliência. A liderança da IBM Semiconductors descreve o Spyre como o primeiro marco de comercialização do AI Hardware Center, antecipando uma cadência contínua de inovação em hardware para os clientes de mainframe e servidores da IBM.

ponto de partida

O Spyre é a resposta local da IBM para inferência de baixa latência em ambientes que não podem comprometer a segurança, a confiabilidade ou a localidade dos dados. A escala de hardware, as integrações nativas da plataforma e o modelo operacional se alinham aos ambientes IBM Z, LinuxONE e Power, que buscam IA agêntica no mesmo raio de ação das transações principais. O próximo passo para os compradores é a evidência: provas de conceito que validam as vantagens de latência, simultaneidade e governança em cargas de trabalho reais. Se o desempenho em campo corresponder ao briefing, o Spyre oferece um caminho pragmático para incorporar IA generativa e agêntica diretamente em sistemas de missão crítica.

Disponibilidade

O Spyre estará disponível para IBM z17 e LinuxONE 5 a partir de 28 de outubro. Os sistemas IBM Power11 receberão o Spyre no início de dezembro. Este lançamento escalonado oferece aos clientes de mainframe e LinuxONE o caminho mais rápido para inferência na plataforma, com as versões Power sendo lançadas logo em seguida.

Envolva-se com a StorageReview

Newsletter | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Feed RSS

Haroldo Fritts

Estou na indústria de tecnologia desde que a IBM criou a Selectric. Minha formação, porém, é escrever. Então decidi sair do negócio de pré-vendas e voltar às minhas raízes, escrevendo um pouco, mas ainda envolvido com tecnologia.