StorageReview.com

IBM Spyre Accelerator: Nízkolatence pro generativní a agentní umělou inteligenci na IBM Z, LinuxONE a Power

Enterprise  ◇  Server

Společnost IBM představila IBM Spyre Accelerator, inferenční engine s nízkou latencí určený pro generativní a agentní umělou inteligenci, kde jsou nezbytné požadavky na odezvu, zabezpečení a provozuschopnost. Spyre je určen pro podniky, které chtějí integrovat umělou inteligenci se svými stávajícími systémy záznamů, což umožňuje uchovávat citlivá data na platformě bez kompromisů v oblasti výkonu.

Všeobecná dostupnost pro IBM z17 a LinuxONE 5 začíná 28. října, Power11 bude následovat začátkem prosince. Akcelerátor je 5nm, 32jádrový SoC zabalený na 75wattové kartě PCIe. IBM podporuje clustery až s 48 kartami na systém IBM Z nebo LinuxONE a až s 16 kartami na systém IBM Power, což umožňuje horizontální škálování pro vícemodelovou inferenci v blízkosti transakčních úloh, jako je detekce podvodů, automatizace maloobchodu a hodnocení rizik. Spyre představuje produktivitu výzkumu IBM AI Hardware Center, vyladěného pro lokální nasazení, kde jsou základními požadavky lokalita dat, zabezpečení a energetická účinnost.

IBM Spyre Accelerator

Od logických kanálů k agentní umělé inteligenci

Podnikové pracovní postupy se odklánějí od deterministických logických řetězců směrem k agentní umělé inteligenci, která vnímá kontext, plánuje a jedná v reálném čase. Tyto agentní systémy vyžadují nízkolatenční inferenci a předvídatelnou kvalitu služeb, a to i v případě, že základní systémy udržují vysoké objemy transakcí. Přístup společnosti IBM spočívá v umisťování dedikovaného inferenčního hardwaru přímo na platformy, kde se již nacházejí kritická data. Uchovávání dat na systémech IBM Z, LinuxONE a Power snižuje riziko a režijní náklady na dodržování předpisů tím, že se vyhýbá zbytečnému odesílání dat a externímu zpracování. Spouštění generativní a agentní inference v blízkosti dat také minimalizuje backhaul a variabilitu vyvolanou sítí, což je často místo, kde se vkrádá latence ocasu. Hlavním cílem je přidat rozhodování řízené umělou inteligencí do stávajících OLTP, dávkových a zasílacích toků, aniž by to ohrozilo propustnost, okna změn nebo úrovně služeb.

Architektura Spyre

Spyre je komerční systém na čipu (SoC) vyvinutý z prototypů vytvořených společností IBM Research. Je postaven na 5nm procesu s 25.6 miliardami tranzistorů a 32 akceleračními jádry a je optimalizován pro souběžnou inferenci s nízkou latencí, nikoli pro trénování modelů. Zařízení je dodáváno jako 75wattová přídavná karta PCIe, což infrastrukturním týmům poskytuje známý model nasazení a servisu.

Architektura akcelerátoru IBM Spyre

Společnost IBM navrhla konfigurace horizontálně škálovatelných řešení, které umožňují až 48 karet v systému IBM Z nebo LinuxONE 5 a až 16 karet v systému IBM Power11, což umožňuje obsluhu více modelů a izolaci klientů v rámci jedné platformy. Co se týče softwaru, Spyre se integruje s podnikovým stackem IBM pro obsluhu modelů, zabezpečení a sledovatelnost, zatímco Power přidává katalog s jedním kliknutím pro rychlé nasazení služeb. Tato kombinace je navržena tak, aby zkrátila dobu trvání investice a zároveň zachovala služby umělé inteligence v rámci stávajících provozních a compliance limitů.

Integrace platformy

IBM Z a LinuxONE: Společné umístění s Telum II

V systémech z17 a LinuxONE 5 pracuje Spyre společně s procesorovým komplexem Telum II, aby udržoval inferenci koexistující s transakčními daty a toky událostí. Toto uspořádání zachovává stávající bezpečnostní domény a auditní stopy, které jsou nezbytné v regulovaném prostředí. Lokálním spuštěním inference organizace minimalizují použití externích akcelerátorů a zabraňují další latenci, která by ovlivňovala SLA transakcí. Systém lze škálovat až na 48 karet a podporovat více modelů a úloh současně. Poskytuje logickou izolaci pro uspokojení různých obchodních jednotek nebo regulačních požadavků. To je obzvláště důležité pro platební toky, prevenci podvodů, vyřizování reklamací a události v dodavatelském řetězci, kde se počítá každá milisekunda a rozšiřování perimetru shody není žádoucí.

IBM Power11: Synergie služeb umělé inteligence řízených katalogy a MMA

Na serverech Power11 se Spyre integruje s katalogem služeb umělé inteligence, který je navržen pro rychlé zavedení v rámci zavedených systémů Power. Administrátoři mohou služby nasadit jediným kliknutím, což je v souladu s tím, jak zákazníci Power tradičně provozují middleware, analytické a obchodní aplikace. Spojení Spyre s integrovaným MMA akcelerátorem Power zlepšuje konverzi dat a propustnost předzpracování, což jsou klíčové fáze pro generativní kanály umělé inteligence a integrace komplexních procesů.

Společnost IBM uvádí příklad propustnosti, kdy při velikosti promptu 128 dokáže systém zpracovat přes osm milionů dokumentů pro integraci znalostní báze přibližně za hodinu. Pro podniky vyvíjející systémy RAG nebo provádějící rozsáhlé podnikové vyhledávání se klade důraz na urychlení přípravy a příjmu dat, spíše než pouze na krok inference. Celkové využití se zaměřuje na smíšené oblasti, jako je výroba, maloobchod, zdravotnictví a nasazení s vysokým podílem ERP, kde je klíčová předvídatelná propustnost a provozuschopnost.

Od IBM AI Hardware Center k nasazení v terénu

Spyre demonstruje, jak IBM transformuje výzkum do praktických produktů. Technologie začala jako prototyp vyvinutý společností IBM Research a poté se dále rozvíjela prostřednictvím iterativního nasazení clusterů v kampusu Yorktown Heights a spolupráce s Centrem pro vznikající systémy umělé inteligence na Univerzitě v Albany. IBM Infrastructure následně zprovoznila návrh pro IBM Z, LinuxONE a Power a sladila křemík s podnikovými požadavky, jako je zabezpečení, spolehlivost, správa životního cyklu a provozuschopnost. Vedoucí pracovníci IBM charakterizují Spyre jako infrastrukturu pro multimodelovou umělou inteligenci s důrazem na bezpečné a odolné škálování generativních a agentních úloh na platformách, kterým již důvěřují klíčová data a transakce.

Hodnota Spyre je neoddělitelná od provozního postoje IBM. Díky používání inference tam, kde jsou data vytvářena a spravována, organizace omezují odchozí data a snižují složitost dodržování předpisů. IBM Z a LinuxONE poskytují kryptografii, izolaci, protokolování a audit, které jsou již nedílnou součástí regulačních rámců mnoha zákazníků. Power přispívá robustním bezpečnostním a správním balíčkem vhodným pro smíšené analytické a transakční systémy. Podpora clusteringu, logické dělení a nástroje pro pozorování první strany jsou v souladu s provozními normami mainframe a Power, což umožňuje nasazování, monitorování a servis služeb umělé inteligence jako jakékoli jiné zatížení první úrovně. Pro mnoho kupujících ve financích, zdravotnictví a veřejném sektoru mají tyto provozní záruky přednost před nezpracovanými TOPS nebo syntetickými benchmarky.

Aspekty výkonu a škálovatelnosti

Ačkoli IBM nezveřejnila komplexní podrobnosti o výkonu pro každý model, architektonické ukazatele jsou zřejmé. Spyre se zaměřuje na inferenční cesty s nízkou latencí optimalizované pro agentní smyčky a událostmi řízené kanály, kde je souběžnost a kontrola latence ocasu důležitější než samotná špičková propustnost. Škálování pomocí clusterů karet PCIe umožňuje týmům dimenzovat nasazení pro vícemodelové obsluhování, izolaci tenantů a budoucí růst, aniž by bylo nutné přepracovat platformu.

Na platformě Power kombinace MMA a Spyre zrychluje přípravu a konverzi dat, což často dominuje celkovému času pro RAG a podnikové vyhledávání. Podniky by měly strukturovat koncepty tak, aby odrážely produkční podmínky: velikosti modelů a okna tokenů, souběžnost požadavků, interakce s transakčními zátěžemi a telemetrie pro latenci ocasu při konfliktu.

Barry Baker, provozní ředitel společnosti IBM Infrastructure a generální ředitel společnosti IBM Systems, zdůraznil zaměření společnosti na vývoj infrastruktury pro nově vznikající úlohy umělé inteligence. Vyzdvihl roli akcelerátoru Spyre při vylepšování systémů pro podporu multimodelové umělé inteligence, včetně generativní a agentní umělé inteligence. Dodal, že cílem této inovace je umožnit klientům bezpečně, odolně a efektivně škálovat kritické úlohy umělé inteligence a zároveň maximalizovat hodnotu podnikových dat.

Mukesh Khare, generální ředitel společnosti IBM Semiconductors, poznamenává, že IBM spustila své Centrum hardwaru pro umělou inteligenci v roce 2019, aby řešila rostoucí výpočetní nároky umělé inteligence, a to ještě před nedávným boomem umělé inteligence. Oslavuje komercializaci prvního čipu centra, který byl navržen pro zvýšení výkonu klientských počítačů a serverů IBM.

Případy užití

Týmy finančních služeb mohou využívat Spyre k detekci podvodů v reálném čase, který pracuje přímo s datovými sadami na platformě, což umožňuje aktualizace modelů a zásad bez rozšiřování perimetru auditu. V maloobchodě a logistice mohou agenti-asistentové koordinovat rozhodnutí o zásobách a plnění s konzistentními dobami odezvy tím, že udržují inferenci lokální v operačních systémech. Zdravotnické a vládní organizace mohou nasadit generativní souhrny a podporu rozhodování v rámci přísných omezení ochrany osobních údajů a pobytu, čímž se zabrání přesunu dat, který by jinak vedl k další práci v oblasti dodržování předpisů. V průmyslových a ERP prostředích může Spyre zajišťovat automatizaci procesů a detekci anomálií v blízkosti systémů SAP, Oracle a telemetrie závodů běžících na platformě Power, čímž zajišťuje deterministické chování a udržovatelnost.

Vedení divize infrastruktury IBM představuje Spyre jako základní infrastrukturu pro přechod na umělou inteligenci, navrženou pro podporu vícemodelových generativních a agentních úloh v podnikovém měřítku se silnými zárukami zabezpečení a odolnosti. Vedení divize IBM Semiconductors popisuje Spyre jako první milník v komercializaci Centra hardwaru umělé inteligence a očekává pokračující tempo hardwarových inovací pro zákazníky IBM v oblasti mainframe a serverů.

Závěrem

Spyre je řešením IBM pro lokální řešení s nízkou latencí v prostředích, která nemohou dělat kompromisy v oblasti zabezpečení, spolehlivosti nebo lokality dat. Škálování hardwaru, nativní integrace platformy a provozní model jsou v souladu s platformami IBM Z, LinuxONE a Power, které hledají agentní umělou inteligenci ve stejném dosahu jako základní transakce. Dalším krokem pro kupující je důkaz: ověření konceptu, které ověřuje výhody latence, souběžnosti a správy v reálných pracovních zátěžích. Pokud výkon v praxi odpovídá zadání, Spyre nabízí pragmatickou cestu k přímému začlenění generativní a agentní umělé inteligence do kriticky důležitých systémů.

dostupnost

Spyre bude obecně dostupný pro IBM z17 a LinuxONE 5 od 28. října. Systémy IBM Power11 obdrží Spyre začátkem prosince. Toto postupné vydání poskytuje zákazníkům s mainframy a LinuxONE nejbližší cestu k inferenci na platformě, přičemž systémy Power budou krátce poté následovat.

Zapojte se do StorageReview

Zpravodaj | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | RSS kanál

Harold Fritts

V technologickém průmyslu působím od doby, kdy IBM založila Selectric. Mám ale zkušenosti s psaním. Rozhodl jsem se tedy opustit předprodejní byznys a vrátit se ke svým kořenům, trochu psát, ale stále se věnovat technologiím.