存儲評論網

IBM推出面向RAG工作負載的內容感知存儲

AI  ◇  企業

IBM推出了一種內容感知儲存(CAS)架構,將AI資料處理直接整合到儲存層中。這種方法透過將文件向量化嵌入儲存系統,減少了對外部預處理流程的需求,從而滿足檢索增強生成(RAG)工作流程的需求。

CAS 將 RAG 的核心功能——基於大型語言模型技術的文件嵌入——轉移到儲存基礎設施。這使得企業能夠就地處理和索引數據,使儲存系統與 AI 驅動的工作負載保持一致,並減少跨基礎設施層的數據移動​​。 IBM 將此定位為一種簡化部署、同時提升 AI 應用效能和資料本地性的方法。

大規模向量資料庫

IBM CAS 實作的核心是一個針對語意搜尋最佳化的向量資料庫。向量資料庫支援近似最近鄰搜索,使 AI 系統能夠基於餘弦相似度或 L2 距離等相似性指標檢索相關資料區塊。這項功能是 RAG 的基礎,RAG 將使用者查詢轉換為向量,並與已索引的企業資料進行匹配,從而提供上下文感知的回應。

IBM CAS 圖表

資料來源:IBM

IBM研究院與三星和英偉達合作,展示了一個原型系統,該系統能夠在單一伺服器上擴展到100億個向量。該系統實現了超過90%的召回率和精確率,平均查詢延遲低於700毫秒。這種規模的目標環境是企業級環境,在這些環境中,資料集可能跨越數十億個文件,並且在完全索引後,向量數量可達數千億個文件。

RAG管道集成

RAG正逐漸成為企業人工智慧領域的首選方法,因為它無需重新訓練模型即可提高輸出準確率。其工作原理是利用從向量資料庫檢索的企業特定資料來增強提示資訊。

這個流程始於資料攝取,文件(例如 PDF 和簡報)會被解析、分塊並轉換為詞向量。這些詞向量儲存在向量資料庫中,用於組織資料以實現高效的相似性搜尋。在查詢時,使用者輸入會被嵌入並與儲存的向量進行匹配,相關的上下文資訊會傳遞給語言模型。這種情境匹配機制可以減少使用者對 AI 產生結果的依賴性,並提高使用者對 AI 生成結果的信任度。

IBM 的 CAS 將此管道直接整合到儲存中,將攝取、索引和檢索整合到更靠近資料的位置。

應對規模和成本挑戰

企業級儲存系統已經能夠處理PB級的資料。當擴展到CAS時,每個檔案可以產生數百個向量,從而迅速增加資料集的大小。傳統的向量資料庫通常需要跨多個伺服器進行橫向擴展,這會增加成本和維運複雜性。對大型資料集進行索引和重新索引也會非常耗時。

IBM 的方法著重於提高向量密度並降低索引開銷,以限制基礎架構的蔓延。此架構將向量和索引儲存與查詢運算解耦,從而實現儲存和運算資源的獨立擴展。這得歸功於 IBM Storage Scale 及其高效能平行檔案系統。

儲存和硬體架構

CAS 實作方案採用IBM Storage Scale System 6000 (ESS 6000),這是一款專為 AI 和高效能工作負載設計的全快閃平台。該系統每個 4U 機箱支援最多 48 個 NVMe 硬碟,每個硬碟的容量從 7 TB 到 60 TB 不等。它整合了 PCIe Gen5、400 Gb InfiniBand 或 200 Gb 乙太網路連接,每個節點可提供高達 340 GB/s 的讀取吞吐量和 175 GB/s 的寫入吞吐量,以及高達 7 萬 IOPS。

該平台還支援NVIDIA GPUDirect Storage,可在儲存體和 GPU 之間建立直接資料路徑,以及 BlueField-3 DPU,用於卸載網路和資料處理。

三星 PM9D3a PCIe Gen5 NVMe 固態硬碟提供高吞吐量、高密度儲存。這些硬碟基於第八代 TLC V-NAND 快閃記憶體,單碟容量高達 30.72 TB,順序讀取速度高達 12 GB/s,順序寫入速度高達 6.8 GB/s。由於採用了市面上常見的企業級固態硬碟,因此該架構能夠使用標準元件進行擴充。

分層索引和GPU加速

為了解決大規模索引問題,IBM 開發了一種分層索引模型,該模型包含多個可獨立最佳化的子索引。這種結構允許在不中斷整個資料集的情況下進行增量更新和局部重新索引,從而提高可用性和維運效率。

與僅使用 CPU 的方法相比,GPU 加速顯著縮短了索引時間。原本在 CPU 上需要數小時才能完成的任務,使用 NVIDIA GPU 只需幾分鐘即可完成。在測試中,使用 6 塊 NVIDIA H200 GPU 建立 100 億個向量的索引僅花了 4 天,而使用雙路 CPU 系統則預計需要 120 天。

包含向量和索引的完整資料集佔用了約 153 TiB 的儲存空間。初始資料載入和分割區耗時九天。最終系統實現了平均 694 毫秒的查詢延遲和 90% 的召回率,並透過與暴力破解的真實值計算結果進行了驗證。

路線圖

IBM 和 NVIDIA 持續最佳化平台,重點在於降低索引和查詢延遲。目前的目標包括:一天內索引 1000 億個或更多向量,將資料攝取時間從 9 天縮短到 1 天,以及在保持 90% 召回率的同時,將查詢延遲降低到 50-100 毫秒範圍內。

將向量索引整合到標準檔案系統中旨在簡化部署並降低企業採用 AI 的門檻。透過將 RAG 功能直接嵌入到儲存中,IBM 將 CAS 定位為 AI 基礎設施的基礎層。

參與 StorageReview

電子報| YouTube | PodcastiTunes / Spotify | Instagram | Twitter | TikTok | RSS訂閱

哈羅德弗里茨

自 IBM 創建 Selectric 以來,我一直在科技行業工作。 不過,我的背景是寫作。 因此,我決定退出售前業務,回歸本源,從事一些寫作工作,但仍從事技術工作。