IBM 和 NASA 已將 NASA-IBM 月球基礎模型開源,這是首批面向公眾開放的月球科學研究基礎模型之一。該模型的權重、技術報告以及用於訓練的機器學習資料集均已上傳至Hugging Face網站的 Prithvi 系列,該系列已涵蓋地球觀測、氣象和太陽物理學等領域。該模型的優點在於,數十年來多儀器採集的月球資料已無法滿足人工篩選的地圖和針對特定任務的狹隘模型的需求,而一個預訓練的主幹模型即可應用於隕石坑測繪、火山特徵探測和冰層勘探等任務,無需每次都從頭開始訓練。在 IBM 和 NASA 的基準測試中,該模型在識別潛在冰層方面的均方根誤差比 SwinV2-B 基線模型降低了高達 22%。
基於九種儀器的 30 層 TerraMind 主幹網
該模型基於 IBM 與歐洲太空總署 (ESA) 共同開發的地球觀測模型 TerraMind 的一個版本建構而成。之所以選擇 TerraMind,是因為它能夠處理混合資料類型和分辨率,並學習跨模態相關性,從而填充缺失值或雜訊值。針對每個月球任務的微調都使用了低秩適配器,將 90% 的基礎權重凍結,從而降低了自適應成本。訓練資料集是 NASA 所說的先前不存在的部分:一個統一的、空間對齊的資料集,包含來自四個任務中九個儀器的 30 多個圖層,約 2 萬個影像瓦片,其中包括超過 100 萬張 1 公尺解析度的相機影像和近 1 萬張 964,000 公尺分辨率的多光譜影像。資料來源包括 NASA 月球勘測軌道飛行器 (LRO) 的圖像、GRAIL 任務 20 公里/像素的重力場圖、月球勘探者 (LPP) 資料以及 JAXA SELENE/Kaguya 的補充觀測資料。此模型附帶名為 SOMBench 的基準測試資料集。
兩種尺度下的冰、火山斑塊和隕石坑
22% 的數據來自冰層探測任務。該模型結合了多模態、多解析度的觀測數據,預測永久陰影區(未來月球基地將開採水、氧氣和火箭推進劑的區域)表面下可能存在的冰層。在火山歷史方面,該模型在不完善的標籤上進行訓練,其不規則月海斑塊的覆蓋率比 SwinV2-B 高出 3%。 IBM 認為,這相當於在微調成本更低的情況下實現了相當的精度。隕石坑探測的性能則因尺度而異:在米級分辨率下,該模型與 SwinV2-B 的性能相當;而在約 100 米的尺度下,該模型僅使用一半的訓練數據,性能就比 SwinV2-B 高出近 19%。 NASA 月球地形專家、該項目的共同負責人邁克爾·巴克表示,該模型的優勢在於那些年齡仍存在爭議的地貌特徵:“這些地貌特徵的年齡仍然是一個備受爭議的問題,因此,我們越了解它們的分佈和屬性,就越有可能解開這個謎團。”
「NASA 花費數十年時間建立了非凡的月球科學記錄,但收集數據只是工作的一部分。我們還必須讓科學家更容易探索和使用數據,」NASA 總部首席科學數據官兼代理首席數據與人工智慧官凱文墨菲 (Kevin Murphy) 表示。 IBM 歐洲、英國和愛爾蘭研究院院長胡安·貝爾納貝-莫雷諾 (Juan Bernabe-Moreno) 表示,該模型“為科學家大規模探索月球奠定了基礎,將不同儀器的觀測結果聯繫起來,揭示了單獨觀測難以發現的模式,並提供了一個全球研究界可以共同構建的開放平台。”
現在所有功能都以開源許可發布,IBM 的研究部落格更深入地介紹了 NASA 的三個初始用例。這與 IBM 在企業級Granite 4.0中採用的開源策略如出一轍,只不過這次應用於科學領域。在這個領域,稀缺資源是標記資料和用於對其進行微調的運算能力,而直接使用者則是著陸點風險分析和為長期月球駐留進行資源勘探。




Amazon