Kontrolné body sú kľúčové pre trénovanie modelov umelej inteligencie, pretože zabezpečujú odolnosť, efektívnosť a schopnosť obnoviť alebo doladiť trénovanie z uložených stavov. Požiadavky moderných pracovných záťaží umelej inteligencie s čoraz komplexnejšími modelmi a rozsiahlymi trénovacími súbormi údajov však posúvajú úložisko na hranicu jeho možností.
Úloha kontrolných bodov v pracovných postupoch umelej inteligencie
Kontrolné body v tréningu umelej inteligencie sú kritickým procesom, ktorý zahŕňa pravidelné ukladanie kompletného stavu modelu počas tréningu. Tento stav zahŕňa váhy a parametre modelu, stavy optimalizátora, harmonogramy rýchlosti učenia a metadáta tréningu. Kontrolné body vytvárajú komplexný prehľad tréningového procesu v špecifických intervaloch, čím zabezpečujú kontinuitu tréningu a jeho obnovu v prípade prerušenia.
Kontrolné body sa zvyčajne vykonávajú v iteračných intervaloch (napr. každých tisíc tréningových krokov). Moderné tréningy LLM, ktoré môžu trvať týždne alebo mesiace a spotrebúvať obrovské výpočtové zdroje, sa vo veľkej miere spoliehajú na tieto kontrolné body ako na bezpečnostnú sieť proti potenciálnym zlyhaniam. Napríklad tréning modelu, ako je trieda GPT-4, môže generovať kontrolné body s veľkosťou od niekoľkých stoviek gigabajtov až po niekoľko terabajtov v závislosti od veľkosti modelu a konfigurácie tréningu.
Tréningový proces generovaný systémom DALL-E
Primárny účel kontrolných bodov presahuje rámec samotnej funkcie zálohovania. Slúži ako kľúčový mechanizmus pre odolnosť tréningu, ktorý umožňuje obnovenie tréningu z posledného uloženého stavu, a nie začatie od nuly v prípade zlyhania systému, výpadkov napájania alebo problémov s hardvérom. Kontrolné body sú navyše neoceniteľné pre analýzu modelu, čo umožňuje výskumníkom skúmať vývoj modelu v rôznych fázach tréningu a potenciálne sa vrátiť do predchádzajúcich stavov, ak sa zistí zníženie výkonu.
Vzory zápisu počas kontrolných bodov sú obzvlášť zaujímavé z hľadiska úložiska. Keď sa spustí kontrolný bod, systém musí zapisovať obrovské množstvo dát v dávkovom vzore. To vytvára charakteristický profil I/O, ktorý sa vyznačuje obdobiami relatívne nízkej aktivity úložiska počas trénovacích výpočtov, po ktorých nasledujú intenzívne operácie zápisu s vysokou šírkou pásma počas kontrolných bodov. Tieto operácie zápisu sú zvyčajne sekvenčné a môžu výrazne profitovať z úložných systémov optimalizovaných pre sekvenčné zápisy s vysokou šírkou pásma.
Rôzne stratégie paralelizmu v distribuovanom tréningu môžu významne ovplyvniť správanie pri kontrolných bodoch. Tieto stratégie paralelizmu ovplyvňujú, kedy dochádza k kontrolným bodom počas tréningu a ktorá časť modelu sa kontroluje. V moderných distribuovaných tréningových nastaveniach môže viacero grafických procesorov (GPU) súčasne zapisovať do rôznych častí tej istej vrstvy, čím vytvára zložité vzory vstupu/výstupu. Táto schopnosť paralelného zápisu je kľúčová pre efektívnosť, ale vyžaduje si starostlivú koordináciu a robustné úložné systémy, ktoré dokážu spracovať súbežné operácie zápisu a zároveň zachovať konzistenciu údajov. Úložný systém musí byť schopný efektívne riadiť tieto súčasné zápisy, pretože akékoľvek úzke hrdlo v tomto procese môže viesť k celkovým oneskoreniam tréningu.
Pomalé stanovovanie kontrolných bodov môže spôsobiť značné úzke miesta v tréningu, pretože celý tréningový proces sa musí pozastaviť, kým sa kontrolný bod zapisuje do úložiska. Napríklad vo veľkom tréningovom prostredí, ak stanovovanie kontrolných bodov trvá 30 minút každých niekoľko hodín, môže to viesť k niekoľkým hodinám nahromadeného prestoja počas celého tréningového obdobia. To priamo ovplyvňuje efektivitu tréningu a zvyšuje prevádzkové náklady, najmä v cloudových prostrediach, kde sa výpočtové zdroje fakturujú podľa času.
Vďaka rýchlejšiemu vytváraniu kontrolných bodov si tímy môžu dovoliť vytvárať kontrolné body častejšie, čím sa znižuje maximálna potenciálna strata údajov v prípade zlyhania. To umožňuje agresívnejšie tréningové prístupy a lepšie experimentálne iteračné cykly. Rýchle časy načítania kontrolných bodov navyše uľahčujú rýchlejšie experimentovanie s rôznymi tréningovými konfiguráciami a architektúrami modelov, pretože výskumníci sa môžu ľahšie obnoviť z predchádzajúcich stavov a vyskúšať alternatívne prístupy.
Schopnosť úložného systému efektívne zvládať tieto operácie s kontrolnými bodmi sa stáva kľúčovým faktorom v celkovej infraštruktúre trénovania. Vysokovýkonné úložné riešenia, ktoré dokážu zvládnuť vzory zápisu v dávkovom režime kontrolných bodov aj trvalé operácie čítania/zápisu pri trénovaní, môžu výrazne ovplyvniť celkový čas a náklady na trénovanie rozsiahlych jazykových modelov. Výkonnostné charakteristiky úložného subsystému, najmä pri spracovaní veľkých sekvenčných zápisov a udržiavaní konzistentne vysokej šírky pásma, sú preto kľúčovými faktormi pri navrhovaní infraštruktúry trénovania LLM.
Pre túto správu sme chceli vyhodnotiť výkon SSD diskov pre kontrolné body s umelou inteligenciou a zhodnotiť výhody najnovších SSD diskov Gen5, keď je rýchlosť kontrolných bodov kritická, v porovnaní s najväčšími QLC SSD diskami na trhu, ktoré dokážu uložiť obrovské množstvo kontrolných bodov, ak by to bolo výhodnejšie pre trénovaný model.
Výkonnosť kontrolných bodov – benchmarking s DLIO
Na vyhodnotenie reálneho výkonu SSD disku Solidigm v tréningových prostrediach umelej inteligencie sme použili porovnávací nástroj Data and Learning Input/Output (DLIO) . DLIO, vyvinutý Národným laboratóriom Argonne, je špeciálne navrhnutý na testovanie vzorov I/O v úlohách hlbokého učenia. Poskytuje prehľad o tom, ako úložné systémy zvládajú výzvy spojené s kontrolnými bodmi, príjmom údajov a trénovaním modelov.
V spolupráci s DLIO sme sa zamerali na meranie priepustnosti, latencie a spoľahlivosti disku v intenzívnych scenároch s kontrolnými bodmi. Hoci toto testovanie bolo vykonané na disku D5-P5336 s kapacitou 61.44 TB, počiatočné údaje o výkone ukázali, že verzia Solidigm D5-P5336 s kapacitou 122 TB ponúka podobný výkonnostný profil. Do tohto testu sme zahrnuli aj výsledky z disku D7-PS1010 založeného na TLC, aby sme ukázali výhody rozhrania PCIe Gen5. Tieto dva disky sme vybrali, aby sme ukázali oba uhly v kontrolných bodoch, jeden predstavuje najrýchlejší možný čas kontrolného bodu a druhý ukladá najviac kontrolných bodov na jeden SSD disk.
Platformou zvolenou pre túto prácu bol náš Dell PowerEdge R760 s operačným systémom Ubuntu 22.04.02 LTS. Použili sme benchmark DLIO verzie 2.0 z vydania 13. augusta 2024. Konfigurácia nášho systému je uvedená nižšie:
- 2 x Intel Xeon Gold 6430 (32-jadrový, 2.1 GHz)
- 16 x 64GB DDR5-4400
- 480 GB SSD disk Dell BOSS
- Sériové káble Gen5 JBOF
- 7.68 TB Solidigm D7-PS1010
- 61.44 TB Solidigm D5-P5336
Aby sme zabezpečili, že naše benchmarkingové testovanie odráža scenáre z reálneho sveta, založili sme naše testovanie na architektúre modelu LLAMA 3.1 405B a implementovali sme kontrolné body pomocou torch.save() na zachytenie parametrov modelu, stavov optimalizátora a stavov vrstiev. Naše nastavenie simulovalo systém s 8 GPU a implementovalo hybridnú stratégiu paralelizmu so 4-cestným tenzorovým paralelným spracovaním a 2-cestným pipeline paralelným spracovaním distribuovaným medzi osem GPU. Táto konfigurácia viedla k veľkosti kontrolných bodov 1 636 GB, čo predstavuje moderné požiadavky na trénovanie modelov veľkých jazykov.
Náš testovací proces pre záťaž kontrolných bodov DLIO pozostával z naplnenia každého disku na podobnú úroveň využitia. Pre 61.44 TB Solidigm D5-P5336 každý priechod zahŕňal 33 kontrolných intervalov, čo spolu predstavovalo 54 TB. Menší 7.68 TB D7-PS1010 sa pohodlne zmestil do troch kontrolných intervalov s celkovou kapacitou 4.9 TB. Do D7-PS1010 sa zmestil jeden ďalší kontrolný bod, hoci jeho využitie bolo o niečo vyššie, ako sme požadovali.
Zaujímavé výsledky sme zaznamenali pri porovnaní kontrolných bodov DLIO D5-P5536 s kapacitou 61.44 TB a diskom Gen4 QLC s diskom Gen5 TLC s kapacitou 7.68 TB a diskom Gen5 TLC. Počas prvého testu, keď sa disky zapĺňali, sme zaznamenali väčší rozdiel vo výkone medzi týmito dvoma modelmi SSD. Rýchlejší disk Gen5 PS1010 dokončil každý kontrolný bod v priemere za 464 sekúnd v porovnaní so 623 sekundami pre disk Gen4 P5336. V druhom a treťom teste sa rozdiel zmenšil na 579 a 587 sekúnd pre disk PS1010 a 676 a 680 sekúnd pre disk P5336.
Pre firmy, ktoré chcú mať čo najmenšiu medzeru v intervaloch kontrolných bodov, ponúka PS1010 Gen5 na báze TLC výhodu v najrýchlejšom čase dokončenia. Ak je cieľom nákladovo efektívne udržať veľa kontrolných bodov, P5336 Gen4 na báze QLC to dokáže. Namerali sme rozdiel v priemerných časoch kontrolných bodov medzi oboma diskami počas druhého a tretieho prechodu menej ako 17 %.
Šírka pásma úložiska GPUDirect
Zatiaľ čo DLIO ukazuje výkon flash pamäte v pracovnom postupe s umelou inteligenciou, pracovná záťaž je úplne založená na zápise, kým sa neobnoví kontrolný bod. Pre úplnejší obraz Solidigm D7-PS1010 a D5-P5336 v pracovných záťažiach s umelou inteligenciou sme zahrnuli merania šírky pásma čítania pomocou GDSIO.
Ako funguje priame úložisko GPU
Tradične, keď grafická karta (GPU) spracováva dáta uložené na disku NVMe, musia dáta najprv prejsť cez procesor (CPU) a systémovú pamäť, než sa dostanú k grafickej karte (GPU). Tento proces spôsobuje úzke miesta, pretože procesor sa stáva sprostredkovateľom, čo zvyšuje latenciu a spotrebúva cenné systémové zdroje. Priame úložisko (GPU Direct Storage) eliminuje túto neefektívnosť tým, že umožňuje grafickej karte pristupovať k dátam priamo z úložného zariadenia cez zbernicu PCIe. Táto priama cesta znižuje réžiu spojenú s pohybom dát, čo umožňuje rýchlejší a efektívnejší prenos dát.
Pracovné zaťaženie umelej inteligencie, najmä tie, ktoré zahŕňajú hlboké učenie, je vysoko dátovo náročné. Trénovanie veľkých neurónových sietí vyžaduje spracovanie terabajtov dát a akékoľvek oneskorenie v prenose dát môže viesť k nedostatočnému využitiu grafických procesorov (GPU) a dlhším časom trénovania. Priame úložisko GPU rieši túto výzvu tým, že zabezpečuje čo najrýchlejšie doručenie dát do GPU, minimalizuje čas nečinnosti a maximalizuje výpočtovú efektivitu.
Podobne ako pri teste DLIO je cieľom lepšie pochopiť a charakterizovať rozdiely medzi vysokorýchlostnými SSD diskami Gen5 a vysokokapacitnými diskami QLC. Nie každá pracovná záťaž s umelou inteligenciou je rovnaká a každý disk ponúka odlišné výhody v závislosti od potreby.
Testovacia konfiguračná matica
V našej testovacej platforme sme systematicky testovali každú kombináciu nasledujúcich parametrov s grafickou kartou NVIDIA L4:
- Veľkosti blokov: 1M, 128K, 64K, 16K, 8K
- Počet nití: 128, 64, 32, 16, 8, 4, 1
- Počet úloh: 16
- Veľkosti šarží: 16
Náš prvý pohľad sa zameral na D5-P5336 založený na QLC, ktorý dosiahol maximálnu rýchlosť 4.2 GiB/s pri prenosovej veľkosti 1 MB a hĺbke I/O 128. Vplyv veľkosti blokov viedol k výraznému zvýšeniu šírky pásma, ktorá sa zvýšila z 8K na 1 MB. Výhoda zvýšenej hĺbky I/O začala slabnúť pri hodnote 32, kde sa pracovné zaťaženie začalo vyrovnávať.
Ďalej sa pozrieme na Gen5 PS-1010, ktorý sa dokáže škálovať až na 6.2 GiB/s pri veľkosti bloku 1 MB a hĺbke I/O 128. Celkovo prekonal P5336 založený na Gen4, pričom pri určitých pracovných zaťaženiach vykázal výrazný nárast. Jednou z pozoruhodných oblastí zlepšenia bola veľkosť bloku 128 kB, kde pri hĺbke I/O 64 a 128 ponúkal PS1010 dvojnásobnú šírku pásma čítania ako P5336.
Je dôležité poznamenať, že oba SSD disky boli testované s grafickou kartou NVIDIA L4. Zatiaľ čo Gen4 D5-P5336 je na vrchole alebo blízko neho, grafické karty NVIDIA vyššej triedy, ako napríklad H100, preukázali vyšší výkon s D7-PS1010. Rýchlosť disku je pre niektorých zákazníkov rozhodujúcim faktorom, zatiaľ čo iní uprednostňujú celkovú hustotu. Spoločnosť Solidigm poskytuje riešenia pre obe skupiny so svojimi ponukami SSD diskov QLC a TLC.
Záver
Keďže rozsah a komplexnosť tréningu umelej inteligencie neustále rastie, základná úložná infraštruktúra musí nielen držať krok, ale aj určovať tempo. Naše testy s dvoma veľmi odlišnými SSD diskami ilustrujú dôležitosť zosúladenia úložných riešení s konkrétnymi prioritami tréningu, ako je minimalizácia latencie kontrolných bodov alebo maximalizácia hustoty kontrolných bodov pre nákladovo efektívnu škálovateľnosť.
V našom hodnotení sme testovali disky Solidigm D5-P5336 (61.44 TB) a D7-PS1010 (7.68 TB) za realistických podmienok trénovania umelej inteligencie pomocou benchmarku DLIO a rozsiahleho hybridno-paralelného pracovného postupu kontrolných bodov LLM. Zaznamenávali sme metriky odrážajúce výkon zápisu kontrolných bodov počas viacerých behov, keď sa disky zapĺňali, pričom sme zdôraznili rozdiely v časoch dokončenia medzi D5-P5336 založeným na Gen4 QLC a D7-PS1010 založeným na Gen5 TLC.
Zatiaľ čo D7-PS1010 poskytoval najrýchlejší možný zápis v kontrolných bodoch, D5-P5336 preukázal presvedčivé výhody v oblasti nákladovej efektívnosti a kapacity s len miernym znížením výkonu. Ďalej sme skúmali šírky pásma čítania GPU Direct Storage s GDSIO prostredníctvom GPU NVIDIA L4. Zistili sme, že Solidigm D5-P5336 ponúka šírku pásma čítania až 4.2 GiB/s s veľkosťou prenosu 1 MB, zatiaľ čo D7-PS1010 ponúka výrazné zvýšenie na 6.2 GiB/s. Ešte lepší výkon by ste dosiahli využitím ešte väčšej GPU, ako je napríklad NVIDIA L40s alebo H100/H200.
S výhľadom do budúcnosti má bezprecedentná kapacita SSD disku Solidigm D5-P5336 s kapacitou 122 TB zásadný vplyv na školenia a nasadzovanie umelej inteligencie. Keďže veľkosť modelov a požiadavky na kontrolné body neustále rastú, tieto masívne disky otvárajú dvere k novým úrovniam efektívnosti a flexibility, čo umožňuje stratégie školenia, ktoré boli predtým nedosiahnuteľné. Vedúce postavenie spoločnosti Solidigm v oblasti riešení SSD s vysokou kapacitou umožňuje organizáciám ukladať viac údajov a kontrolných bodov na menší počet diskov a pomáha im zabezpečiť infraštruktúru v budúcnosti proti ďalšej vlne zložitosti umelej inteligencie.
SSD disk Solidigm D5-P5336 s kapacitou 122 TB
Túto správu sponzoruje spoločnosť Solidigm. Všetky názory a stanoviská vyjadrené v tejto správe vychádzajú z nášho nestranného pohľadu na posudzovaný(e) produkt(y).




Amazonka