Ve světě umělé inteligence se objevil nový hráč, který dobyl komunitu útokem. DeepSeek-R1, open-source model uvažování, se díky svému průlomovému výkonu dostává na titulní stránky novin. Tento model se stal vážným konkurentem a co do možností soupeří s vlajkovou lodí řady modelů O1 od OpenAI a zároveň je výrazně nákladově efektivnější. Ještě působivější je, že tým DeepSeek dosáhl tohoto výkonu s mnohem nižšími a omezenějšími zdroji a při dodržování přísných předpisů pro vývoz GPU. Co ale vlastně DeepSeek je a proč je tento vývoj tak monumentálním krokem vpřed ve výzkumu umělé inteligence?
Kdo je DeepSeek a co je to model uvažování?
DeepSeek je ambiciózní laboratoř pro výzkum umělé inteligence se sídlem v Číně, která si rychle získala uznání za svůj inovativní a dostupný přístup k umělé inteligenci. Zaměřením se na vývoj s otevřeným zdrojovým kódem se etablovala jako klíčový hráč v komunitě umělé inteligence a vytváří vysoce výkonné modely dostupné širšímu publiku. Jejich nejnovější výtvor, DeepSeek-R1, je „model uvažování“, typ modelu umělé inteligence navržený tak, aby vynikal v logické dedukci, řešení problémů a porozumění složitým vztahům nad rámec základního rozpoznávání vzorů.
Modely uvažování, jako je DeepSeek-R1, se liší od tradičních modelů velkých jazyků (LLM) simulací myšlenkového procesu krok za krokem. Místo pouhého generování odpovědí na základě vzorců v datech rozděluje R1 složité problémy na menší, logické kroky, než dospěje k řešení. I když tento přístup může při inferenci trvat o něco déle, umožňuje modelu dosahovat výrazně lepších výsledků v úkolech vyžadujících hluboké porozumění, jako je matematické uvažování, programátorská pomoc a rozhodování.
Proč je DeepSeek-R1 převratnou technologií
Co skutečně odlišuje DeepSeek-R1 od ostatních, je jeho open-source technologie. V odvětví, kde jsou přední modely umělé inteligence často skryty za bariérami, DeepSeek zveřejnil svůj model a podrobnou výzkumnou práci, která popisuje jejich přesné metodologie. Tento odvážný krok je významným odklonem od typicky uzavřené povahy organizací, jako je OpenAI.
Tato otevřenost podnítila vlnu experimentování v komunitě umělé inteligence. Vývojáři a výzkumníci po celém světě hostují DeepSeek-R1, aby prozkoumali a porovnali jeho schopnosti. Existují iniciativy, které replikují strategie popsané v článku, jako například projekt Open-R1 společnosti Huggingface na GitHubu , což je rozpracovaná, plně otevřená reprodukce DeepSeek-R1, včetně trénovacího kódu. Toto úsilí dále zesiluje přístupnost a potenciál spolupráce R1 a umožňuje širšímu publiku zapojit se do jeho inovací a dále na nich stavět.
Vydání DeepSeek-R1 má dalekosáhlé důsledky pro komunitu umělé inteligence i mimo ni. Otevřeným zpřístupněním svého modelu a výzkumu DeepSeek snížil bariéry inovací v oblasti umělé inteligence. Nezávislí výzkumníci, startupy a amatéři nyní mají přístup k špičkovému modelu uvažování, jehož vývoj by obvykle vyžadoval obrovské finanční a výpočetní zdroje. Open-source povaha tohoto vydání již podnítila kreativní experimentování v komunitě; vývojáři experimentují s kombinací schopností uvažování DeepSeek-R1 s jinými modely , aby vylepšili jejich výkon. Jedním z pozoruhodných příkladů je integrace s Claude Sonnet 3.5 od Anthropic, známým pro svůj silný kódovací výkon; ve spojení s schopnostmi uvažování DeepSeek R1 dokázal dosáhnout mnohem vyššího skóre v benchmarkech, jako je Aidar Bench.
Pochopení Nvidia H800 a klíčových rozdílů oproti H100
Na první pohled se Nvidia H800 jeví jako mírně zmenšená verze H100, přičemž nejpatrnější rozdíl spočívá ve výpočetním výkonu FP64. H100 se může pochlubit 34 TFLOP výkonu FP64 ve srovnání s pouhým 1 TFLOP u H800. Tento rozdíl však nepředstavuje významný problém pro většinu úloh umělé inteligence. Moderní modely umělé inteligence se obvykle trénují pomocí formátů s nižší přesností, jako jsou BF16 nebo FP16, optimalizovaných pro rychlost a efektivitu. Přesnost FP64 je primárně zahrnuta v GPU, aby byla zachována kompatibilita se staršími nástroji a vědeckými výpočetními aplikacemi, kde jsou výpočty s dvojitou přesností nezbytné. Pro trénování umělé inteligence je výkon FP64 zřídka úzkým hrdlem.
Skutečnou výzvou H800 je jeho rychlost propojení. Nabízí propojovací šířku pásma NVLink 4.0 400 GB/s, což je méně než polovina 900 GB/s, které nabízí H100. Toto více než 50% snížení šířky pásma má významné důsledky pro sestavy s více GPU, kde jsou tisíce GPU propojeny pro trénování ve velkém měřítku.
| Nvidia H100 SXM | Nvidia H800 SXM | |
| FP64 | 34 TFLOPs | 1 TFLOPs |
| FP64 Tensor Core | 67 TFLOPs | 1 TFLOPs |
| FP32 | 67 TFLOPs | 67 TFLOPs |
| FP32 Tensor Core | 989 TFLOPy | 989 TFLOPy |
| Tenzorové jádro BF16 | 1,979 TFLOPy | 1,979 TFLOPy |
| FP16 Tensor Core | 1,979 TFLOPy | 1,979 TFLOPy |
| FP8 Tensor Core | 3,958 TFLOPy | 3,958 TFLOPy |
| INT8 Tensor Core | 3,958 TOPy | 3,958 TOPy |
| Paměť GPU | 80 GB | 80 GB |
| Šířka pásma paměti GPU | 3.35 TB / s | 3.35 TB / s |
| Maximální tepelný návrhový výkon (TDP) | 700W | 700W |
| Rychlost propojení NVIDIA NVLink 4.0 | 900GB / s | 400GB / s |
Proč záleží na rychlosti propojení: Dopad na školení
Při rozsáhlém trénování umělé inteligence grafické procesory (GPU) často spolupracují s využitím různých technik paralelismu. Mezi běžné patří datový paralelismus, modelový paralelismus, pipeline paralelismus a tenzorový paralelismus. Tenzorový paralelismus, kdy jsou velké tenzory pro výpočet rozděleny mezi více GPU, je obzvláště citlivý na šířku pásma propojení.
Ale co přesně je tenzor? Jednoduše řečeno, tenzory jsou základní datové struktury používané v modelech umělé inteligence k reprezentaci vstupů, vah a mezivýpočtů.
Při trénování velkých modelů umělé inteligence se tyto tenzory mohou stát tak masivními, že se nevejdou do paměti jediné grafické karty (GPU). Aby se to zvládlo, jsou tenzory rozděleny mezi více GPU, přičemž každá GPU zpracovává část tenzoru. Toto rozdělení umožňuje škálování modelu na více GPU, což umožňuje trénovat mnohem větší modely, než by jinak bylo možné.
Rozdělování tenzorů však vyžaduje častou komunikaci mezi GPU pro synchronizaci výpočtů a sdílení výsledků. Zde se rychlost propojení stává kritickou. Snížená šířka pásma NVLink v H800 zpomaluje komunikaci mezi GPU v této fázi, což vede ke zvýšené latenci a snížení celkové efektivity trénování.
Toto úzké hrdlo se stává ještě výraznějším ve scénářích zahrnujících rozsáhlé modely s miliardami parametrů, kde je pro synchronizaci tenzorových výpočtů vyžadována častá komunikace mezi GPU. I když je tenzorový paralelismus nejcitlivější na pomalejší propojení, není to jediný ovlivněný aspekt.
Škálování trénování umělé inteligence na H800 se stává stále náročnějším kvůli pomalejšímu propojení, které není ideální pro úlohy, které se silně spoléhají na efektivní komunikaci mezi více GPU.
Trénink modelu DeepSeek
Vzhledem k výzvám spojeným se škálováním trénování na GPU H800 vyvstává přirozená otázka: jak DeepSeek trénoval tak moderní (SOTA) model umělé inteligence, jako je R1? DeepSeek-R1 je verzí DeepSeek-v3, což je parametrický model 671B. Tento základní model DeepSeek-v3 prošel dalším trénováním pomocí posilovacího učení (RL), aby se v modelu vyvolalo uvažování.
Důležité je poznamenat, že čísla a techniky uvedené výše se vztahují k výzkumné práci o DeepSeek-v3 . DeepSeek-R1 vyžadoval další školicí zdroje, ale přesné podrobnosti nejsou k dispozici. DeepSeek-v3 je však model SOTA a mnoho technik zmíněných v práci o DeepSeek-v3 bylo pravděpodobně přeneseno do školení R1.
Čísla jsou navíc uváděna pouze pro poslední úspěšný tréninkový běh. Toto nezahrnuje experimenty s architekturou, algoritmy ani daty. Ale i s ohledem na to DeepSeek podle své vlastní zprávy dosáhl tohoto výkonu s výrazně nižšími zdroji než Meta Llama.
Takže, když jsme si toto objasnění ujasnili, jak DeepSeek natrénoval tak působivý model? Aniž bychom se zabývali příliš detaily, což by přesahovalo rámec tohoto článku, lze techniky použité k trénování DeepSeek v3 rozdělit do dvou hlavních kategorií: využití FP8 s nižší přesností pro trénování a optimalizace komunikace mezi GPU za účelem minimalizace nákladných operací. Zavedení trénování FP8 se smíšenou přesností ve velkém měřítku bylo první, které zmenšilo velikost vah a zvýšilo výpočetní propustnost (TFLOP), což umožnilo rychlejší a efektivnější trénování. Na druhou stranu, optimalizace komunikace, jako je minimalizace potřeby tenzorového paralelismu a zlepšení komunikace mezi uzly, řešily výzvy, které představovala omezená šířka pásma propojení GPU H800.
Historicky se FP8 pro trénování příliš nepoužíval, protože gradienty, které jsou klíčové pro aktualizaci vah modelu během zpětného šíření, často nekonvergují, pokud jsou reprezentovány v tak málo přesném formátu. Omezený dynamický rozsah a přesnost FP8 ztěžují přesné zachycení drobných aktualizací vah, což vede k nestabilitě trénování. DeepSeek-v3 tuto výzvu překonal zavedením několika jemnozrnných kvantizačních technik, jako je škálování po dlaždicích a blokech, které umožnily modelu adaptivně škálovat aktivace a váhy pro lepší zpracování odlehlých hodnot. To bylo kombinováno se zlepšenou přesností akumulace prostřednictvím středně přesné propagace FP32, která umožnila trénování pomocí FP8.
Na straně komunikace byl vyvinut „algoritmus DualPipe“, který překrývá výpočet a komunikaci, čímž se výrazně snižuje počet bublin v pipeline. Co je to bublina v pipeline? V paralelismu pipeline je trénování rozděleno do fází a rozloženo mezi GPU. Při použití této strategie mohou nastat období nečinnosti, kdy některé GPU čekají na připravenost dat z předchozích fází v pipeline nebo z následujících fází, čímž se snižuje MFU trénovacího clusteru. DualPipe minimalizuje tyto neefektivity překrýváním výpočtů a komunikace, skrytím latence a udržováním GPU zaneprázdněných. Spolu s DualPipe bylo také implementováno vlastní jádro pro komunikaci mezi uzly typu all-to-all, které plně využívá šířky pásma NVLink a InfiniBand a zajišťuje efektivní škálování napříč uzly.
Tyto inovace byly pečlivě navrženy tak, aby překonaly omezená hardwarová omezení a umožnily efektivní trénování modelů DeepSeek.
Co to znamená pro ostatní laboratoře umělé inteligence a komunitu umělé inteligence jako celek?
Vydání DeepSeek-R1 vyvolalo v komunitě umělé inteligence významnou diskusi a reflexi. Zatímco někteří se zapojili do kritizování načasování a metod jeho vydání, je nezbytné si uvědomit širší kontext vývoje modelů umělé inteligence. Trénování modelů SOTA je časově náročný proces a modely, které vidíme dnes, pravděpodobně zahájily své trénovací cykly již koncem roku 2023 nebo začátkem roku 2024.
Neměli bychom také přehlížet vyvíjející se paradigma ve vývoji modelů umělé inteligence. Historicky bylo předtrénování na masivních datových sadách nezbytné kvůli nedostatku vysoce kvalitních syntetických dat z jiných modelů a protože škálování předtrénování vedlo k významnému zvýšení výkonu. Proto se rané modely pro dosažení svých možností silně spoléhaly na extrahovaná data a škálování předtrénování. Současná generace modelů, včetně DeepSeek-R1, však v různých fázích trénování významně těžila ze syntetických dat. Rodina modelů OpenAI o1 je pravděpodobně také založena na předchozích modelech GPT 4o a vyvinula se z masivního modelu GPT 4 s 1.8 biliony parametrů na efektivnější model Turbo a nakonec pravděpodobně na mnohem menší modely 4o, které používáme dnes.
Za zmínku také stojí, že DeepSeek-R1 je jen začátek. Další organizace, jako například Anthropic, Meta, Mistral a Cohere, téměř jistě pracují na podobných modelech uvažování. Vydání R1 signalizuje začátek nové vlny modelů umělé inteligence, které budou i nadále posouvat hranice uvažování, řešení problémů a výkonu specifických pro dané úkoly. Rostoucí dostupnost výkonu GPU tento trend dále urychluje a umožňuje laboratořím generovat více syntetických dat pro jemné doladění a posilovací učení (RL). To zase umožňuje modelům vynikat ve složitých úkolech, jako je generování kódu a logické uvažování.
Iniciativa DeepSeek v oblasti open source bude mít zásadní dopad na komunitu umělé inteligence. Zveřejnění jejich modelu a metodologií podnítilo inovace v rámci komunity open source a inspirovalo další laboratoře k přijetí podobných přístupů. Uznání hodnoty spolupráce v oblasti open source ze strany DeepSeek staví na precedentu, který vytvořily organizace jako Meta, tým Qwen z Alibaby a další. Bez těchto předchozích příspěvků by komunita umělé inteligence pravděpodobně byla mnohem méně vyspělá, než je dnes.
Závěr
Vydání DeepSeek-R1 s otevřeným zdrojovým kódem je krokem správným směrem. Zatímco modely s uzavřeným zdrojovým kódem mají své místo, hnutí open-source zajišťuje, že inovace jsou přístupné širšímu publiku a podporuje inkluzivnější a konkurenčnější prostředí.
Umělá inteligence (AI) je iterativní proces a komunita open-source z této iterativní povahy vzkvétá a urychluje pokrok nebývalým způsobem. Mnozí pevně věří, že open source je jediná cesta vpřed, která zajistí, že žádný subjekt v budoucnu nebude vlastnit AI ani potenciálně AGI (umělou obecnou inteligenci). Jedna z předních čínských laboratoří umělé inteligence sdílí tuto filozofii, otevřeně podporuje a přispívá k hnutí open-source, čímž pouze potvrzuje jeho důležitost.
DeepSeek-R1 je v konečném důsledku více než jen model; je to výzva k akci. Inspiruje výzkumníky, vývojáře a nadšence k posouvání hranic možného, k inovacím s využitím dostupných zdrojů a k přispívání k rychle se rozvíjejícímu oboru. S růstem prostředí umělé inteligence zůstane iterativní a kolaborativní duch open-source komunity hnací silou a bude utvářet budoucnost umělé inteligence nebývalými způsoby.




Amazon