StorageReview.com

Meta AI Llama 3: Budoucnost jazykových modelů umělé inteligence

AI  ◇  Enterprise

Společnost Meta AI vyvinula a oznámila Llama 3 , rozsáhlý jazykový model, který svými předchozími verzemi dělá vlny v oblasti umělé inteligence. Tento nejnovější přírůstek do rodiny Llama se pyšní působivými schopnostmi, včetně generování souvislého a plynulého textu, odpovídání na otázky a zapojení se do konverzace.

Llama 3

Lama 3 – Jen další revize?

Co odlišuje Llama 3 od jejích předchůdců? Podle výsledků lidského hodnocení dosahuje model míry úspěšnosti 59.3 % proti Mistral Medium a 63.7 % proti GPT-3.5. Tato působivá čísla naznačují, že Llama 3 dokáže generovat text srovnatelné kvality s textem generovaným člověkem.

Trénovací datová sada pro Llama 3 se skládá z více než 15T tokenů shromážděných z veřejně dostupných zdrojů, což ji činí sedmkrát větší než trénovací datová sada použitá pro Llama 2. Tato rozsáhlá trénovací data umožňují modelu generovat rozmanitý a přesný text.

Tato datová sada o objemu 15 bilionů tokenů je výrazně větší než její předchůdce, obsahuje sedmkrát více dat než Llama 2 a zahrnuje rozsáhlou škálu kódu – což je čtyřnásobek množství používaného dříve. Více než 5 % dat tvoří vysoce kvalitní neanglický obsah zahrnující více než 30 jazyků, ačkoli se uznává, že výkon v těchto jazycích nemusí dosáhnout úrovně pozorované v angličtině.

Pro zajištění kvality dat vyvinula společnost Meta sofistikované filtrační postupy. Patří mezi ně heuristické filtry, filtry obsahu NSFW, sémantická deduplikace a klasifikátory určené k posouzení kvality textu. Zajímavé je, že Llama 2 byl použit k upřesnění trénovacích dat pro tyto klasifikátory kvality, což se ukázalo jako klíčové pro následnou generaci.

Bezpečnost lamy 3

Pokud jde o škálování předtrénování, Meta inovovala s podrobnými zákony škálování, aby efektivně vylepšila trénování modelů. Tyto zákony řídí kombinaci dat a výpočetního využití a optimalizují výkon v různých benchmarkech, jako je generování kódu. Překvapivě modely s parametry 8B a 70B vykazovaly trvalé zlepšování výkonu nad rámec tradičních trénovacích limitů a prokázaly potenciál v rozsáhlých trénovacích scénářích s daty.

Lama 3 a ty

Budoucnost ekosystému Llama vypadá také slibně, s plány na rozšíření možností modelu a jeho zpřístupnění vývojářům. To znamená, že v nadcházejících měsících a letech můžeme očekávat ještě více inovativních aplikací Llama 3.

Pro praktickou tréninkovou aplikaci společnost Meta využila trojici strategií paralelizace – datovou, modelovou a pipeline paralelizaci – k trénování v bezprecedentním měřítku s využitím 16 tisíc grafických procesorů (GPU) . Toto škálování bylo umožněno zakázkově vytvořenými clustery GPU a novým trénovacím zásobníkem, který zajišťuje více než 95 % efektivního času trénování automatizací údržby a optimalizací využití GPU.

Společnost Meta uvádí, že zdokonalování po trénování pomocí ladění instrukcí bylo zásadní. Techniky, jako je řízené jemné ladění, vzorkování odmítnutí a optimalizace politik, zdokonalily výkon modelu u specifických úkolů a pomohly mu naučit se vybírat správné odpovědi z generovaných možností. Tato propracovaná strategie trénování výrazně zlepšila schopnosti modelu Llama 3 v oblasti uvažování a kódování a stanovila nový standard pro trénování a aplikaci modelů umělé inteligence.

Závěrečné myšlenky

Llama 3 přichází s mnoha konkurenty, kteří slibují lepší výkon a užitečnost. Díky svým působivým schopnostem a rozsáhlým trénovacím datům způsobí revoluci v naší interakci se stroji. Ať už jste vývojář, který chce Llamu integrovat do svého dalšího projektu, nebo se prostě zajímáte o budoucnost umělé inteligence, Llama 3 stojí za to sledovat.

Meta AI lze použít na Facebooku, Instagramu, WhatsAppu, Messengeru a webu. Dokumentace k Meta AI je k dispozici zde.

Webové stránky Llama 3 obsahují informace ke stažení pro modely a poskytují i ​​Průvodce zahájením práce.

Zapojte se do StorageReview

Zpravodaj | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | RSS kanál

Jordan Ranous

Specialista na umělou inteligenci; provede vás světem podnikové umělé inteligence. Autor a analytik pro Storage Review s praxí v oblasti analýzy velkých finančních dat, provozu/vývoje v datových centrech a analýzy zákaznické zkušenosti. Pilot, astrofotograf, guru pro LTO pásky a nadšenec pro baterie/solární energii.