LLaMA (Meta AI) (CS)
LLaMA (Large Language Model Meta AI) — rodina velkých jazykových modelů (LLM) s převážně otevřeným zdrojovým kódem, vyvíjená výzkumnou divizí Meta AI. Modely LLaMA jsou postaveny na upravené architektuře transformerů a jsou zaměřeny na vysokou výpočetní efektivitu, demokratizaci přístupu k pokročilým AI technologiím a snadnou adaptaci na specializované úlohy. Rodina se vyvinula od původního výzkumného vydání LLaMA 1 (únor 2023) až po multimodální modely LLaMA 4 (plánované vydání v roce 2026).
Název
Akronym LLaMA je zkratka pro Large Language Model Meta AI (Velký jazykový model Meta AI).
- Large Language Model — zdůrazňuje rozsah modelů, jejichž parametry se pohybují od miliard po triliony.
- Meta AI — označuje vývojáře, výzkumnou skupinu Meta.
Historie vzniku
Vývoj LLaMA začal koncem roku 2022 jako strategická odpověď Meta na úspěch ChatGPT od OpenAI. Mark Zuckerberg sestavil interdisciplinární tým zahrnující výzkumníky z laboratoře FAIR (Facebook AI Research). Klíčovou roli ve filozofii projektu sehrál Yann LeCun, vedoucí FAIR, který od roku 2013 zastával zásadu úplné otevřenosti veškerého výzkumu laboratoře.
První verze, LLaMA 1, byla vydána v únoru 2023 s výzkumnou licencí. Krátce po vydání, v březnu 2023, unikly váhy modelu do sítě přes BitTorrent. Tato událost, navzdory obavám, vývoj projektu nezastavila, ale naopak jej urychlila, protože umožnila nezávislým výzkumníkům a nadšencům po celém světě experimentovat s modelem. V důsledku toho se na platformě Hugging Face objevily desítky tisíc odvozených modelů. Následné verze, počínaje LLaMA 2, byly vydávány s komerční licencí[1], čímž se upevnilo postavení LLaMA jako klíčového hráče na trhu otevřených AI modelů.
Vývoj modelů a chronologie vydání
| Verze | Datum vydání | Rozsah parametrů | Klíčové inovace a vlastnosti |
|---|---|---|---|
| LLaMA 1 | Únor 2023 | 7B – 65B | Základní architektura (RMSNorm, SwiGLU, RoPE). Trénování na 1,4 bilionu tokenů. Kontextové okno 2048 tokenů. Výzkumná licence. |
| LLaMA 2 | Červenec 2023 | 7B – 70B | Fine-tuning pro dialogy (RLHF). Zavedení Grouped-Query Attention (GQA). Kontextové okno 4096 tokenů. První komerční licence. |
| Code Llama | Srpen 2023 | 7B – 70B | Specializovaná verze pro kód. Fine-tuning na 500 miliardách tokenů kódu. Varianty: základní, Python-specializovaný, instruction-tuned. |
| LLaMA 3 | Duben 2024 | 8B, 70B | Trénování na 15 bilionech tokenů. Vylepšený tokenizátor se slovníkem 128 tisíc tokenů. Vysoký výkon (82 % na MMLU). |
| LLaMA 3.1 | Červenec 2024[2] | 8B, 70B, 405B | Vlajkový model 405B s výkonem na úrovni GPT-4o. Kontextové okno až 128 tisíc tokenů. Přibyla možnost zpracování obrázků. |
| LLaMA 4 | (plán: duben 2025) | 109B (Scout), 400B (Maverick), 2T (Behemoth) | Architektura Mixture-of-Experts (MoE). Nativní multimodalita (text, obrázky, video). Kontextové okno až 10 milionů tokenů. |
Architektura
LLaMA používá architekturu autoregresivního transformer-dekodéru, ale zavádí řadu klíčových vylepšení zvyšujících výpočetní efektivitu a kvalitu generovaného textu:
- Pre-normalization (Předběžná normalizace). Normalizace je aplikována na vstupu každé podvrstvy transformeru, nikoli na výstupu. Tento přístup stabilizuje trénování velmi hlubokých sítí a předchází problémům s gradienty.
- RMSNorm (Root Mean Square Layer Normalization). Místo standardního LayerNorm se používá RMSNorm. Tato normalizační technika eliminuje operaci odečítání průměru, což urychluje výpočty o 10–50 % při zachování stability.
- SwiGLU (Swish-Gated Linear Unit). Jako aktivační funkce se místo ReLU nebo GELU používá SwiGLU. Tento gating mechanism vytváří plynulejší tok gradientů a zlepšuje kvalitu modelu.
- RoPE (Rotary Position Embeddings, Rotační poziční embedding). Pro kódování pozic tokenů se používají relativní poziční embeddingy RoPE, které umožňují modelu lépe extrapolovat na sekvence delší, než jaké byly použity při trénování.
- GQA (Grouped-Query Attention). Zavedené v LLaMA 2, tato technika je optimalizací multi-head attention, která výrazně snižuje nároky na paměť a urychluje generování textu.
- Mixture-of-Experts (MoE) (plánováno v LLaMA 4). Architektura, která rozděluje parametry modelu do „expertních" podsítí a aktivuje pouze jejich malou část pro každý dotaz. To výrazně snižuje výpočetní náklady na inferenci.
Konfigurace LLaMA 1
| Model | Parametry | Dimenze skrytého stavu | Počet vrstev | Počet attention hlav | Objem trénovacích dat |
|---|---|---|---|---|---|
| 7B | 6.7B | 4096 | 32 | 32 | 1.0T tokenů |
| 13B | 13.0B | 5120 | 40 | 40 | 1.0T tokenů |
| 33B | 32.5B | 6656 | 60 | 52 | 1.4T tokenů |
| 65B | 65.2B | 8192 | 80 | 64 | 1.4T tokenů |
Trénovací data
Objem trénovacích korpusů vzrostl z 1,4 bilionu tokenů pro LLaMA 1 na 15 bilionů pro LLaMA 3. Pro trénování jsou využívány veřejně dostupné zdroje, včetně Common Crawl (tvoří až 67 % dat), C4, GitHub, Wikipedia, Books, ArXiv a Stack Exchange. Pro LLaMA 3 byla použita také vysoce kvalitní soukromá data.
Výkon a srovnání
- Na benchmarcích: Model LLaMA 3.1 (405B) dosahuje výsledků blízkých GPT-4o: v testu MMLU dosahuje 88,6 %, čímž zaostává za GPT-4o pouze o 0,1 procentního bodu. V úloze generování kódu HumanEval dosahuje LLaMA 3.1 89 % (GPT-4o — 90,2 %).
- Parametrická efektivita: Modely LLaMA s menším počtem parametrů často překonávají větší modely konkurentů. Například LLaMA 1 (13B) překonala GPT-3 (175B) ve většině testů.
- Náklady: Při lokálním hostingu mohou být náklady na inferenci LLaMA až 50krát nižší ve srovnání s využíváním proprietárních API, což technologii zpřístupňuje malým a středním podnikům.
Licencování
- LLaMA 1 byla distribuována pod nekomerční výzkumnou licencí s přístupem na vyžádání.
- LLaMA 2 a novější verze jsou distribuovány pod licencí Llama Community License, která umožňuje komerční využití a úpravy. Licence však obsahuje omezení: společnosti s více než 700 miliony aktivních uživatelů měsíčně musí získat zvláštní povolení od Meta. To vyvolává diskuse o tom, zda je LLaMA skutečně plně otevřeným modelem.
Využití
Modely LLaMA jsou integrovány do produktů tisíců společností a používají se v různých oblastech:
- Korporátní sektor: Zoom využívá LLaMA v AI Companion pro shrnutí schůzek; Shopify — pro zpracování 40–60 milionů dotazů denně za účelem obohacení metadat produktů; Instacart — v interním asistentovi Ava.
- Věda a společnost: Meditron (adaptace LLaMA) je využíván pro lékařskou diagnostiku v regionech s omezenými zdroji.
- Veřejný sektor a průmysl: Meta uzavřela partnerství s Lockheed Martin a Palantir. NASA využívá LLaMA 3 na ISS jako offline asistenta pro provádění kritických operací bez spojení se Zemí.
Omezení a kritika
- Zaujatost a bezpečnost: Nezávislé audity ukazují, že modely LLaMA mohou navzdory bezpečnostním opatřením reprodukovat škodlivé stereotypy. Únik vah LLaMA 1 vyhrotil otázky ohledně potenciálního zneužití technologie.
- Mezery ve znalostech: V úzce specializovaných oblastech může LLaMA vykazovat mezery. Například přesnost na lékařském testu nephSAP činila 17–30 % oproti 73 % u GPT-4.
- Spotřeba energie: Trénování velkých modelů vyžaduje obrovské zdroje. Trénování LLaMA 1 vyžadovalo 2 638 MWh, což odpovídá emisím 1 015 tun CO₂.
Budoucnost
Meta plánuje investovat až 65 miliard dolarů do AI infrastruktury do roku 2025. Ve vývoji se nachází model LLaMA 4 Behemoth se 2 biliony parametrů, který bude podporovat více než 200 jazyků a získá hlubokou integraci s produkty metaverza.
Literatura
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
- Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
- Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
- Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
- Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.
Poznámky
- ↑ Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
- ↑ LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.
Viz také
- GPT
- Velké jazykové modely
- Transformer (architektura neuronové sítě)