LLaMA (Meta AI) (HU)
LLaMA (Large Language Model Meta AI) — nagy nyelvi modellek (LLM) döntően nyílt forráskódú családja, amelyet a Meta AI kutatási részlege fejleszt. A LLaMA modellek módosított transformer architektúrára épülnek, és a számítási hatékonyság növelésére, a csúcstechnológiájú MI-technológiákhoz való hozzáférés demokratizálására, valamint a specializált feladatokhoz való könnyű adaptációra összpontosítanak. A modellcsalád az eredeti kutatási kiadású LLaMA 1-től (2023. február) a multimodális LLaMA 4-ig fejlődött (tervezett kiadás: 2026).
Elnevezés
A LLaMA betűszó a Large Language Model Meta AI (Meta AI Nagy Nyelvi Modell) kifejezés rövidítése.
- Large Language Model — a modellek méretét hangsúlyozza, amelyek paraméterszáma milliárdoktól billióig terjed.
- Meta AI — a fejlesztőre, a Meta kutatócsoportjára utal.
Fejlesztéstörténet
A LLaMA fejlesztése 2022 végén kezdődött, mint a Meta stratégiai válasza az OpenAI ChatGPT sikerére. Mark Zuckerberg egy interdiszciplináris csapatot hozott létre, amelybe a FAIR (Facebook AI Research) laboratórium kutatói is tartoztak. A projekt filozófiájában kulcsszerepet játszott Yann LeCun, a FAIR vezetője, aki 2013 óta a laboratórium összes kutatásának teljes nyilvánosságra hozatala mellett állt ki.
Az első verzió, a LLaMA 1, 2023 februárjában jelent meg kutatási licenccel. Nem sokkal a megjelenés után, 2023 márciusában a modell súlyai BitTorrenten keresztül kiszivárogtak az internetre. Ez az esemény – az aggodalmakkal ellentétben – nem akasztotta meg, hanem ellenkezőleg, felgyorsította a projekt fejlődését, mivel lehetővé tette független kutatók és lelkes fejlesztők számára szerte a világon, hogy kísérletezzenek a modellel. Ennek eredményeként a Hugging Face platformon több tízezer származtatott modell jelent meg. A következő verziók, a LLaMA 2-től kezdve, már kereskedelmi licenccel kerültek kiadásra[1], megszilárdítva a LLaMA pozícióját a nyílt MI-modellek piacán.
A modellek fejlődése és a kiadások kronológiája
| Verzió | Kiadás dátuma | Paramétertartomány | Főbb újítások és jellemzők |
|---|---|---|---|
| LLaMA 1 | 2023. február | 7B – 65B | Alaparchitektúra (RMSNorm, SwiGLU, RoPE). 1,4 billió tokennel tanítva. Kontextusablak: 2048 token. Kutatási licenc. |
| LLaMA 2 | 2023. július | 7B – 70B | Párbeszédre hangolt fine-tuning (RLHF). Grouped-Query Attention (GQA) bevezetése. Kontextusablak: 4096 token. Első kereskedelmi licenc. |
| Code Llama | 2023. augusztus | 7B – 70B | Kódolásra specializált verzió. 500 milliárd kód-tokennel fine-tuningolva. Változatok: alapmodell, Python-specializált, instruction-tuned. |
| LLaMA 3 | 2024. április | 8B, 70B | 15 billió tokennel tanítva. Fejlesztett tokenizáló 128 ezer tokenes szótárral. Magas teljesítmény (82% MMLU-n). |
| LLaMA 3.1 | 2024. július[2] | 8B, 70B, 405B | A 405B-s zászlóshajó modell GPT-4o szintű teljesítménnyel. Kontextusablak: akár 128 ezer token. Képfeldolgozási képesség megjelent. |
| LLaMA 4 | (terv: 2025. április) | 109B (Scout), 400B (Maverick), 2T (Behemoth) | Mixture-of-Experts (MoE) architektúra. Natív multimodalitás (szöveg, kép, videó). Kontextusablak: akár 10 millió token. |
Architektúra
A LLaMA autoregresszív decoder-only transformer architektúrát alkalmaz, ugyanakkor számos kulcsfontosságú fejlesztést vezet be, amelyek növelik a számítási hatékonyságot és a generált szöveg minőségét:
- Pre-normalization (Előzetes normalizálás). A normalizálás a transformer minden alrétegének bemenetén kerül alkalmazásra, nem a kimenetén. Ez a megközelítés stabilizálja a nagyon mély hálózatok tanítását, és megelőzi a gradiensekkel kapcsolatos problémákat.
- RMSNorm (Root Mean Square Layer Normalization). A standard LayerNorm helyett RMSNorm-ot alkalmaz. Ez a normalizálási technika elhagyja az átlagkivonási műveletet, ami 10–50%-os gyorsulást eredményez a stabilitás megőrzése mellett.
- SwiGLU (Swish-Gated Linear Unit). Aktivációs függvényként a ReLU vagy GELU helyett SwiGLU-t használ. Ez a kapuzási mechanizmus (gating mechanism) simább gradiensvezérlést biztosít és javítja a modell minőségét.
- RoPE (Rotary Position Embeddings, Forgásos pozicionális embedding-ek). A token-pozíciók kódolásához relatív pozicionális embedding-eket (RoPE) alkalmaz, amelyek lehetővé teszik a modell számára, hogy jobban extrapoláljon a tanítás során használtnál hosszabb sorozatokra.
- GQA (Grouped-Query Attention). A LLaMA 2-ben bevezetett technika a többfejű figyelem optimalizálása, amely jelentősen csökkenti a memóriaigényt és felgyorsítja a szöveggenerálást.
- Mixture-of-Experts (MoE) (a LLaMA 4-ben tervezett). Olyan architektúra, amely a modell paramétereit „szakértői" részháózatokra osztja, és minden egyes kéréshez csak egy kis részüket aktiválja. Ez drasztikusan csökkenti az inferencia számítási költségeit.
LLaMA 1 konfigurációk
| Modell | Paraméterek | Rejtett állapot dimenziója | Rétegek száma | Figyelemfejek száma | Tanítóadatok mennyisége |
|---|---|---|---|---|---|
| 7B | 6.7B | 4096 | 32 | 32 | 1.0T token |
| 13B | 13.0B | 5120 | 40 | 40 | 1.0T token |
| 33B | 32.5B | 6656 | 60 | 52 | 1.4T token |
| 65B | 65.2B | 8192 | 80 | 64 | 1.4T token |
Tanítóadatok
A tanítókorpuszok mérete a LLaMA 1 esetén 1,4 billió tokenről a LLaMA 3 esetén 15 billióra nőtt. A tanításhoz nyilvánosan elérhető forrásokat használnak, köztük a Common Crawl-t (az adatok akár 67%-a), a C4-et, a GitHubot, a Wikipédiát, könyveket, az ArXiv-ot és a Stack Exchange-t. A LLaMA 3 tanításához kiváló minőségű privát adatokat is felhasználtak.
Teljesítmény és összehasonlítás
- Benchmark-eredmények: A LLaMA 3.1 (405B) modell a GPT-4o-hoz közelítő eredményeket mutat: az MMLU teszten 88,6%-ot ér el, mindössze 0,1 százalékponttal maradva el a GPT-4o mögött. A HumanEval kódgenerálási feladaton a LLaMA 3.1 89%-ot teljesít (GPT-4o: 90,2%).
- Paraméteres hatékonyság: A kevesebb paraméterrel rendelkező LLaMA modellek gyakran felülmúlják a versenytársak nagyobb modelljeit. Például a LLaMA 1 (13B) a legtöbb teszten megelőzte a GPT-3-at (175B).
- Költség: Helyi hosztolás esetén a LLaMA inferencia költsége akár 50-szer alacsonyabb lehet a tulajdonosi API-k használatához képest, ami a technológiát elérhetővé teszi kis- és középvállalkozások számára is.
Licencelés
- A LLaMA 1 nem kereskedelmi kutatási licenc alatt volt elérhető, kérésre.
- A LLaMA 2 és újabb verziók a Llama Community License keretében kerülnek terjesztésre, amely engedélyezi a kereskedelmi felhasználást és a módosítást. A licenc azonban korlátozásokat is tartalmaz: a havonta több mint 700 millió aktív felhasználóval rendelkező vállalatok kötelesek különleges engedélyt kérni a Metától. Ez vitákat vált ki azzal kapcsolatban, hogy a LLaMA valóban teljesen nyílt modellnek tekinthető-e.
Alkalmazás
A LLaMA modelleket több ezer vállalat termékébe integrálták, és különböző területeken alkalmazzák:
- Vállalati szektor: A Zoom a LLaMA-t az AI Companion megbeszélés-összefoglaló funkciójában használja; a Shopify napi 40–60 millió kérés feldolgozására alkalmazza termékmeta-adatok gazdagítása céljából; az Instacart a belső Ava asszisztensbe integrálta.
- Tudomány és társadalom: A Meditron (a LLaMA adaptációja) korlátozott erőforrásokkal rendelkező régiókban orvosi diagnózis céljára szolgál.
- Állami szektor és ipar: A Meta partnerséget kötött a Lockheed Martinnal és a Palantirral. A NASA a LLaMA 3-at a Nemzetközi Űrállomáson offline asszisztensként használja kritikus műveletek végrehajtásához, Földdel való kapcsolat nélkül.
Korlátok és kritikák
- Elfogultság és biztonság: Független auditok azt mutatják, hogy a LLaMA modellek a biztonsági intézkedések ellenére képesek káros sztereotípiákat reprodukálni. A LLaMA 1 súlyainak kiszivárgása kiélezte a technológia esetleges rosszindulatú felhasználásával kapcsolatos kérdéseket.
- Tudásbeli hiányosságok: Szűk szakterületeken a LLaMA hiányosságokat mutathat. Például a nephSAP orvosi teszten 17–30%-os pontosságot ért el a GPT-4 73%-ával szemben.
- Energiafelhasználás: A nagy modellek tanítása óriási erőforrásokat igényel. A LLaMA 1 tanítása 2 638 MWh-t igényelt, ami 1 015 tonna CO₂-kibocsátással egyenértékű.
Jövő
A Meta 2025-ig akár 65 milliárd dollárt tervez MI-infrastruktúrába fektetni. Fejlesztés alatt áll a LLaMA 4 Behemoth modell 2 billió paraméterrel, amely több mint 200 nyelvet fog támogatni, és mélyen integrálódik a metaverzum termékeibe.
Irodalom
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
- Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
- Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
- Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
- Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.
Jegyzetek
- ↑ Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
- ↑ LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.
Lásd még
- GPT
- Nagy nyelvi modellek
- Transformer (neurális hálózat architektúra)