LLaMA (Meta AI) (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

LLaMA (Large Language Model Meta AI) — nagy nyelvi modellek (LLM) döntően nyílt forráskódú családja, amelyet a Meta AI kutatási részlege fejleszt. A LLaMA modellek módosított transformer architektúrára épülnek, és a számítási hatékonyság növelésére, a csúcstechnológiájú MI-technológiákhoz való hozzáférés demokratizálására, valamint a specializált feladatokhoz való könnyű adaptációra összpontosítanak. A modellcsalád az eredeti kutatási kiadású LLaMA 1-től (2023. február) a multimodális LLaMA 4-ig fejlődött (tervezett kiadás: 2026).

Elnevezés

A LLaMA betűszó a Large Language Model Meta AI (Meta AI Nagy Nyelvi Modell) kifejezés rövidítése.

  • Large Language Model — a modellek méretét hangsúlyozza, amelyek paraméterszáma milliárdoktól billióig terjed.
  • Meta AI — a fejlesztőre, a Meta kutatócsoportjára utal.

Fejlesztéstörténet

A LLaMA fejlesztése 2022 végén kezdődött, mint a Meta stratégiai válasza az OpenAI ChatGPT sikerére. Mark Zuckerberg egy interdiszciplináris csapatot hozott létre, amelybe a FAIR (Facebook AI Research) laboratórium kutatói is tartoztak. A projekt filozófiájában kulcsszerepet játszott Yann LeCun, a FAIR vezetője, aki 2013 óta a laboratórium összes kutatásának teljes nyilvánosságra hozatala mellett állt ki.

Az első verzió, a LLaMA 1, 2023 februárjában jelent meg kutatási licenccel. Nem sokkal a megjelenés után, 2023 márciusában a modell súlyai BitTorrenten keresztül kiszivárogtak az internetre. Ez az esemény – az aggodalmakkal ellentétben – nem akasztotta meg, hanem ellenkezőleg, felgyorsította a projekt fejlődését, mivel lehetővé tette független kutatók és lelkes fejlesztők számára szerte a világon, hogy kísérletezzenek a modellel. Ennek eredményeként a Hugging Face platformon több tízezer származtatott modell jelent meg. A következő verziók, a LLaMA 2-től kezdve, már kereskedelmi licenccel kerültek kiadásra[1], megszilárdítva a LLaMA pozícióját a nyílt MI-modellek piacán.

A modellek fejlődése és a kiadások kronológiája

A LLaMA modellek fejlődésének kronológiája
Verzió Kiadás dátuma Paramétertartomány Főbb újítások és jellemzők
LLaMA 1 2023. február 7B – 65B Alaparchitektúra (RMSNorm, SwiGLU, RoPE). 1,4 billió tokennel tanítva. Kontextusablak: 2048 token. Kutatási licenc.
LLaMA 2 2023. július 7B – 70B Párbeszédre hangolt fine-tuning (RLHF). Grouped-Query Attention (GQA) bevezetése. Kontextusablak: 4096 token. Első kereskedelmi licenc.
Code Llama 2023. augusztus 7B – 70B Kódolásra specializált verzió. 500 milliárd kód-tokennel fine-tuningolva. Változatok: alapmodell, Python-specializált, instruction-tuned.
LLaMA 3 2024. április 8B, 70B 15 billió tokennel tanítva. Fejlesztett tokenizáló 128 ezer tokenes szótárral. Magas teljesítmény (82% MMLU-n).
LLaMA 3.1 2024. július[2] 8B, 70B, 405B A 405B-s zászlóshajó modell GPT-4o szintű teljesítménnyel. Kontextusablak: akár 128 ezer token. Képfeldolgozási képesség megjelent.
LLaMA 4 (terv: 2025. április) 109B (Scout), 400B (Maverick), 2T (Behemoth) Mixture-of-Experts (MoE) architektúra. Natív multimodalitás (szöveg, kép, videó). Kontextusablak: akár 10 millió token.

Architektúra

A LLaMA autoregresszív decoder-only transformer architektúrát alkalmaz, ugyanakkor számos kulcsfontosságú fejlesztést vezet be, amelyek növelik a számítási hatékonyságot és a generált szöveg minőségét:

  • Pre-normalization (Előzetes normalizálás). A normalizálás a transformer minden alrétegének bemenetén kerül alkalmazásra, nem a kimenetén. Ez a megközelítés stabilizálja a nagyon mély hálózatok tanítását, és megelőzi a gradiensekkel kapcsolatos problémákat.
  • RMSNorm (Root Mean Square Layer Normalization). A standard LayerNorm helyett RMSNorm-ot alkalmaz. Ez a normalizálási technika elhagyja az átlagkivonási műveletet, ami 10–50%-os gyorsulást eredményez a stabilitás megőrzése mellett.
  • SwiGLU (Swish-Gated Linear Unit). Aktivációs függvényként a ReLU vagy GELU helyett SwiGLU-t használ. Ez a kapuzási mechanizmus (gating mechanism) simább gradiensvezérlést biztosít és javítja a modell minőségét.
  • RoPE (Rotary Position Embeddings, Forgásos pozicionális embedding-ek). A token-pozíciók kódolásához relatív pozicionális embedding-eket (RoPE) alkalmaz, amelyek lehetővé teszik a modell számára, hogy jobban extrapoláljon a tanítás során használtnál hosszabb sorozatokra.
  • GQA (Grouped-Query Attention). A LLaMA 2-ben bevezetett technika a többfejű figyelem optimalizálása, amely jelentősen csökkenti a memóriaigényt és felgyorsítja a szöveggenerálást.
  • Mixture-of-Experts (MoE) (a LLaMA 4-ben tervezett). Olyan architektúra, amely a modell paramétereit „szakértői" részháózatokra osztja, és minden egyes kéréshez csak egy kis részüket aktiválja. Ez drasztikusan csökkenti az inferencia számítási költségeit.

LLaMA 1 konfigurációk

A LLaMA 1 modellek architektúrális paraméterei
Modell Paraméterek Rejtett állapot dimenziója Rétegek száma Figyelemfejek száma Tanítóadatok mennyisége
7B 6.7B 4096 32 32 1.0T token
13B 13.0B 5120 40 40 1.0T token
33B 32.5B 6656 60 52 1.4T token
65B 65.2B 8192 80 64 1.4T token

Tanítóadatok

A tanítókorpuszok mérete a LLaMA 1 esetén 1,4 billió tokenről a LLaMA 3 esetén 15 billióra nőtt. A tanításhoz nyilvánosan elérhető forrásokat használnak, köztük a Common Crawl-t (az adatok akár 67%-a), a C4-et, a GitHubot, a Wikipédiát, könyveket, az ArXiv-ot és a Stack Exchange-t. A LLaMA 3 tanításához kiváló minőségű privát adatokat is felhasználtak.

Teljesítmény és összehasonlítás

  • Benchmark-eredmények: A LLaMA 3.1 (405B) modell a GPT-4o-hoz közelítő eredményeket mutat: az MMLU teszten 88,6%-ot ér el, mindössze 0,1 százalékponttal maradva el a GPT-4o mögött. A HumanEval kódgenerálási feladaton a LLaMA 3.1 89%-ot teljesít (GPT-4o: 90,2%).
  • Paraméteres hatékonyság: A kevesebb paraméterrel rendelkező LLaMA modellek gyakran felülmúlják a versenytársak nagyobb modelljeit. Például a LLaMA 1 (13B) a legtöbb teszten megelőzte a GPT-3-at (175B).
  • Költség: Helyi hosztolás esetén a LLaMA inferencia költsége akár 50-szer alacsonyabb lehet a tulajdonosi API-k használatához képest, ami a technológiát elérhetővé teszi kis- és középvállalkozások számára is.

Licencelés

  • A LLaMA 1 nem kereskedelmi kutatási licenc alatt volt elérhető, kérésre.
  • A LLaMA 2 és újabb verziók a Llama Community License keretében kerülnek terjesztésre, amely engedélyezi a kereskedelmi felhasználást és a módosítást. A licenc azonban korlátozásokat is tartalmaz: a havonta több mint 700 millió aktív felhasználóval rendelkező vállalatok kötelesek különleges engedélyt kérni a Metától. Ez vitákat vált ki azzal kapcsolatban, hogy a LLaMA valóban teljesen nyílt modellnek tekinthető-e.

Alkalmazás

A LLaMA modelleket több ezer vállalat termékébe integrálták, és különböző területeken alkalmazzák:

  • Vállalati szektor: A Zoom a LLaMA-t az AI Companion megbeszélés-összefoglaló funkciójában használja; a Shopify napi 40–60 millió kérés feldolgozására alkalmazza termékmeta-adatok gazdagítása céljából; az Instacart a belső Ava asszisztensbe integrálta.
  • Tudomány és társadalom: A Meditron (a LLaMA adaptációja) korlátozott erőforrásokkal rendelkező régiókban orvosi diagnózis céljára szolgál.
  • Állami szektor és ipar: A Meta partnerséget kötött a Lockheed Martinnal és a Palantirral. A NASA a LLaMA 3-at a Nemzetközi Űrállomáson offline asszisztensként használja kritikus műveletek végrehajtásához, Földdel való kapcsolat nélkül.

Korlátok és kritikák

  • Elfogultság és biztonság: Független auditok azt mutatják, hogy a LLaMA modellek a biztonsági intézkedések ellenére képesek káros sztereotípiákat reprodukálni. A LLaMA 1 súlyainak kiszivárgása kiélezte a technológia esetleges rosszindulatú felhasználásával kapcsolatos kérdéseket.
  • Tudásbeli hiányosságok: Szűk szakterületeken a LLaMA hiányosságokat mutathat. Például a nephSAP orvosi teszten 17–30%-os pontosságot ért el a GPT-4 73%-ával szemben.
  • Energiafelhasználás: A nagy modellek tanítása óriási erőforrásokat igényel. A LLaMA 1 tanítása 2 638 MWh-t igényelt, ami 1 015 tonna CO₂-kibocsátással egyenértékű.

Jövő

A Meta 2025-ig akár 65 milliárd dollárt tervez MI-infrastruktúrába fektetni. Fejlesztés alatt áll a LLaMA 4 Behemoth modell 2 billió paraméterrel, amely több mint 200 nyelvet fog támogatni, és mélyen integrálódik a metaverzum termékeibe.

Irodalom

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
  • Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
  • Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
  • Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
  • Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
  • Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.

Jegyzetek

  1. Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
  2. LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.

Lásd még

  • GPT
  • Nagy nyelvi modellek
  • Transformer (neurális hálózat architektúra)