LLaMA (Meta AI) (RO)

From Systems analysis Wiki
Jump to navigation Jump to search

LLaMA (Large Language Model Meta AI) — familie de modele de limbaj de mari dimensiuni (LLM) cu sursă predominant deschisă, dezvoltată de divizia de cercetare Meta AI. Modelele LLaMA sunt construite pe o arhitectură transformer modificată și sunt orientate spre eficiență ridicată a calculului, democratizarea accesului la tehnologii AI de ultimă generație și adaptarea ușoară la sarcini specializate. Familia a evoluat de la lansarea inițială de cercetare LLaMA 1 (februarie 2023) până la modelele multimodale LLaMA 4 (lansare planificată în 2026).

Denumire

Abrevierea LLaMA provine de la Large Language Model Meta AI (Model de Limbaj de Mari Dimensiuni Meta AI).

  • Large Language Model — subliniază dimensiunea modelelor, ai căror parametri se măsoară de la miliarde la trilioane.
  • Meta AI — indică dezvoltatorul, grupul de cercetare Meta.

Istoricul creării

Dezvoltarea LLaMA a început la sfârșitul anului 2022 ca răspuns strategic al Meta la succesul ChatGPT de la OpenAI. Mark Zuckerberg a format o echipă interdisciplinară, incluzând cercetători din laboratorul FAIR (Facebook AI Research). Un rol cheie în filosofia proiectului l-a jucat Yann LeCun, directorul FAIR, care din 2013 a aderat la principiul transparenței totale a tuturor cercetărilor laboratorului.

Prima versiune, LLaMA 1, a fost lansată în februarie 2023 cu o licență de cercetare. La scurt timp după lansare, în martie 2023, ponderile modelului au fost scurse pe internet prin BitTorrent. Acest eveniment, contrar temerilor, nu a oprit, ci dimpotrivă, a stimulat dezvoltarea proiectului, deoarece le-a oferit cercetătorilor independenți și entuziaștilor din întreaga lume posibilitatea de a experimenta cu modelul. Ca urmare, pe platforma Hugging Face au apărut zeci de mii de modele derivate. Versiunile ulterioare, începând cu LLaMA 2, au fost lansate deja cu licență comercială[1], consolidând statutul LLaMA ca jucător cheie pe piața modelelor AI cu sursă deschisă.

Evoluția modelelor și cronologia lansărilor

Cronologia dezvoltării modelelor LLaMA
Versiune Data lansării Intervalul de parametri Inovații și caracteristici cheie
LLaMA 1 Februarie 2023 7B – 65B Arhitectură de bază (RMSNorm, SwiGLU, RoPE). Antrenare pe 1,4 trilioane de token-uri. Fereastră de context de 2048 token-uri. Licență de cercetare.
LLaMA 2 Iulie 2023 7B – 70B Fine-tuning pentru dialoguri (RLHF). Introducerea Grouped-Query Attention (GQA). Fereastră de context de 4096 token-uri. Prima licență comercială.
Code Llama August 2023 7B – 70B Versiune specializată pentru cod. Fine-tuning pe 500 de miliarde de token-uri de cod. Variante: de bază, specializat pentru Python, instruction-tuned.
LLaMA 3 Aprilie 2024 8B, 70B Antrenare pe 15 trilioane de token-uri. Tokenizator îmbunătățit cu un vocabular de 128 mii de token-uri. Performanță ridicată (82% pe MMLU).
LLaMA 3.1 Iulie 2024[2] 8B, 70B, 405B Modelul flagship 405B cu performanță la nivelul GPT-4o. Fereastră de context de până la 128 mii de token-uri. A apărut posibilitatea procesării imaginilor.
LLaMA 4 (plan: aprilie 2025) 109B (Scout), 400B (Maverick), 2T (Behemoth) Arhitectură Mixture-of-Experts (MoE). Multimodalitate nativă (text, imagini, video). Fereastră de context de până la 10 milioane de token-uri.

Arhitectură

LLaMA utilizează arhitectura transformer-decoder autoregresiv, dar introduce o serie de îmbunătățiri cheie care cresc eficiența calculului și calitatea textului generat:

  • Pre-normalization (Pre-normalizare). Normalizarea se aplică la intrarea fiecărui substrat al transformer-ului, nu la ieșire. Această abordare stabilizează antrenarea rețelelor foarte adânci și previne problemele cu gradienții.
  • RMSNorm (Root Mean Square Layer Normalization). În locul LayerNorm standard se utilizează RMSNorm. Această tehnică de normalizare elimină operația de scădere a mediei, accelerând calculele cu 10–50% menținând în același timp stabilitatea.
  • SwiGLU (Swish-Gated Linear Unit). Ca funcție de activare se folosește SwiGLU în locul ReLU sau GELU. Acest mecanism de gating (gating mechanism) creează un flux de gradient mai lin și îmbunătățește calitatea modelului.
  • RoPE (Rotary Position Embeddings, Embedding-uri poziționale rotaționale). Pentru codificarea pozițiilor token-urilor se aplică embedding-urile poziționale relative RoPE, care permit modelului să extrapoleze mai bine la secvențe mai lungi decât cele utilizate la antrenare.
  • GQA (Grouped-Query Attention). Introdus în LLaMA 2, această tehnică este o optimizare a atenției cu mai multe capete, care reduce semnificativ cerințele de memorie și accelerează generarea textului.
  • Mixture-of-Experts (MoE) (planificat în LLaMA 4). Arhitectură care împarte parametrii modelului în subrețele „de experți", activând doar o mică parte din acestea pentru fiecare cerere. Aceasta reduce drastic costurile computaționale ale inferenței.

Configurații LLaMA 1

Parametrii arhitecturali ai modelelor LLaMA 1
Model Parametri Dimensiunea stării ascunse Nr. de straturi Nr. de capete de atenție Volumul datelor de antrenare
7B 6.7B 4096 32 32 1.0T token-uri
13B 13.0B 5120 40 40 1.0T token-uri
33B 32.5B 6656 60 52 1.4T token-uri
65B 65.2B 8192 80 64 1.4T token-uri

Date de antrenare

Volumul corpusurilor de antrenare a crescut de la 1,4 trilioane de token-uri pentru LLaMA 1 la 15 trilioane pentru LLaMA 3. Pentru antrenare se utilizează surse publice, incluzând Common Crawl (care reprezintă până la 67% din date), C4, GitHub, Wikipedia, Books, ArXiv și Stack Exchange. Pentru LLaMA 3 au fost utilizate și date private de înaltă calitate.

Performanță și comparații

  • Pe benchmark-uri: Modelul LLaMA 3.1 (405B) obține rezultate apropiate de GPT-4o: pe testul MMLU atinge 88,6%, cedând GPT-4o doar 0,1 puncte procentuale. Pe sarcina de generare de cod HumanEval, LLaMA 3.1 obține 89% (GPT-4o — 90,2%).
  • Eficiență parametrică: Modelele LLaMA cu un număr mai mic de parametri depășesc adesea modele mai mari ale concurenților. De exemplu, LLaMA 1 (13B) a depășit GPT-3 (175B) pe majoritatea testelor.
  • Cost: La găzduire locală, costul inferenței LLaMA poate fi de până la 50 de ori mai mic față de utilizarea API-urilor proprietare, ceea ce face tehnologia accesibilă pentru întreprinderile mici și mijlocii.

Licențiere

  • LLaMA 1 a fost distribuită sub o licență de cercetare necomercială cu acces la cerere.
  • LLaMA 2 și versiunile ulterioare sunt distribuite sub licența Llama Community License, care permite utilizarea comercială și modificarea. Cu toate acestea, licența conține restricții: companiile cu mai mult de 700 de milioane de utilizatori activi lunari trebuie să obțină o aprobare specială din partea Meta. Aceasta generează dezbateri despre dacă LLaMA este un model complet deschis.

Aplicații

Modelele LLaMA sunt integrate în produsele a mii de companii și sunt utilizate în diverse domenii:

  • Sectorul corporativ: Zoom utilizează LLaMA în AI Companion pentru rezumarea întâlnirilor; Shopify — pentru procesarea a 40–60 de milioane de cereri pe zi în scopul îmbogățirii metadatelor produselor; Instacart — în asistentul intern Ava.
  • Știință și societate: Meditron (o adaptare a LLaMA) este utilizat pentru diagnosticul medical în regiunile cu resurse limitate.
  • Sectorul public și industria: Meta a încheiat parteneriate cu Lockheed Martin și Palantir. NASA utilizează LLaMA 3 pe Stația Spațială Internațională ca asistent offline pentru executarea operațiunilor critice fără legătură cu Pământul.

Limitări și critici

  • Bias și siguranță: Auditurile independente arată că modelele LLaMA, în ciuda măsurilor de siguranță, pot reproduce stereotipuri dăunătoare. Scurgerea ponderilor LLaMA 1 a acutizat întrebările privind potențiala utilizare malițioasă a tehnologiei.
  • Lacune de cunoștințe: În domenii foarte specializate, LLaMA poate prezenta lacune. De exemplu, acuratețea pe testul medical nephSAP a fost de 17–30% față de 73% la GPT-4.
  • Consum energetic: Antrenarea modelelor mari necesită resurse uriașe. Antrenarea LLaMA 1 a necesitat 2 638 MWh, echivalent cu emisii de 1 015 tone de CO₂.

Viitor

Meta plănuiește să investească până la 65 de miliarde de dolari în infrastructura AI până în 2025. În curs de dezvoltare se află modelul LLaMA 4 Behemoth cu 2 trilioane de parametri, care va suporta mai mult de 200 de limbi și va fi profund integrat cu produsele metaversului.

Bibliografie

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
  • Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
  • Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
  • Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
  • Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
  • Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.

Note

  1. Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
  2. LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.

Vezi și

  • GPT
  • Modele de limbaj de mari dimensiuni
  • Transformer (arhitectura rețelei neuronale)