LLaMA (Meta AI) (NL)
LLaMA (Large Language Model Meta AI) — een familie van grote taalmodellen (LLM) met overwegend open broncode, ontwikkeld door de onderzoeksafdeling Meta AI. De LLaMA-modellen zijn gebaseerd op een aangepaste transformer-architectuur en zijn gericht op hoge rekenefficiëntie, democratisering van toegang tot geavanceerde AI-technologieën en eenvoudige aanpassing voor gespecialiseerde taken. De familie heeft zich ontwikkeld van de oorspronkelijke onderzoeksrelease LLaMA 1 (februari 2023) tot de multimodale modellen LLaMA 4 (geplande release in 2026).
Naam
De afkorting LLaMA staat voor Large Language Model Meta AI (Groot Taalmodel Meta AI).
- Large Language Model — benadrukt de schaal van de modellen, waarvan de parameters variëren van miljarden tot biljoenen.
- Meta AI — verwijst naar de ontwikkelaar, de onderzoeksgroep van Meta.
Geschiedenis
De ontwikkeling van LLaMA begon eind 2022 als een strategisch antwoord van Meta op het succes van ChatGPT van OpenAI. Mark Zuckerberg stelde een interdisciplinair team samen, bestaande uit onderzoekers van het laboratorium FAIR (Facebook AI Research). Een sleutelrol in de filosofie van het project speelde Yann LeCun, hoofd van FAIR, die sinds 2013 het principe van volledige openheid van alle onderzoeken van het laboratorium aanhoudt.
De eerste versie, LLaMA 1, werd in februari 2023 uitgebracht met een onderzoekslicentie. Kort na de release, in maart 2023, lekten de gewichten van het model via BitTorrent op het internet. Dit evenement remde de ontwikkeling van het project, in tegenstelling tot de vrees, niet af, maar stimuleerde deze juist, omdat het onafhankelijke onderzoekers en enthousiastelingen over de hele wereld de mogelijkheid gaf om met het model te experimenteren. Als gevolg daarvan verschenen er tienduizenden afgeleide modellen op het platform Hugging Face. Latere versies, te beginnen met LLaMA 2, werden uitgebracht met een commerciële licentie[1], waarmee LLaMA's status als belangrijke speler op de markt van open AI-modellen werd bestendigd.
Evolutie van modellen en tijdlijn van releases
| Versie | Releasedatum | Parameterbereik | Belangrijkste innovaties en kenmerken |
|---|---|---|---|
| LLaMA 1 | Februari 2023 | 7B – 65B | Basisarchitectuur (RMSNorm, SwiGLU, RoPE). Training op 1,4 biljoen tokens. Contextvenster van 2048 tokens. Onderzoekslicentie. |
| LLaMA 2 | Juli 2023 | 7B – 70B | Fine-tuning voor dialogen (RLHF). Introductie van Grouped-Query Attention (GQA). Contextvenster van 4096 tokens. Eerste commerciële licentie. |
| Code Llama | Augustus 2023 | 7B – 70B | Gespecialiseerde versie voor code. Fine-tuning op 500 miljard tokens aan code. Varianten: basis, Python-gespecialiseerd, instruction-tuned. |
| LLaMA 3 | April 2024 | 8B, 70B | Training op 15 biljoen tokens. Verbeterde tokenizer met een woordenschat van 128.000 tokens. Hoge prestaties (82% op MMLU). |
| LLaMA 3.1 | Juli 2024[2] | 8B, 70B, 405B | Vlaggenschipmodel 405B met prestaties op het niveau van GPT-4o. Contextvenster tot 128.000 tokens. Mogelijkheid tot beeldverwerking toegevoegd. |
| LLaMA 4 | (gepland: april 2025) | 109B (Scout), 400B (Maverick), 2T (Behemoth) | Mixture-of-Experts (MoE)-architectuur. Native multimodaliteit (tekst, afbeeldingen, video). Contextvenster tot 10 miljoen tokens. |
Architectuur
LLaMA maakt gebruik van een autoregressieve decoder-only transformer-architectuur, maar introduceert een aantal belangrijke verbeteringen die de rekenefficiëntie en de kwaliteit van de gegenereerde tekst verhogen:
- Pre-normalisatie. Normalisatie wordt toegepast op de invoer van elke deellaag van de transformer, en niet op de uitvoer. Deze aanpak stabiliseert de training van zeer diepe netwerken en voorkomt problemen met gradiënten.
- RMSNorm (Root Mean Square Layer Normalization). In plaats van de standaard LayerNorm wordt RMSNorm gebruikt. Deze normaliseringstechniek elimineert de bewerking van het aftrekken van het gemiddelde, waardoor berekeningen 10–50% worden versneld met behoud van stabiliteit.
- SwiGLU (Swish-Gated Linear Unit). Als activatiefunctie wordt SwiGLU gebruikt in plaats van ReLU of GELU. Dit gating mechanism creëert een vloeiendere gradiëntstroom en verbetert de kwaliteit van het model.
- RoPE (Rotary Position Embeddings). Voor het coderen van tokenposities worden relatieve positionele embeddings RoPE gebruikt, waarmee het model beter kan extrapoleren naar reeksen die langer zijn dan die welke tijdens de training zijn gebruikt.
- GQA (Grouped-Query Attention). Geïntroduceerd in LLaMA 2, is deze techniek een optimalisatie van multi-head attention die de geheugenvereisten aanzienlijk vermindert en de tekstgeneratie versnelt.
- Mixture-of-Experts (MoE) (gepland voor LLaMA 4). Een architectuur die de parameters van het model verdeelt in "expert" deelnetwerken, waarbij slechts een klein deel daarvan voor elk verzoek wordt geactiveerd. Dit vermindert de rekenkosten voor inferentie drastisch.
Configuraties LLaMA 1
| Model | Parameters | Dimensie verborgen toestand | Aantal lagen | Aantal attention-heads | Omvang trainingsdata |
|---|---|---|---|---|---|
| 7B | 6.7B | 4096 | 32 | 32 | 1.0T tokens |
| 13B | 13.0B | 5120 | 40 | 40 | 1.0T tokens |
| 33B | 32.5B | 6656 | 60 | 52 | 1.4T tokens |
| 65B | 65.2B | 8192 | 80 | 64 | 1.4T tokens |
Trainingsdata
Het volume van de trainingscorpora is gegroeid van 1,4 biljoen tokens voor LLaMA 1 tot 15 biljoen voor LLaMA 3. Voor de training worden openbaar beschikbare bronnen gebruikt, waaronder Common Crawl (goed voor tot 67% van de data), C4, GitHub, Wikipedia, Books, ArXiv en Stack Exchange. Voor LLaMA 3 werden ook hoogwaardige private data gebruikt.
Prestaties en vergelijking
- Op benchmarks: Het model LLaMA 3.1 (405B) behaalt resultaten die dicht bij GPT-4o liggen: op de MMLU-test bereikt het 88,6%, slechts 0,1 procentpunt achter GPT-4o. Op de codegeneratietaak HumanEval behaalt LLaMA 3.1 89% (GPT-4o — 90,2%).
- Parameterefficiëntie: LLaMA-modellen met een kleiner aantal parameters overtreffen vaak grotere modellen van concurrenten. Zo overtrof LLaMA 1 (13B) GPT-3 (175B) op de meeste benchmarks.
- Kosten: Bij lokale hosting kunnen de inferentiekosten van LLaMA tot 50 keer lager zijn in vergelijking met het gebruik van propriëtaire API's, wat de technologie toegankelijk maakt voor het midden- en kleinbedrijf.
Licentieverlening
- LLaMA 1 werd verspreid onder een niet-commerciële onderzoekslicentie met toegang op aanvraag.
- LLaMA 2 en latere versies worden verspreid onder de Llama Community License, die commercieel gebruik en modificatie toestaat. De licentie bevat echter beperkingen: bedrijven met meer dan 700 miljoen actieve gebruikers per maand moeten speciale toestemming van Meta verkrijgen. Dit wakkert discussies aan over de vraag of LLaMA een volledig open model is.
Toepassingen
LLaMA-modellen zijn geïntegreerd in de producten van duizenden bedrijven en worden in verschillende sectoren gebruikt:
- Bedrijfsleven: Zoom gebruikt LLaMA in AI Companion voor samenvattingen van vergaderingen; Shopify — voor de verwerking van 40–60 miljoen verzoeken per dag voor het verrijken van productmetadata; Instacart — in de interne assistent Ava.
- Wetenschap en samenleving: Meditron (een aanpassing van LLaMA) wordt gebruikt voor medische diagnostiek in regio's met beperkte middelen.
- Overheid en industrie: Meta heeft partnerschappen gesloten met Lockheed Martin en Palantir. NASA gebruikt LLaMA 3 op het ISS als offline-assistent voor het uitvoeren van kritieke operaties zonder verbinding met de aarde.
Beperkingen en kritiek
- Vooringenomenheid en veiligheid: Onafhankelijke audits tonen aan dat LLaMA-modellen, ondanks veiligheidsmaatregelen, schadelijke stereotypen kunnen reproduceren. Het uitlekken van de gewichten van LLaMA 1 heeft de vragen over potentieel kwaadwillig gebruik van de technologie verscherpt.
- Kennishiaten: Op sterk gespecialiseerde gebieden kan LLaMA hiaten vertonen. Zo bedroeg de nauwkeurigheid op de medische test nephSAP 17–30% tegenover 73% voor GPT-4.
- Energieverbruik: De training van grote modellen vereist enorme middelen. De training van LLaMA 1 vergde 2.638 MWh, wat equivalent is aan de uitstoot van 1.015 ton CO₂.
Toekomst
Meta is van plan om tot 65 miljard dollar te investeren in AI-infrastructuur tegen 2025. In ontwikkeling is het model LLaMA 4 Behemoth met 2 biljoen parameters, dat meer dan 200 talen zal ondersteunen en diepgaande integratie met metaverse-producten zal krijgen.
Literatuur
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
- Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
- Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
- Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
- Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.
Noten
- ↑ Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
- ↑ LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.
Zie ook
- GPT
- Grote taalmodellen
- Transformer (neurale netwerkarchitectuur)