LLaMA (Meta AI) (SV)
LLaMA (Large Language Model Meta AI) — en familj av i huvudsak öppna stora språkmodeller (LLM) som utvecklas av Meta AI:s forskningsavdelning. LLaMA-modellerna bygger på en modifierad transformer-arkitektur och är inriktade på hög beräkningseffektivitet, demokratisering av tillgången till avancerad AI-teknik samt enkel anpassning till specialiserade uppgifter. Familjen har utvecklats från den ursprungliga forskningsversionen LLaMA 1 (februari 2023) till de multimodala modellerna LLaMA 4 (planerad lansering 2026).
Namn
Akronymen LLaMA står för Large Language Model Meta AI.
- Large Language Model — betonar modellernas skala, vars parametrar mäts från miljarder till biljoner.
- Meta AI — anger utvecklaren, Meta:s forskningsgrupp.
Skapandehistoria
Utvecklingen av LLaMA inleddes i slutet av 2022 som Meta:s strategiska svar på framgången med OpenAI:s ChatGPT. Mark Zuckerberg satte samman ett tvärvetenskapligt team som inkluderade forskare från laboratoriet FAIR (Facebook AI Research). Yann LeCun, chef för FAIR, spelade en nyckelroll i projektets filosofi och har sedan 2013 hållit fast vid principen om full öppenhet för alla laboratoriets forskning.
Den första versionen, LLaMA 1, lanserades i februari 2023 med en forskningslicens. Strax efter lanseringen, i mars 2023, läckte modellens vikter ut på nätet via BitTorrent. Detta händelse bromsade inte, utan tvärtom stimulerade projektets utveckling, eftersom det gav oberoende forskare och entusiaster runt om i världen möjlighet att experimentera med modellen. Som ett resultat dök tiotusentals deriverade modeller upp på plattformen Hugging Face. Efterföljande versioner, med start från LLaMA 2, lanserades med kommersiell licens[1], vilket cementerade LLaMA:s ställning som en nyckelaktör på marknaden för öppna AI-modeller.
Modellernas evolution och lanseringstidslinje
| Version | Lanseringsdatum | Parameterområde | Viktigaste innovationer och egenskaper |
|---|---|---|---|
| LLaMA 1 | Februari 2023 | 7B – 65B | Grundläggande arkitektur (RMSNorm, SwiGLU, RoPE). Träning på 1,4 biljoner token. Kontextfönster på 2 048 token. Forskningslicens. |
| LLaMA 2 | Juli 2023 | 7B – 70B | Fine-tuning för dialoger (RLHF). Införande av Grouped-Query Attention (GQA). Kontextfönster på 4 096 token. Första kommersiella licensen. |
| Code Llama | Augusti 2023 | 7B – 70B | Specialiserad version för kod. Fine-tuning på 500 miljarder kod-token. Varianter: grundläggande, Python-specialiserad, instruction-tuned. |
| LLaMA 3 | April 2024 | 8B, 70B | Träning på 15 biljoner token. Förbättrad tokenizer med ett ordförråd på 128 000 token. Hög prestanda (82 % på MMLU). |
| LLaMA 3.1 | Juli 2024[2] | 8B, 70B, 405B | Flaggskeppsmodellen 405B med prestanda i nivå med GPT-4o. Kontextfönster upp till 128 000 token. Möjlighet att bearbeta bilder tillkom. |
| LLaMA 4 | (plan: april 2025) | 109B (Scout), 400B (Maverick), 2T (Behemoth) | Mixture-of-Experts (MoE)-arkitektur. Inbyggd multimodalitet (text, bilder, video). Kontextfönster upp till 10 miljoner token. |
Arkitektur
LLaMA använder en autoregressiv transformer-decoder-arkitektur, men introducerar ett antal viktiga förbättringar som höjer beräkningseffektiviteten och kvaliteten på den genererade texten:
- Pre-normalization (Förhandsnormalisering). Normalisering tillämpas på ingången av varje transformer-delskikt, snarare än på utgången. Detta tillvägagångssätt stabiliserar träningen av mycket djupa nätverk och förhindrar gradientproblem.
- RMSNorm (Root Mean Square Layer Normalization). Istället för den vanliga LayerNorm används RMSNorm. Denna normaliseringsteknik eliminerar operationen att subtrahera medelvärdet, vilket påskyndar beräkningarna med 10–50 % med bibehållen stabilitet.
- SwiGLU (Swish-Gated Linear Unit). Som aktiveringsfunktion används SwiGLU istället för ReLU eller GELU. Denna gating mechanism skapar ett jämnare gradientflöde och förbättrar modellens kvalitet.
- RoPE (Rotary Position Embeddings). Relativa positionella embeddings av typen RoPE används för att koda token-positioner, vilket gör det möjligt för modellen att bättre extrapolera till sekvenser som är längre än de som användes under träningen.
- GQA (Grouped-Query Attention). Introducerad i LLaMA 2, denna teknik är en optimering av multi-head attention som avsevärt minskar minneskraven och påskyndar textgenerering.
- Mixture-of-Experts (MoE) (planeras i LLaMA 4). En arkitektur som delar upp modellens parametrar i "expert"-undernätverk och aktiverar endast en liten del av dem för varje förfrågan. Detta minskar drastiskt beräkningskostnaderna vid inferens.
Konfigurationer för LLaMA 1
| Modell | Parametrar | Dolt tillståndsdimension | Antal lager | Antal attention-huvuden | Träningsdatavolym |
|---|---|---|---|---|---|
| 7B | 6.7B | 4096 | 32 | 32 | 1.0T token |
| 13B | 13.0B | 5120 | 40 | 40 | 1.0T token |
| 33B | 32.5B | 6656 | 60 | 52 | 1.4T token |
| 65B | 65.2B | 8192 | 80 | 64 | 1.4T token |
Träningsdata
Volymen av träningskorpusar har vuxit från 1,4 biljoner token för LLaMA 1 till 15 biljoner för LLaMA 3. För träning används offentligt tillgängliga källor, inklusive Common Crawl (utgör upp till 67 % av datan), C4, GitHub, Wikipedia, Books, ArXiv och Stack Exchange. För LLaMA 3 användes även högkvalitativa privata data.
Prestanda och jämförelse
- På benchmark: Modellen LLaMA 3.1 (405B) visar resultat nära GPT-4o: på MMLU-testet uppnår den 88,6 %, vilket är bara 0,1 procentenheter sämre än GPT-4o. På kodgenereringsuppgiften HumanEval visar LLaMA 3.1 89 % (GPT-4o — 90,2 %).
- Parametereffektivitet: LLaMA-modeller med färre parametrar överträffar ofta konkurrenternas större modeller. Till exempel överträffade LLaMA 1 (13B) GPT-3 (175B) på de flesta tester.
- Kostnad: Vid lokal hosting kan inferenskostnaden för LLaMA vara upp till 50 gånger lägre jämfört med användning av proprietära API:er, vilket gör tekniken tillgänglig för små och medelstora företag.
Licensiering
- LLaMA 1 distribuerades under en icke-kommersiell forskningslicens med tillgång efter ansökan.
- LLaMA 2 och senare versioner distribueras under Llama Community License, som tillåter kommersiell användning och modifiering. Licensen innehåller dock begränsningar: företag med mer än 700 miljoner aktiva användare per månad måste inhämta särskilt tillstånd från Meta. Detta väcker diskussioner om huruvida LLaMA är en helt öppen modell.
Tillämpningar
LLaMA-modeller är integrerade i produkter från tusentals företag och används inom olika områden:
- Företagssektorn: Zoom använder LLaMA i AI Companion för mötessammanfattningar; Shopify — för behandling av 40–60 miljoner förfrågningar per dag för berikning av produktmetadata; Instacart — i den interna assistenten Ava.
- Vetenskap och samhälle: Meditron (en anpassning av LLaMA) används för medicinsk diagnostik i resursfattiga regioner.
- Offentlig sektor och industri: Meta har ingått partnerskap med Lockheed Martin och Palantir. NASA använder LLaMA 3 på ISS som en offline-assistent för att utföra kritiska operationer utan kontakt med jorden.
Begränsningar och kritik
- Bias och säkerhet: Oberoende revisioner visar att LLaMA-modeller, trots säkerhetsåtgärder, kan reproducera skadliga stereotyper. Läckan av LLaMA 1:s vikter skärpte frågorna om potentiellt skadlig användning av tekniken.
- Kunskapsluckor: Inom mycket specialiserade områden kan LLaMA uppvisa brister. Till exempel var precisionen på det medicinska testet nephSAP 17–30 % jämfört med 73 % för GPT-4.
- Energiförbrukning: Träning av stora modeller kräver enorma resurser. Träningen av LLaMA 1 krävde 2 638 MWh, vilket motsvarar utsläpp på 1 015 ton CO₂.
Framtid
Meta planerar att investera upp till 65 miljarder dollar i AI-infrastruktur till 2025. Under utveckling finns modellen LLaMA 4 Behemoth med 2 biljoner parametrar, som kommer att stödja mer än 200 språk och få djup integration med metaverse-produkter.
Litteratur
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
- Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
- Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
- Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
- Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.
Noter
- ↑ Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
- ↑ LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.
Se även
- GPT
- Stora språkmodeller
- Transformer (neural nätverksarkitektur)