LLaMA (Meta AI) (SV)

From Systems analysis Wiki
Jump to navigation Jump to search

LLaMA (Large Language Model Meta AI) — en familj av i huvudsak öppna stora språkmodeller (LLM) som utvecklas av Meta AI:s forskningsavdelning. LLaMA-modellerna bygger på en modifierad transformer-arkitektur och är inriktade på hög beräkningseffektivitet, demokratisering av tillgången till avancerad AI-teknik samt enkel anpassning till specialiserade uppgifter. Familjen har utvecklats från den ursprungliga forskningsversionen LLaMA 1 (februari 2023) till de multimodala modellerna LLaMA 4 (planerad lansering 2026).

Namn

Akronymen LLaMA står för Large Language Model Meta AI.

  • Large Language Model — betonar modellernas skala, vars parametrar mäts från miljarder till biljoner.
  • Meta AI — anger utvecklaren, Meta:s forskningsgrupp.

Skapandehistoria

Utvecklingen av LLaMA inleddes i slutet av 2022 som Meta:s strategiska svar på framgången med OpenAI:s ChatGPT. Mark Zuckerberg satte samman ett tvärvetenskapligt team som inkluderade forskare från laboratoriet FAIR (Facebook AI Research). Yann LeCun, chef för FAIR, spelade en nyckelroll i projektets filosofi och har sedan 2013 hållit fast vid principen om full öppenhet för alla laboratoriets forskning.

Den första versionen, LLaMA 1, lanserades i februari 2023 med en forskningslicens. Strax efter lanseringen, i mars 2023, läckte modellens vikter ut på nätet via BitTorrent. Detta händelse bromsade inte, utan tvärtom stimulerade projektets utveckling, eftersom det gav oberoende forskare och entusiaster runt om i världen möjlighet att experimentera med modellen. Som ett resultat dök tiotusentals deriverade modeller upp på plattformen Hugging Face. Efterföljande versioner, med start från LLaMA 2, lanserades med kommersiell licens[1], vilket cementerade LLaMA:s ställning som en nyckelaktör på marknaden för öppna AI-modeller.

Modellernas evolution och lanseringstidslinje

Tidslinje för LLaMA-modellernas utveckling
Version Lanseringsdatum Parameterområde Viktigaste innovationer och egenskaper
LLaMA 1 Februari 2023 7B – 65B Grundläggande arkitektur (RMSNorm, SwiGLU, RoPE). Träning på 1,4 biljoner token. Kontextfönster på 2 048 token. Forskningslicens.
LLaMA 2 Juli 2023 7B – 70B Fine-tuning för dialoger (RLHF). Införande av Grouped-Query Attention (GQA). Kontextfönster på 4 096 token. Första kommersiella licensen.
Code Llama Augusti 2023 7B – 70B Specialiserad version för kod. Fine-tuning på 500 miljarder kod-token. Varianter: grundläggande, Python-specialiserad, instruction-tuned.
LLaMA 3 April 2024 8B, 70B Träning på 15 biljoner token. Förbättrad tokenizer med ett ordförråd på 128 000 token. Hög prestanda (82 % på MMLU).
LLaMA 3.1 Juli 2024[2] 8B, 70B, 405B Flaggskeppsmodellen 405B med prestanda i nivå med GPT-4o. Kontextfönster upp till 128 000 token. Möjlighet att bearbeta bilder tillkom.
LLaMA 4 (plan: april 2025) 109B (Scout), 400B (Maverick), 2T (Behemoth) Mixture-of-Experts (MoE)-arkitektur. Inbyggd multimodalitet (text, bilder, video). Kontextfönster upp till 10 miljoner token.

Arkitektur

LLaMA använder en autoregressiv transformer-decoder-arkitektur, men introducerar ett antal viktiga förbättringar som höjer beräkningseffektiviteten och kvaliteten på den genererade texten:

  • Pre-normalization (Förhandsnormalisering). Normalisering tillämpas på ingången av varje transformer-delskikt, snarare än på utgången. Detta tillvägagångssätt stabiliserar träningen av mycket djupa nätverk och förhindrar gradientproblem.
  • RMSNorm (Root Mean Square Layer Normalization). Istället för den vanliga LayerNorm används RMSNorm. Denna normaliseringsteknik eliminerar operationen att subtrahera medelvärdet, vilket påskyndar beräkningarna med 10–50 % med bibehållen stabilitet.
  • SwiGLU (Swish-Gated Linear Unit). Som aktiveringsfunktion används SwiGLU istället för ReLU eller GELU. Denna gating mechanism skapar ett jämnare gradientflöde och förbättrar modellens kvalitet.
  • RoPE (Rotary Position Embeddings). Relativa positionella embeddings av typen RoPE används för att koda token-positioner, vilket gör det möjligt för modellen att bättre extrapolera till sekvenser som är längre än de som användes under träningen.
  • GQA (Grouped-Query Attention). Introducerad i LLaMA 2, denna teknik är en optimering av multi-head attention som avsevärt minskar minneskraven och påskyndar textgenerering.
  • Mixture-of-Experts (MoE) (planeras i LLaMA 4). En arkitektur som delar upp modellens parametrar i "expert"-undernätverk och aktiverar endast en liten del av dem för varje förfrågan. Detta minskar drastiskt beräkningskostnaderna vid inferens.

Konfigurationer för LLaMA 1

Arkitekturparametrar för LLaMA 1-modeller
Modell Parametrar Dolt tillståndsdimension Antal lager Antal attention-huvuden Träningsdatavolym
7B 6.7B 4096 32 32 1.0T token
13B 13.0B 5120 40 40 1.0T token
33B 32.5B 6656 60 52 1.4T token
65B 65.2B 8192 80 64 1.4T token

Träningsdata

Volymen av träningskorpusar har vuxit från 1,4 biljoner token för LLaMA 1 till 15 biljoner för LLaMA 3. För träning används offentligt tillgängliga källor, inklusive Common Crawl (utgör upp till 67 % av datan), C4, GitHub, Wikipedia, Books, ArXiv och Stack Exchange. För LLaMA 3 användes även högkvalitativa privata data.

Prestanda och jämförelse

  • På benchmark: Modellen LLaMA 3.1 (405B) visar resultat nära GPT-4o: på MMLU-testet uppnår den 88,6 %, vilket är bara 0,1 procentenheter sämre än GPT-4o. På kodgenereringsuppgiften HumanEval visar LLaMA 3.1 89 % (GPT-4o — 90,2 %).
  • Parametereffektivitet: LLaMA-modeller med färre parametrar överträffar ofta konkurrenternas större modeller. Till exempel överträffade LLaMA 1 (13B) GPT-3 (175B) på de flesta tester.
  • Kostnad: Vid lokal hosting kan inferenskostnaden för LLaMA vara upp till 50 gånger lägre jämfört med användning av proprietära API:er, vilket gör tekniken tillgänglig för små och medelstora företag.

Licensiering

  • LLaMA 1 distribuerades under en icke-kommersiell forskningslicens med tillgång efter ansökan.
  • LLaMA 2 och senare versioner distribueras under Llama Community License, som tillåter kommersiell användning och modifiering. Licensen innehåller dock begränsningar: företag med mer än 700 miljoner aktiva användare per månad måste inhämta särskilt tillstånd från Meta. Detta väcker diskussioner om huruvida LLaMA är en helt öppen modell.

Tillämpningar

LLaMA-modeller är integrerade i produkter från tusentals företag och används inom olika områden:

  • Företagssektorn: Zoom använder LLaMA i AI Companion för mötessammanfattningar; Shopify — för behandling av 40–60 miljoner förfrågningar per dag för berikning av produktmetadata; Instacart — i den interna assistenten Ava.
  • Vetenskap och samhälle: Meditron (en anpassning av LLaMA) används för medicinsk diagnostik i resursfattiga regioner.
  • Offentlig sektor och industri: Meta har ingått partnerskap med Lockheed Martin och Palantir. NASA använder LLaMA 3 på ISS som en offline-assistent för att utföra kritiska operationer utan kontakt med jorden.

Begränsningar och kritik

  • Bias och säkerhet: Oberoende revisioner visar att LLaMA-modeller, trots säkerhetsåtgärder, kan reproducera skadliga stereotyper. Läckan av LLaMA 1:s vikter skärpte frågorna om potentiellt skadlig användning av tekniken.
  • Kunskapsluckor: Inom mycket specialiserade områden kan LLaMA uppvisa brister. Till exempel var precisionen på det medicinska testet nephSAP 17–30 % jämfört med 73 % för GPT-4.
  • Energiförbrukning: Träning av stora modeller kräver enorma resurser. Träningen av LLaMA 1 krävde 2 638 MWh, vilket motsvarar utsläpp på 1 015 ton CO₂.

Framtid

Meta planerar att investera upp till 65 miljarder dollar i AI-infrastruktur till 2025. Under utveckling finns modellen LLaMA 4 Behemoth med 2 biljoner parametrar, som kommer att stödja mer än 200 språk och få djup integration med metaverse-produkter.

Litteratur

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
  • Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
  • Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
  • Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
  • Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
  • Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.

Noter

  1. Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
  2. LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.

Se även

  • GPT
  • Stora språkmodeller
  • Transformer (neural nätverksarkitektur)