LLaMA (Meta AI) (PL)
LLaMA (Large Language Model Meta AI) — rodzina dużych modeli językowych (LLM) o przeważnie otwartym kodzie źródłowym, rozwijana przez dział badawczy Meta AI. Modele LLaMA opierają się na zmodyfikowanej architekturze transformer i są ukierunkowane na wysoką efektywność obliczeniową, demokratyzację dostępu do zaawansowanych technologii AI oraz łatwą adaptację do zadań specjalistycznych. Rodzina ewoluowała od pierwotnego wydania badawczego LLaMA 1 (luty 2023) do multimodalnych modeli LLaMA 4 (planowane wydanie w 2026 roku).
Nazwa
Skrót LLaMA oznacza Large Language Model Meta AI (Duży Model Językowy Meta AI).
- Large Language Model — podkreśla skalę modeli, których parametry mierzone są od miliardów do bilionów.
- Meta AI — wskazuje na twórcę, grupę badawczą Meta.
Historia powstania
Prace nad LLaMA rozpoczęły się pod koniec 2022 roku jako strategiczna odpowiedź Meta na sukces ChatGPT od OpenAI. Mark Zuckerberg sformował interdyscyplinarny zespół, obejmujący badaczy z laboratorium FAIR (Facebook AI Research). Kluczową rolę w filozofii projektu odegrał Yann LeCun, kierownik FAIR, który od 2013 roku wyznawał zasadę pełnej otwartości wszystkich badań laboratorium.
Pierwsza wersja, LLaMA 1, została wydana w lutym 2023 roku na licencji badawczej. Wkrótce po premierze, w marcu 2023 roku, wagi modelu wyciekły do sieci za pośrednictwem BitTorrent. To wydarzenie, wbrew obawom, nie zatrzymało, lecz wręcz przeciwnie — przyspieszyło rozwój projektu, dając niezależnym badaczom i entuzjastom na całym świecie możliwość eksperymentowania z modelem. W rezultacie na platformie Hugging Face pojawiły się dziesiątki tysięcy modeli pochodnych. Kolejne wersje, począwszy od LLaMA 2, były już wydawane na licencji komercyjnej[1], ugruntowując status LLaMA jako kluczowego gracza na rynku otwartych modeli AI.
Ewolucja modeli i harmonogram wydań
| Wersja | Data wydania | Zakres parametrów | Kluczowe innowacje i cechy |
|---|---|---|---|
| LLaMA 1 | Luty 2023 | 7B – 65B | Podstawowa architektura (RMSNorm, SwiGLU, RoPE). Trening na 1,4 bln tokenów. Okno kontekstu 2048 tokenów. Licencja badawcza. |
| LLaMA 2 | Lipiec 2023 | 7B – 70B | Dostrajanie do dialogów (RLHF). Wdrożenie Grouped-Query Attention (GQA). Okno kontekstu 4096 tokenów. Pierwsza licencja komercyjna. |
| Code Llama | Sierpień 2023 | 7B – 70B | Specjalistyczna wersja do kodu. Dostrajanie na 500 mld tokenów kodu. Warianty: podstawowy, specjalizowany pod Python, instruction-tuned. |
| LLaMA 3 | Kwiecień 2024 | 8B, 70B | Trening na 15 bln tokenów. Ulepszony tokenizer ze słownikiem 128 tys. tokenów. Wysoka wydajność (82% na MMLU). |
| LLaMA 3.1 | Lipiec 2024[2] | 8B, 70B, 405B | Flagowy model 405B z wydajnością na poziomie GPT-4o. Okno kontekstu do 128 tys. tokenów. Pojawiła się możliwość przetwarzania obrazów. |
| LLaMA 4 | (plan: kwiecień 2025) | 109B (Scout), 400B (Maverick), 2T (Behemoth) | Architektura Mixture-of-Experts (MoE). Natywna multimodalność (tekst, obrazy, wideo). Okno kontekstu do 10 mln tokenów. |
Architektura
LLaMA wykorzystuje architekturę autoregresyjnego transformera-dekodera, wprowadzając jednak szereg kluczowych ulepszeń zwiększających efektywność obliczeniową i jakość generowanego tekstu:
- Pre-normalization (Wstępna normalizacja). Normalizacja jest stosowana na wejściu każdej podwarstwy transformera, a nie na wyjściu. Takie podejście stabilizuje trening bardzo głębokich sieci i zapobiega problemom z gradientami.
- RMSNorm (Root Mean Square Layer Normalization). Zamiast standardowej LayerNorm stosowana jest RMSNorm. Ta technika normalizacji eliminuje operację odejmowania średniej, co przyspiesza obliczenia o 10–50% przy zachowaniu stabilności.
- SwiGLU (Swish-Gated Linear Unit). Jako funkcja aktywacji zamiast ReLU lub GELU stosowana jest SwiGLU. Ten mechanizm gating tworzy bardziej płynny przepływ gradientu i poprawia jakość modelu.
- RoPE (Rotary Position Embeddings, Rotacyjne pozycyjne embedding). Do kodowania pozycji tokenów stosowane są względne pozycyjne embedding RoPE, które pozwalają modelowi lepiej ekstrapolować na sekwencje dłuższe niż te używane podczas treningu.
- GQA (Grouped-Query Attention). Wprowadzona w LLaMA 2, technika ta stanowi optymalizację wielogłowego attention, która znacząco zmniejsza wymagania pamięciowe i przyspiesza generowanie tekstu.
- Mixture-of-Experts (MoE) (planowane w LLaMA 4). Architektura, która dzieli parametry modelu na „eksperckie" podsieci, aktywując jedynie niewielką ich część dla każdego zapytania. Drastycznie zmniejsza to koszty obliczeniowe inferencji.
Konfiguracje LLaMA 1
| Model | Parametry | Wymiarowość stanu ukrytego | Liczba warstw | Liczba głów attention | Rozmiar danych treningowych |
|---|---|---|---|---|---|
| 7B | 6.7B | 4096 | 32 | 32 | 1.0T tokenów |
| 13B | 13.0B | 5120 | 40 | 40 | 1.0T tokenów |
| 33B | 32.5B | 6656 | 60 | 52 | 1.4T tokenów |
| 65B | 65.2B | 8192 | 80 | 64 | 1.4T tokenów |
Dane treningowe
Wielkość korpusów treningowych wzrosła z 1,4 bln tokenów dla LLaMA 1 do 15 bln dla LLaMA 3. Do treningu wykorzystywane są publicznie dostępne źródła, w tym Common Crawl (stanowiący do 67% danych), C4, GitHub, Wikipedia, Books, ArXiv oraz Stack Exchange. Dla LLaMA 3 wykorzystywano również wysokiej jakości dane prywatne.
Wydajność i porównanie
- Na benchmarkach: Model LLaMA 3.1 (405B) osiąga wyniki zbliżone do GPT-4o: w teście MMLU uzyskuje 88,6%, ustępując GPT-4o jedynie o 0,1 punktu procentowego. W zadaniu generowania kodu HumanEval LLaMA 3.1 osiąga 89% (GPT-4o — 90,2%).
- Efektywność parametryczna: Modele LLaMA z mniejszą liczbą parametrów często przewyższają większe modele konkurentów. Na przykład LLaMA 1 (13B) przebiła GPT-3 (175B) na większości testów.
- Koszt: Przy lokalnym hostingu koszt inferencji LLaMA może być nawet 50 razy niższy w porównaniu z korzystaniem z własnościowych API, co czyni tę technologię dostępną dla małych i średnich przedsiębiorstw.
Licencjonowanie
- LLaMA 1 była dystrybuowana na niekomercyjnej licencji badawczej z dostępem na żądanie.
- LLaMA 2 i nowsze wersje są dystrybuowane na licencji Llama Community License, która zezwala na użytek komercyjny i modyfikację. Licencja zawiera jednak ograniczenia: firmy z więcej niż 700 mln aktywnych użytkowników miesięcznie muszą uzyskać specjalne zezwolenie od Meta. Rodzi to dyskusje na temat tego, czy LLaMA jest w pełni otwartym modelem.
Zastosowania
Modele LLaMA są zintegrowane z produktami tysięcy firm i wykorzystywane w różnych dziedzinach:
- Sektor korporacyjny: Zoom wykorzystuje LLaMA w AI Companion do podsumowań spotkań; Shopify — do obsługi 40–60 mln zapytań dziennie w celu wzbogacania metadanych produktów; Instacart — w wewnętrznym asystencie Ava.
- Nauka i społeczeństwo: Meditron (adaptacja LLaMA) jest używany do diagnostyki medycznej w regionach o ograniczonych zasobach.
- Sektor publiczny i przemysł: Meta zawarła partnerstwa z Lockheed Martin i Palantir. NASA używa LLaMA 3 na MSK jako asystenta offline do wykonywania krytycznych operacji bez łączności z Ziemią.
Ograniczenia i krytyka
- Stronniczość i bezpieczeństwo: Niezależne audyty pokazują, że modele LLaMA, pomimo zastosowanych środków bezpieczeństwa, mogą reprodukować szkodliwe stereotypy. Wyciek wag LLaMA 1 zaostrzył pytania o potencjalne złośliwe wykorzystanie technologii.
- Luki w wiedzy: W wąsko specjalistycznych dziedzinach LLaMA może wykazywać braki. Na przykład dokładność w teście medycznym nephSAP wyniosła 17–30% wobec 73% u GPT-4.
- Zużycie energii: Trening dużych modeli wymaga ogromnych zasobów. Trening LLaMA 1 pochłonął 2 638 MWh, co odpowiada emisji 1 015 ton CO₂.
Przyszłość
Meta planuje zainwestować do 65 miliardów dolarów w infrastrukturę AI do 2025 roku. W opracowaniu znajduje się model LLaMA 4 Behemoth z 2 bilionami parametrów, który będzie obsługiwał ponad 200 języków i uzyska głęboką integrację z produktami metaświata.
Literatura
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
- Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
- Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
- Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
- Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.
Przypisy
- ↑ Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
- ↑ LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.
Zobacz też
- GPT
- Duże modele językowe
- Transformer (architektura sieci neuronowej)