LLaMA (Meta AI) (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

LLaMA (Large Language Model Meta AI) — isang pamilya ng malalaking language model (LLM) na pangunahing may bukas na source code, na inihahanda ng research division ng Meta AI. Ang mga modelo ng LLaMA ay itinayo sa binagong arkitektura ng transformer at nakatuon sa mataas na kahusayan ng komputasyon, demokratisasyon ng access sa mga makabagong teknolohiya ng AI, at madaling pag-aangkop para sa mga espesyalisadong gawain. Ang pamilya ay nagbago mula sa unang research release ng LLaMA 1 (Pebrero 2023) hanggang sa multimodal na mga modelo ng LLaMA 4 (naplanong release sa 2026).

Pangalan

Ang abbreviation na LLaMA ay nangangahulugang Large Language Model Meta AI (Malaking Language Model ng Meta AI).

  • Large Language Model — binibigyang-diin ang sukat ng mga modelo, ang mga parameter ng kung saan ay sinusukat mula sa bilyon hanggang sa trilyon.
  • Meta AI — tinutukoy ang developer, ang research group ng Meta.

Kasaysayan ng Paglikha

Nagsimula ang pagbuo ng LLaMA sa huling bahagi ng 2022 bilang estratehikong tugon ng Meta sa tagumpay ng ChatGPT mula sa OpenAI. Binuo ni Mark Zuckerberg ang isang interdisciplinary na koponan na kinabibilangan ng mga mananaliksik mula sa laboratoryo ng FAIR (Facebook AI Research). Malaking papel sa pilosopiya ng proyekto ang ginampanan ni Yann LeCun, ang pinuno ng FAIR, na mula pa noong 2013 ay sumusunod sa prinsipyo ng kumpletong pagiging bukas ng lahat ng pananaliksik ng laboratoryo.

Ang unang bersyon, LLaMA 1, ay inilabas noong Pebrero 2023 na may research license. Ilang sandali pagkatapos ng release, noong Marso 2023, nag-leak ang mga weight ng modelo sa internet sa pamamagitan ng BitTorrent. Ang pangyayaring ito, salungat sa mga pangamba, ay hindi huminto kundi, sa kabaligtaran, nagpabilis ng pag-unlad ng proyekto, dahil binigyan nito ng pagkakataon ang mga independiyenteng mananaliksik at enthusiast sa buong mundo na mag-eksperimento sa modelo. Bilang resulta, libu-libong derived na modelo ang lumabas sa platform ng Hugging Face. Ang mga susunod na bersyon, simula sa LLaMA 2, ay inilabas na may commercial license[1], na nagpapatibay ng katayuan ng LLaMA bilang pangunahing manlalaro sa merkado ng mga bukas na modelo ng AI.

Ebolusyon ng mga Modelo at Kronolohiya ng mga Release

Kronolohiya ng pag-unlad ng mga modelo ng LLaMA
Bersyon Petsa ng Paglabas Hanay ng mga Parameter Mga Pangunahing Inobasyon at Katangian
LLaMA 1 Pebrero 2023 7B – 65B Pangunahing arkitektura (RMSNorm, SwiGLU, RoPE). Pagsasanay sa 1.4 trilyong token. Context window na 2048 token. Research license.
LLaMA 2 Hulyo 2023 7B – 70B Fine-tuning para sa mga diyalogo (RLHF). Pagpapakilala ng Grouped-Query Attention (GQA). Context window na 4096 token. Unang commercial license.
Code Llama Agosto 2023 7B – 70B Espesyalisadong bersyon para sa code. Fine-tuning sa 500 bilyong token ng code. Mga variant: pangunahin, Python-espesyalisado, instruction-tuned.
LLaMA 3 Abril 2024 8B, 70B Pagsasanay sa 15 trilyong token. Pinahusay na tokenizer na may bokabularyo na 128 libong token. Mataas na pagganap (82% sa MMLU).
LLaMA 3.1 Hulyo 2024[2] 8B, 70B, 405B Flagship na modelo na 405B na may pagganap sa antas ng GPT-4o. Context window hanggang 128 libong token. Lumabas ang kakayahang mag-proseso ng mga larawan.
LLaMA 4 (plano: Abril 2025) 109B (Scout), 400B (Maverick), 2T (Behemoth) Arkitektura ng Mixture-of-Experts (MoE). Native na multimodality (teksto, mga larawan, video). Context window hanggang 10 milyong token.

Arkitektura

Gumagamit ang LLaMA ng arkitektura ng autoregressive decoder-only transformer, ngunit nagpapakilala ng ilang pangunahing pagpapabuti na nagpapataas ng kahusayan ng komputasyon at kalidad ng nabuong teksto:

  • Pre-normalization (Paunang Normalisasyon). Ang normalisasyon ay inilalapat sa input ng bawat sub-layer ng transformer, hindi sa output. Ang pamamaraang ito ay nagpapanatag ng pagsasanay ng napakalalim na mga network at pumipigil sa mga problema sa gradient.
  • RMSNorm (Root Mean Square Layer Normalization). Sa halip na karaniwang LayerNorm, ginagamit ang RMSNorm. Ang teknik ng normalisasyong ito ay inaalis ang operasyon ng pagbabawas ng mean, na nagpapabilis ng mga kalkulasyon ng 10–50% habang pinapanatili ang katatagan.
  • SwiGLU (Swish-Gated Linear Unit). Bilang activation function sa halip na ReLU o GELU, ginagamit ang SwiGLU. Ang gating mechanism na ito ay lumilikha ng mas maayos na daloy ng gradient at nagpapabuti ng kalidad ng modelo.
  • RoPE (Rotary Position Embeddings, Rotational na Positional Embedding). Para sa pag-encode ng mga posisyon ng token, ginagamit ang relative positional embedding na RoPE, na nagbibigay-daan sa modelo na mas mahusay na mag-extrapolate sa mga sequence na mas mahaba kaysa sa mga ginamit sa pagsasanay.
  • GQA (Grouped-Query Attention). Ipinakilala sa LLaMA 2, ang teknik na ito ay isang optimization ng multi-head attention na makabuluhang nagbabawas ng mga kinakailangan sa memorya at nagpapabilis ng pagbuo ng teksto.
  • Mixture-of-Experts (MoE) (naplanong gamitin sa LLaMA 4). Isang arkitektura na naghahatii ng mga parameter ng modelo sa mga "expert" na sub-network, na nag-a-activate lamang ng maliit na bahagi nito para sa bawat kahilingan. Ito ay lubos na nagpapababa ng mga gastos sa komputasyon para sa inference.

Mga Konpigurasyon ng LLaMA 1

Mga arkitekturang parameter ng mga modelo ng LLaMA 1
Modelo Mga Parameter Dimensyon ng Nakatagong Estado Bilang ng mga Layer Bilang ng mga Attention Head Dami ng mga Datos sa Pagsasanay
7B 6.7B 4096 32 32 1.0T token
13B 13.0B 5120 40 40 1.0T token
33B 32.5B 6656 60 52 1.4T token
65B 65.2B 8192 80 64 1.4T token

Mga Datos sa Pagsasanay

Lumagkit ang dami ng mga corpus sa pagsasanay mula sa 1.4 trilyong token para sa LLaMA 1 hanggang sa 15 trilyon para sa LLaMA 3. Para sa pagsasanay, ginagamit ang mga mapagkukunang magagamit ng publiko, kabilang ang Common Crawl (na bumubuo ng hanggang 67% ng data), C4, GitHub, Wikipedia, Books, ArXiv at Stack Exchange. Para sa LLaMA 3, ginagamit din ang mga mataas na kalidad na pribadong datos.

Pagganap at Paghahambing

  • Sa mga benchmark: Ang modelo ng LLaMA 3.1 (405B) ay nagpapakita ng mga resulta na malapit sa GPT-4o: sa pagsubok na MMLU, umabot ito sa 88.6%, na nahuhuli sa GPT-4o ng 0.1 porsyentong puntos lamang. Sa gawain ng pagbuo ng code na HumanEval, nagpapakita ang LLaMA 3.1 ng 89% (GPT-4o — 90.2%).
  • Kahusayan ng parameter: Ang mga modelo ng LLaMA na may mas kaunting parameter ay madalas na nakakahigit sa mas malalaking modelo ng mga kakumpitensya. Halimbawa, ang LLaMA 1 (13B) ay nakahigit sa GPT-3 (175B) sa karamihan ng mga pagsubok.
  • Gastos: Sa lokal na hosting, ang gastos ng inference ng LLaMA ay maaaring hanggang 50 beses na mas mababa kumpara sa paggamit ng mga proprietary na API, na ginagawang accessible ang teknolohiya para sa maliliit at katamtamang laking negosyo.

Pagbibigay-Lisensya

  • LLaMA 1 ay ipinamamahagi sa ilalim ng non-commercial na research license na may access sa kahilingan.
  • LLaMA 2 at mga mas bagong bersyon ay ipinamamahagi sa ilalim ng Llama Community License, na nagpapahintulot ng commercial na paggamit at pagbabago. Gayunpaman, naglalaman ang lisensya ng mga paghihigpit: ang mga kumpanyang may higit sa 700 milyong aktibong gumagamit bawat buwan ay dapat kumuha ng espesyal na pahintulot mula sa Meta. Nagdudulot ito ng mga talakayan kung ang LLaMA ay isang ganap na bukas na modelo.

Mga Aplikasyon

Ang mga modelo ng LLaMA ay isinama sa mga produkto ng libu-libong kumpanya at ginagamit sa iba't ibang larangan:

  • Sektor ng korporasyon: Ginagamit ng Zoom ang LLaMA sa AI Companion para sa mga buod ng pulong; ang Shopify — para sa pagproseso ng 40–60 milyong kahilingan sa isang araw para sa pagpapayaman ng metadata ng produkto; ang Instacart — sa panloob na assistant na Ava.
  • Agham at lipunan: Ang Meditron (adaptasyon ng LLaMA) ay ginagamit para sa medikal na diagnosis sa mga rehiyong may limitadong resources;
  • Sektor ng pamahalaan at industriya: Nagtapos ang Meta ng mga pakikipagsosyo sa Lockheed Martin at Palantir. Gumagamit ang NASA ng LLaMA 3 sa ISS bilang offline assistant para sa pagsasagawa ng mga kritikal na operasyon nang walang koneksyon sa Lupa.

Mga Limitasyon at Kritisismo

  • Pagkiling at kaligtasan: Ipinapakita ng mga independiyenteng audit na ang mga modelo ng LLaMA, sa kabila ng mga hakbang sa kaligtasan, ay maaaring magparami ng mga mapanganib na stereotype. Ang pag-leak ng mga weight ng LLaMA 1 ay nagpasidhi ng mga katanungan tungkol sa potensyal na malisyosong paggamit ng teknolohiya.
  • Mga agwat sa kaalaman: Sa mga lubos na espesyalisadong larangan, maaaring magpakita ang LLaMA ng mga agwat. Halimbawa, ang katumpakan sa medikal na pagsubok na nephSAP ay 17–30% kumpara sa 73% ng GPT-4.
  • Konsumo ng enerhiya: Ang pagsasanay ng malalaking modelo ay nangangailangan ng napakalaking resources. Ang pagsasanay ng LLaMA 1 ay nangangailangan ng 2,638 MW·h, na katumbas ng 1,015 tonelada ng CO₂ na emisyon.

Kinabukasan

Plano ng Meta na mag-invest ng hanggang 65 bilyong dolyar sa AI infrastructure sa 2025. Nasa pag-unlad ang modelo na LLaMA 4 Behemoth na may 2 trilyong parameter, na susuporta sa higit sa 200 wika at makakakuha ng malalim na integrasyon sa mga produkto ng metaverse.

Mga Sanggunian

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
  • Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
  • Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
  • Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
  • Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
  • Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.

Mga Tala

  1. Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
  2. LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.

Tingnan Din

  • GPT
  • Malalaking Language Model
  • Transformer (arkitektura ng neural network)