LLaMA (Meta AI) (TR)
LLaMA (Large Language Model Meta AI) — Meta AI araştırma birimi tarafından geliştirilen, ağırlıklı olarak açık kaynak kodlu büyük dil modelleri (LLM) ailesidir. LLaMA modelleri, değiştirilmiş bir transformer mimarisi üzerine inşa edilmiş olup yüksek hesaplama verimliliğine, ileri AI teknolojilerine demokratik erişime ve özel görevlere kolay uyarlanabilirliğe odaklanmaktadır. Aile, ilk araştırma sürümü olan LLaMA 1'den (Şubat 2023) LLaMA 4'ün çok modlu modellerine (planlanan yayın tarihi 2026) kadar evrim geçirmiştir.
Adlandırma
LLaMA kısaltması Large Language Model Meta AI (Meta AI Büyük Dil Modeli) ifadesinin kısaltmasıdır.
- Large Language Model — parametreleri milyarlardan trilyonlara kadar ölçülen modellerin büyük ölçeğini vurgular.
- Meta AI — geliştirici olan Meta araştırma grubuna işaret eder.
Yaratılış tarihi
LLaMA'nın geliştirilmesi, 2022 yılının sonunda Meta'nın OpenAI'nin ChatGPT'nin başarısına karşı stratejik bir yanıtı olarak başladı. Mark Zuckerberg, FAIR (Facebook AI Research) laboratuvarından araştırmacıları da kapsayan disiplinlerarası bir ekip kurdu. FAIR'in başkanı ve 2013'ten bu yana laboratuvarın tüm araştırmalarını tam açıklık ilkesiyle yürüten Yann LeCun, projenin felsefesinde kilit bir rol oynadı.
İlk sürüm olan LLaMA 1, Şubat 2023'te araştırma lisansıyla yayımlandı. Yayımlanmasının kısa süre sonrasında, Mart 2023'te modelin ağırlıkları BitTorrent aracılığıyla internete sızdı. Bu olay, endişelerin aksine projenin gelişimini durdurmak yerine tersine hızlandırdı; zira dünya genelindeki bağımsız araştırmacılara ve meraklılara modeli deneyimleme imkânı sağladı. Sonuç olarak Hugging Face platformunda on binlerce türev model ortaya çıktı. LLaMA 2 ile başlayan sonraki sürümler ise ticari lisansla yayımlandı[1] ve LLaMA'nın açık AI modelleri pazarındaki kilit oyuncu konumunu pekiştirdi.
Model evrimi ve yayım kronolojisi
| Sürüm | Yayım tarihi | Parametre aralığı | Temel yenilikler ve özellikler |
|---|---|---|---|
| LLaMA 1 | Şubat 2023 | 7B – 65B | Temel mimari (RMSNorm, SwiGLU, RoPE). 1,4 trilyon token üzerinde eğitim. 2048 token bağlam penceresi. Araştırma lisansı. |
| LLaMA 2 | Temmuz 2023 | 7B – 70B | Diyalog için ince ayar (RLHF). Grouped-Query Attention (GQA) entegrasyonu. 4096 token bağlam penceresi. İlk ticari lisans. |
| Code Llama | Ağustos 2023 | 7B – 70B | Kod için özelleştirilmiş sürüm. 500 milyar token kod üzerinde ince ayar. Seçenekler: temel, Python'a özel, instruction-tuned. |
| LLaMA 3 | Nisan 2024 | 8B, 70B | 15 trilyon token üzerinde eğitim. 128 bin tokenlik sözlük ile geliştirilmiş tokenizer. Yüksek performans (MMLU'da %82). |
| LLaMA 3.1 | Temmuz 2024[2] | 8B, 70B, 405B | GPT-4o düzeyinde performansa sahip 405B amiral gemisi modeli. 128 bin tokena kadar bağlam penceresi. Görüntü işleme desteği eklendi. |
| LLaMA 4 | (plan: Nisan 2025) | 109B (Scout), 400B (Maverick), 2T (Behemoth) | Mixture-of-Experts (MoE) mimarisi. Yerel çok modalite (metin, görüntü, video). 10 milyona kadar token bağlam penceresi. |
Mimari
LLaMA, otoregressif bir transformer-decoder mimarisi kullanmakla birlikte hesaplama verimliliğini ve üretilen metnin kalitesini artıran bir dizi temel iyileştirme sunar:
- Pre-normalization (Ön normalizasyon). Normalizasyon, transformer'ın her alt katmanının çıkışında değil, girişinde uygulanır. Bu yaklaşım, çok derin ağların eğitimini kararlı hale getirir ve gradyan sorunlarını önler.
- RMSNorm (Root Mean Square Layer Normalization). Standart LayerNorm yerine RMSNorm kullanılır. Bu normalizasyon tekniği, ortalama çıkarma işlemini ortadan kaldırarak kararlılığı korurken hesaplamaları %10–50 oranında hızlandırır.
- SwiGLU (Swish-Gated Linear Unit). Aktivasyon fonksiyonu olarak ReLU veya GELU yerine SwiGLU kullanılır. Bu gating mechanism daha akıcı bir gradyan akışı sağlar ve model kalitesini artırır.
- RoPE (Rotary Position Embeddings, Dönel Konumsal Embedding'ler). Token konumlarını kodlamak için göreli konumsal embedding'ler olan RoPE kullanılır; bu sayede model, eğitimde kullanılandan daha uzun dizilere daha iyi ekstrapolasyon yapabilir.
- GQA (Grouped-Query Attention). LLaMA 2'de tanıtılan bu teknik, çok başlı attention'ın bir optimizasyonu olup bellek gereksinimlerini önemli ölçüde azaltır ve metin üretimini hızlandırır.
- Mixture-of-Experts (MoE) (LLaMA 4'te planlanıyor). Modelin parametrelerini "uzman" alt ağlara bölen ve her istek için yalnızca küçük bir kısmını etkinleştiren mimari. Bu, inference hesaplama maliyetlerini önemli ölçüde düşürür.
LLaMA 1 konfigürasyonları
| Model | Parametre | Gizli durum boyutu | Katman sayısı | Attention başlığı sayısı | Eğitim verisi hacmi |
|---|---|---|---|---|---|
| 7B | 6.7B | 4096 | 32 | 32 | 1.0T token |
| 13B | 13.0B | 5120 | 40 | 40 | 1.0T token |
| 33B | 32.5B | 6656 | 60 | 52 | 1.4T token |
| 65B | 65.2B | 8192 | 80 | 64 | 1.4T token |
Eğitim verileri
Eğitim korpuslarının hacmi, LLaMA 1 için 1,4 trilyon tokenden LLaMA 3 için 15 trilyona yükseldi. Eğitimde Common Crawl (verilerin %67'sine kadar), C4, GitHub, Wikipedia, Books, ArXiv ve Stack Exchange dahil kamuya açık kaynaklar kullanılmaktadır. LLaMA 3 için ayrıca yüksek kaliteli özel veriler de kullanıldı.
Performans ve karşılaştırma
- Benchmark'larda: LLaMA 3.1 (405B) modeli GPT-4o'ya yakın sonuçlar göstermektedir: MMLU testinde %88,6 oranına ulaşarak GPT-4o'nun yalnızca 0,1 yüzde puan gerisinde kalmaktadır. Kod üretimi görevi olan HumanEval'de LLaMA 3.1 %89 (GPT-4o — %90,2) sonuç elde etmektedir.
- Parametrik verimlilik: Daha az parametreli LLaMA modelleri çoğu zaman rakiplerin daha büyük modellerini geride bırakmaktadır. Örneğin LLaMA 1 (13B), testlerin büyük çoğunluğunda GPT-3'ü (175B) geçmiştir.
- Maliyet: Yerel barındırma durumunda, LLaMA'nın inference maliyeti tescilli API'lerin kullanımına kıyasla 50 kata kadar daha düşük olabilmektedir; bu da teknolojiyi küçük ve orta ölçekli işletmeler için erişilebilir kılmaktadır.
Lisanslama
- LLaMA 1, talep üzerine erişim ile ticari olmayan araştırma lisansı kapsamında dağıtıldı.
- LLaMA 2 ve sonraki sürümler, ticari kullanıma ve değişikliğe izin veren Llama Community License kapsamında dağıtılmaktadır. Ancak lisans kısıtlamalar içermektedir: ayda 700 milyondan fazla aktif kullanıcıya sahip şirketlerin Meta'dan özel izin alması gerekmektedir. Bu durum, LLaMA'nın tam anlamıyla açık bir model olup olmadığına dair tartışmalara yol açmaktadır.
Kullanım alanları
LLaMA modelleri binlerce şirketin ürünlerine entegre edilmiş olup çeşitli alanlarda kullanılmaktadır:
- Kurumsal sektör: Zoom, toplantı özetleri için AI Companion'da LLaMA kullanmaktadır; Shopify, ürün metadata'sını zenginleştirmek için günde 40–60 milyon isteği işlemekte; Instacart ise dahili asistan Ava'da kullanmaktadır.
- Bilim ve toplum: Meditron (LLaMA uyarlaması), kısıtlı kaynaklara sahip bölgelerde tıbbi tanı için kullanılmaktadır.
- Kamu sektörü ve sanayi: Meta, Lockheed Martin ve Palantir ile ortaklıklar kurmuştur. NASA, kritik operasyonları Dünya ile iletişim kurmaksızın yürütmek için Uluslararası Uzay İstasyonu'nda çevrimdışı bir asistan olarak LLaMA 3'ü kullanmaktadır.
Sınırlamalar ve eleştiriler
- Önyargı ve güvenlik: Bağımsız denetimler, LLaMA modellerinin güvenlik önlemlerine rağmen zararlı kalıpları yeniden üretebileceğini göstermektedir. LLaMA 1 ağırlıklarının sızması, teknolojinin kötü amaçlı kullanımına ilişkin soruları keskinleştirdi.
- Bilgi eksiklikleri: Dar uzmanlık gerektiren alanlarda LLaMA eksiklikler gösterebilmektedir. Örneğin nephSAP tıbbi testindeki doğruluk oranı GPT-4'ün %73'üne karşılık %17–30 olarak gerçekleşmiştir.
- Enerji tüketimi: Büyük modellerin eğitimi muazzam kaynaklar gerektirmektedir. LLaMA 1'in eğitimi 2.638 MWh enerji tüketmiş; bu miktar 1.015 ton CO₂ emisyonuna eşdeğerdir.
Gelecek
Meta, 2025 yılına kadar AI altyapısına 65 milyar dolara kadar yatırım yapmayı planlamaktadır. 2 trilyon parametreli, 200'den fazla dili destekleyecek ve metaverse ürünleriyle derin entegrasyona sahip olacak LLaMA 4 Behemoth modeli geliştirme aşamasındadır.
Ayrıca bakınız
- GPT
- Büyük dil modelleri
- Transformer (sinir ağı mimarisi)
Kaynakça
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
- Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
- Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
- Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
- Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.
Notlar
- ↑ Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
- ↑ LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.