LLaMA (Meta AI) (BG)
LLaMA (Large Language Model Meta AI) — семейство от големи езикови модели (LLM) с предимно отворен изходен код, разработвано от изследователското подразделение Meta AI. Моделите LLaMA се изграждат върху модифицирана архитектура на transformer и са ориентирани към висока изчислителна ефективност, демократизация на достъпа до съвременни ИИ-технологии и лесна адаптация към специализирани задачи. Семейството еволюира от първоначалния изследователски релийз LLaMA 1 (февруари 2023 г.) до мултимодалните модели LLaMA 4 (планиран релийз през 2026 г.).
Наименование
Абревиатурата LLaMA се разшифрова като Large Language Model Meta AI (Голям езиков модел Meta AI).
- Large Language Model — подчертава мащаба на моделите, чиито параметри се измерват от милиарди до трилиони.
- Meta AI — указва разработчика — изследователската група Meta.
История на създаването
Разработката на LLaMA започна в края на 2022 г. като стратегически отговор на Meta на успеха на ChatGPT от OpenAI. Марк Зукърбърг сформира міждисциплинарен екип, включващ изследователи от лабораторията FAIR (Facebook AI Research). Ключова роля във философията на проекта изигра Ян Льокун, ръководител на FAIR, който от 2013 г. се придържа към принципа на пълна откритост на всички изследвания на лабораторията.
Първата версия, LLaMA 1, беше пусната през февруари 2023 г. с изследователски лиценз. Скоро след релийза, през март 2023 г., теглата на модела изтекоха в мрежата чрез BitTorrent. Това събитие, въпреки опасенията, не спря, а напротив — ускори развитието на проекта, тъй като даде възможност на независими изследователи и ентусиасти по целия свят да експериментират с модела. В резултат на платформата Hugging Face се появиха десетки хиляди производни модели. Следващите версии, започвайки с LLaMA 2, вече се пускаха с търговски лиценз[1], затвърждавайки статута на LLaMA като ключов играч на пазара на отворени ИИ-модели.
Еволюция на моделите и хронология на релийзите
| Версия | Дата на издаване | Диапазон на параметрите | Ключови иновации и особености |
|---|---|---|---|
| LLaMA 1 | Февруари 2023 | 7B – 65B | Базова архитектура (RMSNorm, SwiGLU, RoPE). Обучение върху 1,4 трлн token. Контекстен прозорец от 2048 token. Изследователски лиценз. |
| LLaMA 2 | Юли 2023 | 7B – 70B | Дообучение за диалози (RLHF). Въвеждане на Grouped-Query Attention (GQA). Контекстен прозорец от 4096 token. Първи търговски лиценз. |
| Code Llama | Август 2023 | 7B – 70B | Специализирана версия за код. Дообучение върху 500 млрд token код. Варианти: базов, специализиран за Python, instruction-tuned. |
| LLaMA 3 | Април 2024 | 8B, 70B | Обучение върху 15 трлн token. Подобрен tokenizer с речник от 128 хил. token. Висока производителност (82% на MMLU). |
| LLaMA 3.1 | Юли 2024[2] | 8B, 70B, 405B | Флагмански модел 405B с производителност на ниво GPT-4o. Контекстен прозорец до 128 хил. token. Появи се възможност за обработка на изображения. |
| LLaMA 4 | (план: април 2025) | 109B (Scout), 400B (Maverick), 2T (Behemoth) | Архитектура Mixture-of-Experts (MoE). Нативна мултимодалност (текст, изображения, видео). Контекстен прозорец до 10 млн token. |
Архитектура
LLaMA използва архитектура на авторегресивен transformer-декодер, но въвежда редица ключови подобрения, повишаващи изчислителната ефективност и качеството на генерирания текст:
- Pre-normalization (Предварителна нормализация). Нормализацията се прилага на входа на всеки подслой на transformer-а, а не на изхода. Този подход стабилизира обучението на много дълбоки мрежи и предотвратява проблеми с градиентите.
- RMSNorm (Root Mean Square Layer Normalization). Вместо стандартен LayerNorm се използва RMSNorm. Тази техника за нормализация премахва операцията за изваждане на средната стойност, което ускорява изчисленията с 10–50% при запазване на стабилността.
- SwiGLU (Swish-Gated Linear Unit). Като функция за активиране вместо ReLU или GELU се използва SwiGLU. Този механизъм на портиране (gating mechanism) създава по-плавен поток на градиента и подобрява качеството на модела.
- RoPE (Rotary Position Embeddings, Ротационни позиционни embedding-и). За кодиране на позициите на token-ите се прилагат относителни позиционни embedding-и RoPE, които позволяват на модела да екстраполира по-добре върху последователности, по-дълги от използваните при обучението.
- GQA (Grouped-Query Attention). Въведена в LLaMA 2, тази техника е оптимизация на многоглавото внимание, която значително намалява изискванията към паметта и ускорява генерирането на текст.
- Mixture-of-Experts (MoE) (планирано в LLaMA 4). Архитектура, която разделя параметрите на модела на „експертни" подмрежи, активирайки само малка тяхна част за всяка заявка. Това рязко намалява изчислителните разходи при inference.
Конфигурации на LLaMA 1
| Модел | Параметри | Размерност на скритото състояние | Бр. слоеве | Бр. глави на вниманието | Обем на обучаващите данни |
|---|---|---|---|---|---|
| 7B | 6.7B | 4096 | 32 | 32 | 1.0T token |
| 13B | 13.0B | 5120 | 40 | 40 | 1.0T token |
| 33B | 32.5B | 6656 | 60 | 52 | 1.4T token |
| 65B | 65.2B | 8192 | 80 | 64 | 1.4T token |
Обучаващи данни
Обемът на обучаващите корпуси нарасна от 1,4 трлн token за LLaMA 1 до 15 трлн за LLaMA 3. За обучение се използват общодостъпни източници, включително Common Crawl (съставлява до 67% от данните), C4, GitHub, Wikipedia, Books, ArXiv и Stack Exchange. За LLaMA 3 бяха използвани и висококачествени частни данни.
Производителност и сравнение
- На benchmark-ите: Моделът LLaMA 3.1 (405B) показва резултати, близки до GPT-4o: на теста MMLU достига 88,6%, отстъпвайки на GPT-4o само с 0,1 процентни пункта. На задачата за генериране на код HumanEval LLaMA 3.1 показва 89% (GPT-4o — 90,2%).
- Параметрична ефективност: Моделите LLaMA с по-малък брой параметри често превъзхождат по-големи модели на конкурентите. Например LLaMA 1 (13B) надмина GPT-3 (175B) на повечето тестове.
- Стойност: При локален хостинг цената на inference с LLaMA може да бъде до 50 пъти по-ниска в сравнение с използването на проприетарни API, което прави технологията достъпна за малкия и средния бизнес.
Лицензиране
- LLaMA 1 се разпространяваше по некомерсиален изследователски лиценз с достъп по заявка.
- LLaMA 2 и по-късните версии се разпространяват по лиценза Llama Community License, който разрешава търговско използване и модификация. Лицензът обаче съдържа ограничения: компании с повече от 700 млн активни потребители на месец трябва да получават специално разрешение от Meta. Това предизвиква дискусии дали LLaMA е напълно отворен модел.
Приложение
Моделите LLaMA са интегрирани в продуктите на хиляди компании и се използват в различни сфери:
- Корпоративен сектор: Zoom използва LLaMA в AI Companion за резюмета на срещи; Shopify — за обработка на 40–60 млн заявки на ден за обогатяване на метаданни на стоки; Instacart — във вътрешния асистент Ava.
- Наука и общество: Meditron (адаптация на LLaMA) се използва за медицинска диагностика в региони с ограничени ресурси.
- Държавен сектор и промишленост: Meta сключи партньорства с Lockheed Martin и Palantir. NASA използва LLaMA 3 на МКС като офлайн-асистент за изпълнение на критични операции без връзка със Земята.
Ограничения и критика
- Предразсъдъци и безопасност: Независими одити показват, че моделите LLaMA, въпреки мерките за безопасност, могат да възпроизвеждат вредни стереотипи. Изтичането на теглата на LLaMA 1 изостри въпросите за потенциалната злонамерена употреба на технологията.
- Пропуски в знанията: В тясно специализирани области LLaMA може да демонстрира пропуски. Например точността на медицинския тест nephSAP е 17–30% спрямо 73% при GPT-4.
- Енергопотребление: Обучението на големи модели изисква огромни ресурси. Тренирането на LLaMA 1 изисква 2 638 МВт·ч, което е еквивалентно на емисии от 1 015 тона CO₂.
Бъдеще
Meta планира да инвестира до 65 милиарда долара в AI-инфраструктура до 2025 г. В разработка е моделът LLaMA 4 Behemoth с 2 трилиона параметра, който ще поддържа над 200 езика и ще получи дълбока интеграция с продуктите на метавселената.
Литература
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
- Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
- Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
- Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
- Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.
Бележки
- ↑ Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
- ↑ LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.
Вижте също
- GPT
- Големи езикови модели
- Transformer (архитектура на невронна мрежа)