LLaMA (Meta AI) (FA)
LLaMA (Large Language Model Meta AI) — خانوادهای از مدلهای زبانی بزرگ (LLM) با کد منبع عمدتاً باز، که توسط بخش تحقیقاتی Meta AI توسعه مییابد. مدلهای LLaMA بر پایه معماری اصلاحشده transformer ساخته شدهاند و بر کارایی بالای محاسباتی، دموکراتیزهکردن دسترسی به فناوریهای پیشرفته هوش مصنوعی و سازگاری آسان با وظایف تخصصی تمرکز دارند. این خانواده از انتشار اولیه پژوهشی LLaMA 1 (فوریه ۲۰۲۳) تا مدلهای چندوجهی LLaMA 4 (انتشار برنامهریزیشده در ۲۰۲۶) تکامل یافته است.
نامگذاری
مخفف LLaMA به صورت Large Language Model Meta AI (مدل زبانی بزرگ Meta AI) بسط مییابد.
- Large Language Model — بر مقیاس مدلها تأکید دارد که پارامترهای آنها از میلیاردها تا تریلیونها اندازهگیری میشود.
- Meta AI — به توسعهدهنده، یعنی گروه تحقیقاتی Meta، اشاره دارد.
تاریخچه
توسعه LLaMA در اواخر ۲۰۲۲ به عنوان پاسخ استراتژیک Meta به موفقیت ChatGPT از OpenAI آغاز شد. مارک زاکربرگ تیمی میانرشتهای متشکل از محققان آزمایشگاه FAIR (Facebook AI Research) تشکیل داد. یان لکون، رئیس FAIR، که از سال ۲۰۱۳ به اصل باز بودن کامل تمام پژوهشهای آزمایشگاه پایبند بود، نقش کلیدی در فلسفه این پروژه ایفا کرد.
نسخه اول، LLaMA 1، در فوریه ۲۰۲۳ با مجوز پژوهشی منتشر شد. اندکی پس از انتشار، در مارس ۲۰۲۳، وزنهای مدل از طریق BitTorrent به فضای اینترنت درز کرد. این رویداد، برخلاف نگرانیهای اولیه، توسعه پروژه را متوقف نکرد بلکه به آن شتاب بخشید، چرا که به محققان مستقل و علاقهمندان در سرتاسر جهان امکان داد با مدل آزمایش کنند. در نتیجه، دهها هزار مدل مشتق بر روی پلتفرم Hugging Face پدیدار شدند. نسخههای بعدی، از جمله LLaMA 2، با مجوز تجاری منتشر شدند[1] و جایگاه LLaMA را به عنوان یک بازیگر کلیدی در بازار مدلهای هوش مصنوعی باز تثبیت کردند.
تکامل مدلها و جدول زمانی انتشار
| نسخه | تاریخ انتشار | بازه پارامترها | نوآوریها و ویژگیهای کلیدی |
|---|---|---|---|
| LLaMA 1 | فوریه ۲۰۲۳ | 7B – 65B | معماری پایه (RMSNorm، SwiGLU، RoPE). آموزش روی ۱٫۴ تریلیون token. پنجره context به اندازه ۲۰۴۸ token. مجوز پژوهشی. |
| LLaMA 2 | جولای ۲۰۲۳ | 7B – 70B | fine-tuning برای مکالمه (RLHF). پیادهسازی Grouped-Query Attention (GQA). پنجره context به اندازه ۴۰۹۶ token. اولین مجوز تجاری. |
| Code Llama | اوت ۲۰۲۳ | 7B – 70B | نسخه تخصصی برای کد. fine-tuning روی ۵۰۰ میلیارد token کد. انواع: پایه، تخصصی Python، instruction-tuned. |
| LLaMA 3 | آوریل ۲۰۲۴ | 8B، 70B | آموزش روی ۱۵ تریلیون token. tokenizer بهبودیافته با واژگان ۱۲۸ هزار token. عملکرد بالا (۸۲٪ در MMLU). |
| LLaMA 3.1 | جولای ۲۰۲۴[2] | 8B، 70B، 405B | مدل پرچمدار 405B با عملکردی در سطح GPT-4o. پنجره context تا ۱۲۸ هزار token. قابلیت پردازش تصویر اضافه شد. |
| LLaMA 4 | (برنامه: آوریل ۲۰۲۵) | 109B (Scout)، 400B (Maverick)، 2T (Behemoth) | معماری Mixture-of-Experts (MoE). چندوجهی بودن بومی (متن، تصویر، ویدئو). پنجره context تا ۱۰ میلیون token. |
معماری
LLaMA از معماری transformer اتورگرسیو decoder-only استفاده میکند، اما مجموعهای از بهبودهای کلیدی را معرفی میکند که کارایی محاسباتی و کیفیت متن تولیدشده را افزایش میدهند:
- Pre-normalization (نرمالسازی پیشین). نرمالسازی در ورودی هر زیرلایه transformer اعمال میشود، نه در خروجی آن. این رویکرد آموزش شبکههای بسیار عمیق را تثبیت کرده و از مشکلات گرادیان جلوگیری میکند.
- RMSNorm (Root Mean Square Layer Normalization). به جای LayerNorm استاندارد از RMSNorm استفاده میشود. این تکنیک نرمالسازی عملیات کمکردن میانگین را حذف میکند و محاسبات را ۱۰ تا ۵۰ درصد با حفظ پایداری تسریع میبخشد.
- SwiGLU (Swish-Gated Linear Unit). به جای ReLU یا GELU از SwiGLU به عنوان تابع فعالسازی استفاده میشود. این مکانیزم gating جریان گرادیان روانتری ایجاد کرده و کیفیت مدل را بهبود میبخشد.
- RoPE (Rotary Position Embeddings، embedding موقعیت دورانی). برای رمزگذاری موقعیت tokenها از embedding موقعیت نسبی RoPE استفاده میشود که به مدل امکان میدهد بر روی دنبالههایی با طول بیشتر از آنچه در آموزش استفاده شده، بهتر برونیابی کند.
- GQA (Grouped-Query Attention). این تکنیک که در LLaMA 2 معرفی شد، یک بهینهسازی attention چندسری است که نیازهای حافظه را به طور قابل توجهی کاهش داده و تولید متن را تسریع میکند.
- Mixture-of-Experts (MoE) (برنامهریزیشده برای LLaMA 4). معماریای که پارامترهای مدل را به زیرشبکههای «متخصص» تقسیم میکند و تنها بخش کوچکی از آنها را برای هر درخواست فعال میسازد. این امر هزینههای محاسباتی inference را به شدت کاهش میدهد.
پیکربندیهای LLaMA 1
| مدل | پارامترها | ابعاد حالت پنهان | تعداد لایهها | تعداد سرهای attention | حجم دادههای آموزشی |
|---|---|---|---|---|---|
| 7B | 6.7B | 4096 | 32 | 32 | 1.0T token |
| 13B | 13.0B | 5120 | 40 | 40 | 1.0T token |
| 33B | 32.5B | 6656 | 60 | 52 | 1.4T token |
| 65B | 65.2B | 8192 | 80 | 64 | 1.4T token |
دادههای آموزشی
حجم مجموعه دادههای آموزشی از ۱٫۴ تریلیون token برای LLaMA 1 تا ۱۵ تریلیون برای LLaMA 3 رشد کرده است. برای آموزش از منابع عمومی استفاده میشود، از جمله Common Crawl (تا ۶۷٪ دادهها)، C4، GitHub، Wikipedia، Books، ArXiv و Stack Exchange. برای LLaMA 3 همچنین از دادههای خصوصی با کیفیت بالا استفاده شده است.
عملکرد و مقایسه
- در benchmarkها: مدل LLaMA 3.1 (405B) نتایجی نزدیک به GPT-4o نشان میدهد: در آزمون MMLU به ۸۸٫۶٪ میرسد و تنها ۰٫۱ واحد درصدی از GPT-4o عقبتر است. در وظیفه تولید کد HumanEval، LLaMA 3.1 به ۸۹٪ میرسد (GPT-4o — ۹۰٫۲٪).
- کارایی پارامتری: مدلهای LLaMA با تعداد پارامتر کمتر اغلب از مدلهای بزرگتر رقبا پیشی میگیرند. برای مثال، LLaMA 1 (13B) در اکثر آزمونها از GPT-3 (175B) پیشی گرفت.
- هزینه: در هاستینگ محلی، هزینه inference مدل LLaMA میتواند تا ۵۰ برابر کمتر از استفاده از APIهای اختصاصی باشد که این فناوری را برای کسبوکارهای کوچک و متوسط در دسترس قرار میدهد.
مجوزدهی
- LLaMA 1 با مجوز پژوهشی غیرتجاری و دسترسی از طریق درخواست توزیع شد.
- LLaMA 2 و نسخههای بعدی تحت مجوز Llama Community License توزیع میشوند که استفاده تجاری و اصلاح را مجاز میشمارد. با این حال، مجوز حاوی محدودیتهایی است: شرکتهایی با بیش از ۷۰۰ میلیون کاربر فعال ماهانه باید مجوز ویژهای از Meta دریافت کنند. این موضوع بحثهایی را درباره اینکه آیا LLaMA واقعاً یک مدل کاملاً باز است یا خیر برانگیخته است.
کاربردها
مدلهای LLaMA در محصولات هزاران شرکت یکپارچه شدهاند و در حوزههای مختلفی مورد استفاده قرار میگیرند:
- بخش شرکتی: Zoom از LLaMA در AI Companion برای خلاصهسازی جلسات استفاده میکند؛ Shopify برای پردازش ۴۰ تا ۶۰ میلیون درخواست در روز جهت غنیسازی متادیتای محصولات؛ Instacart در دستیار داخلی Ava.
- علم و جامعه: Meditron (اقتباسی از LLaMA) برای تشخیص پزشکی در مناطق با منابع محدود استفاده میشود.
- بخش دولتی و صنعت: Meta با Lockheed Martin و Palantir مشارکت برقرار کرده است. NASA از LLaMA 3 در ایستگاه فضایی بینالمللی به عنوان دستیار آفلاین برای انجام عملیات حساس بدون ارتباط با زمین استفاده میکند.
محدودیتها و انتقادات
- سوگیری و ایمنی: ممیزیهای مستقل نشان میدهند که مدلهای LLaMA، علیرغم اقدامات ایمنی، ممکن است کلیشههای مضر را بازتولید کنند. درز وزنهای LLaMA 1 سؤالات مربوط به سوءاستفاده احتمالی از فناوری را تشدید کرد.
- شکافهای دانشی: در حوزههای بسیار تخصصی، LLaMA ممکن است شکافهایی نشان دهد. برای مثال، دقت در آزمون پزشکی nephSAP بین ۱۷ تا ۳۰ درصد در برابر ۷۳ درصد برای GPT-4 بود.
- مصرف انرژی: آموزش مدلهای بزرگ به منابع عظیمی نیاز دارد. آموزش LLaMA 1 به ۲٬۶۳۸ مگاوات ساعت انرژی نیاز داشت که معادل انتشار ۱٬۰۱۵ تن CO₂ است.
آینده
Meta برنامه دارد تا ۶۵ میلیارد دلار تا سال ۲۰۲۵ در زیرساخت هوش مصنوعی سرمایهگذاری کند. مدل LLaMA 4 Behemoth با ۲ تریلیون پارامتر در حال توسعه است که از بیش از ۲۰۰ زبان پشتیبانی خواهد کرد و یکپارچهسازی عمیقی با محصولات متاورس خواهد داشت.
همچنین ببینید
- GPT
- مدلهای زبانی بزرگ
- transformer (معماری شبکه عصبی)
منابع
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
- Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
- Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
- Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
- Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.
یادداشتها
- ↑ Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
- ↑ LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.