LLaMA (Meta AI) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

LLaMA (Large Language Model Meta AI) — خانواده‌ای از مدل‌های زبانی بزرگ (LLM) با کد منبع عمدتاً باز، که توسط بخش تحقیقاتی Meta AI توسعه می‌یابد. مدل‌های LLaMA بر پایه معماری اصلاح‌شده transformer ساخته شده‌اند و بر کارایی بالای محاسباتی، دموکراتیزه‌کردن دسترسی به فناوری‌های پیشرفته هوش مصنوعی و سازگاری آسان با وظایف تخصصی تمرکز دارند. این خانواده از انتشار اولیه پژوهشی LLaMA 1 (فوریه ۲۰۲۳) تا مدل‌های چندوجهی LLaMA 4 (انتشار برنامه‌ریزی‌شده در ۲۰۲۶) تکامل یافته است.

نام‌گذاری

مخفف LLaMA به صورت Large Language Model Meta AI (مدل زبانی بزرگ Meta AI) بسط می‌یابد.

  • Large Language Model — بر مقیاس مدل‌ها تأکید دارد که پارامترهای آن‌ها از میلیاردها تا تریلیون‌ها اندازه‌گیری می‌شود.
  • Meta AI — به توسعه‌دهنده، یعنی گروه تحقیقاتی Meta، اشاره دارد.

تاریخچه

توسعه LLaMA در اواخر ۲۰۲۲ به عنوان پاسخ استراتژیک Meta به موفقیت ChatGPT از OpenAI آغاز شد. مارک زاکربرگ تیمی میان‌رشته‌ای متشکل از محققان آزمایشگاه FAIR (Facebook AI Research) تشکیل داد. یان لکون، رئیس FAIR، که از سال ۲۰۱۳ به اصل باز بودن کامل تمام پژوهش‌های آزمایشگاه پایبند بود، نقش کلیدی در فلسفه این پروژه ایفا کرد.

نسخه اول، LLaMA 1، در فوریه ۲۰۲۳ با مجوز پژوهشی منتشر شد. اندکی پس از انتشار، در مارس ۲۰۲۳، وزن‌های مدل از طریق BitTorrent به فضای اینترنت درز کرد. این رویداد، برخلاف نگرانی‌های اولیه، توسعه پروژه را متوقف نکرد بلکه به آن شتاب بخشید، چرا که به محققان مستقل و علاقه‌مندان در سرتاسر جهان امکان داد با مدل آزمایش کنند. در نتیجه، ده‌ها هزار مدل مشتق بر روی پلتفرم Hugging Face پدیدار شدند. نسخه‌های بعدی، از جمله LLaMA 2، با مجوز تجاری منتشر شدند[1] و جایگاه LLaMA را به عنوان یک بازیگر کلیدی در بازار مدل‌های هوش مصنوعی باز تثبیت کردند.

تکامل مدل‌ها و جدول زمانی انتشار

جدول زمانی توسعه مدل‌های LLaMA
نسخه تاریخ انتشار بازه پارامترها نوآوری‌ها و ویژگی‌های کلیدی
LLaMA 1 فوریه ۲۰۲۳ 7B – 65B معماری پایه (RMSNorm، SwiGLU، RoPE). آموزش روی ۱٫۴ تریلیون token. پنجره context به اندازه ۲۰۴۸ token. مجوز پژوهشی.
LLaMA 2 جولای ۲۰۲۳ 7B – 70B fine-tuning برای مکالمه (RLHF). پیاده‌سازی Grouped-Query Attention (GQA). پنجره context به اندازه ۴۰۹۶ token. اولین مجوز تجاری.
Code Llama اوت ۲۰۲۳ 7B – 70B نسخه تخصصی برای کد. fine-tuning روی ۵۰۰ میلیارد token کد. انواع: پایه، تخصصی Python، instruction-tuned.
LLaMA 3 آوریل ۲۰۲۴ 8B، 70B آموزش روی ۱۵ تریلیون token. tokenizer بهبودیافته با واژگان ۱۲۸ هزار token. عملکرد بالا (۸۲٪ در MMLU).
LLaMA 3.1 جولای ۲۰۲۴[2] 8B، 70B، 405B مدل پرچم‌دار 405B با عملکردی در سطح GPT-4o. پنجره context تا ۱۲۸ هزار token. قابلیت پردازش تصویر اضافه شد.
LLaMA 4 (برنامه: آوریل ۲۰۲۵) 109B (Scout)، 400B (Maverick)، 2T (Behemoth) معماری Mixture-of-Experts (MoE). چندوجهی بودن بومی (متن، تصویر، ویدئو). پنجره context تا ۱۰ میلیون token.

معماری

LLaMA از معماری transformer اتورگرسیو decoder-only استفاده می‌کند، اما مجموعه‌ای از بهبودهای کلیدی را معرفی می‌کند که کارایی محاسباتی و کیفیت متن تولیدشده را افزایش می‌دهند:

  • Pre-normalization (نرمال‌سازی پیشین). نرمال‌سازی در ورودی هر زیرلایه transformer اعمال می‌شود، نه در خروجی آن. این رویکرد آموزش شبکه‌های بسیار عمیق را تثبیت کرده و از مشکلات گرادیان جلوگیری می‌کند.
  • RMSNorm (Root Mean Square Layer Normalization). به جای LayerNorm استاندارد از RMSNorm استفاده می‌شود. این تکنیک نرمال‌سازی عملیات کم‌کردن میانگین را حذف می‌کند و محاسبات را ۱۰ تا ۵۰ درصد با حفظ پایداری تسریع می‌بخشد.
  • SwiGLU (Swish-Gated Linear Unit). به جای ReLU یا GELU از SwiGLU به عنوان تابع فعال‌سازی استفاده می‌شود. این مکانیزم gating جریان گرادیان روان‌تری ایجاد کرده و کیفیت مدل را بهبود می‌بخشد.
  • RoPE (Rotary Position Embeddings، embedding موقعیت دورانی). برای رمزگذاری موقعیت token‌ها از embedding موقعیت نسبی RoPE استفاده می‌شود که به مدل امکان می‌دهد بر روی دنباله‌هایی با طول بیشتر از آنچه در آموزش استفاده شده، بهتر برون‌یابی کند.
  • GQA (Grouped-Query Attention). این تکنیک که در LLaMA 2 معرفی شد، یک بهینه‌سازی attention چندسری است که نیازهای حافظه را به طور قابل توجهی کاهش داده و تولید متن را تسریع می‌کند.
  • Mixture-of-Experts (MoE) (برنامه‌ریزی‌شده برای LLaMA 4). معماری‌ای که پارامترهای مدل را به زیرشبکه‌های «متخصص» تقسیم می‌کند و تنها بخش کوچکی از آن‌ها را برای هر درخواست فعال می‌سازد. این امر هزینه‌های محاسباتی inference را به شدت کاهش می‌دهد.

پیکربندی‌های LLaMA 1

پارامترهای معماری مدل‌های LLaMA 1
مدل پارامترها ابعاد حالت پنهان تعداد لایه‌ها تعداد سرهای attention حجم داده‌های آموزشی
7B 6.7B 4096 32 32 1.0T token
13B 13.0B 5120 40 40 1.0T token
33B 32.5B 6656 60 52 1.4T token
65B 65.2B 8192 80 64 1.4T token

داده‌های آموزشی

حجم مجموعه داده‌های آموزشی از ۱٫۴ تریلیون token برای LLaMA 1 تا ۱۵ تریلیون برای LLaMA 3 رشد کرده است. برای آموزش از منابع عمومی استفاده می‌شود، از جمله Common Crawl (تا ۶۷٪ داده‌ها)، C4، GitHub، Wikipedia، Books، ArXiv و Stack Exchange. برای LLaMA 3 همچنین از داده‌های خصوصی با کیفیت بالا استفاده شده است.

عملکرد و مقایسه

  • در benchmark‌ها: مدل LLaMA 3.1 (405B) نتایجی نزدیک به GPT-4o نشان می‌دهد: در آزمون MMLU به ۸۸٫۶٪ می‌رسد و تنها ۰٫۱ واحد درصدی از GPT-4o عقب‌تر است. در وظیفه تولید کد HumanEval، LLaMA 3.1 به ۸۹٪ می‌رسد (GPT-4o — ۹۰٫۲٪).
  • کارایی پارامتری: مدل‌های LLaMA با تعداد پارامتر کمتر اغلب از مدل‌های بزرگ‌تر رقبا پیشی می‌گیرند. برای مثال، LLaMA 1 (13B) در اکثر آزمون‌ها از GPT-3 (175B) پیشی گرفت.
  • هزینه: در هاستینگ محلی، هزینه inference مدل LLaMA می‌تواند تا ۵۰ برابر کمتر از استفاده از API‌های اختصاصی باشد که این فناوری را برای کسب‌وکارهای کوچک و متوسط در دسترس قرار می‌دهد.

مجوزدهی

  • LLaMA 1 با مجوز پژوهشی غیرتجاری و دسترسی از طریق درخواست توزیع شد.
  • LLaMA 2 و نسخه‌های بعدی تحت مجوز Llama Community License توزیع می‌شوند که استفاده تجاری و اصلاح را مجاز می‌شمارد. با این حال، مجوز حاوی محدودیت‌هایی است: شرکت‌هایی با بیش از ۷۰۰ میلیون کاربر فعال ماهانه باید مجوز ویژه‌ای از Meta دریافت کنند. این موضوع بحث‌هایی را درباره اینکه آیا LLaMA واقعاً یک مدل کاملاً باز است یا خیر برانگیخته است.

کاربردها

مدل‌های LLaMA در محصولات هزاران شرکت یکپارچه شده‌اند و در حوزه‌های مختلفی مورد استفاده قرار می‌گیرند:

  • بخش شرکتی: Zoom از LLaMA در AI Companion برای خلاصه‌سازی جلسات استفاده می‌کند؛ Shopify برای پردازش ۴۰ تا ۶۰ میلیون درخواست در روز جهت غنی‌سازی متادیتای محصولات؛ Instacart در دستیار داخلی Ava.
  • علم و جامعه: Meditron (اقتباسی از LLaMA) برای تشخیص پزشکی در مناطق با منابع محدود استفاده می‌شود.
  • بخش دولتی و صنعت: Meta با Lockheed Martin و Palantir مشارکت برقرار کرده است. NASA از LLaMA 3 در ایستگاه فضایی بین‌المللی به عنوان دستیار آفلاین برای انجام عملیات حساس بدون ارتباط با زمین استفاده می‌کند.

محدودیت‌ها و انتقادات

  • سوگیری و ایمنی: ممیزی‌های مستقل نشان می‌دهند که مدل‌های LLaMA، علی‌رغم اقدامات ایمنی، ممکن است کلیشه‌های مضر را بازتولید کنند. درز وزن‌های LLaMA 1 سؤالات مربوط به سوءاستفاده احتمالی از فناوری را تشدید کرد.
  • شکاف‌های دانشی: در حوزه‌های بسیار تخصصی، LLaMA ممکن است شکاف‌هایی نشان دهد. برای مثال، دقت در آزمون پزشکی nephSAP بین ۱۷ تا ۳۰ درصد در برابر ۷۳ درصد برای GPT-4 بود.
  • مصرف انرژی: آموزش مدل‌های بزرگ به منابع عظیمی نیاز دارد. آموزش LLaMA 1 به ۲٬۶۳۸ مگاوات ساعت انرژی نیاز داشت که معادل انتشار ۱٬۰۱۵ تن CO₂ است.

آینده

Meta برنامه دارد تا ۶۵ میلیارد دلار تا سال ۲۰۲۵ در زیرساخت هوش مصنوعی سرمایه‌گذاری کند. مدل LLaMA 4 Behemoth با ۲ تریلیون پارامتر در حال توسعه است که از بیش از ۲۰۰ زبان پشتیبانی خواهد کرد و یکپارچه‌سازی عمیقی با محصولات متاورس خواهد داشت.

همچنین ببینید

  • GPT
  • مدل‌های زبانی بزرگ
  • transformer (معماری شبکه عصبی)

منابع

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
  • Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
  • Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
  • Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
  • Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
  • Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.

یادداشت‌ها

  1. Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
  2. LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.