Chinchilla (language model) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

Chinchilla — یک مدل زبانی بزرگ (LLM) است که توسط گروه پژوهشی DeepMind توسعه یافته و در مارس ۲۰۲۲ معرفی شد[1]. این مدل حاوی حدود ۷۰ میلیارد پارامتر است و بر روی مجموعه‌ای از متون به حجم ۱٫۴ تریلیون token آموزش دیده است.

ویژگی کلیدی Chinchilla رویکرد بهینه از نظر محاسباتی در آموزش آن است. برخلاف مدل‌های پیشین که تمرکز اصلی بر افزایش تعداد پارامترها بود، Chinchilla بر اساس فرضیه‌ای درباره ضرورت مقیاس‌بندی متناسب هم اندازه مدل و هم حجم داده‌های آموزشی ساخته شد. به لطف این رویکرد، Chinchilla برتری خود را نسبت به مدل‌های به‌مراتب بزرگ‌تری همچون Gopher (۲۸۰ میلیارد پارامتر) و GPT-3 (۱۷۵ میلیارد) در طیف گسترده‌ای از وظایف زبانی به اثبات رساند[2].

پیشینه و تاریخچه توسعه

توسعه Chinchilla نتیجه پژوهشی درباره مقیاس‌بندی LLM بود که در DeepMind و بر اساس خانواده مدل‌های Gopher انجام شد[3]. مدل Gopher که در سال ۲۰۲۱ معرفی شد، دارای ۲۸۰ میلیارد پارامتر بود، اما بر روی مجموعه داده نسبتاً کوچکی به حجم ۳۰۰ میلیارد token آموزش دیده بود. در آن دوره، رویکردی در صنعت غالب بود که بر اساس آن عملکرد مدل‌ها عمدتاً از طریق افزایش اندازه آن‌ها (تعداد پارامترها) بهبود می‌یافت، در حالی که حجم داده‌ها نسبتاً ثابت می‌ماند.

فرضیه آموزش بهینه از نظر محاسباتی

پژوهشگران DeepMind فرضیه‌ای مطرح کردند که بر اساس آن بسیاری از مدل‌های بزرگ، از جمله Gopher، نسبت به اندازه خود کم‌آموزش‌دیده (undertrained) بودند. این مدل‌ها به دلیل کمبود داده‌های آموزشی، به حداکثر کیفیت ممکن در ازای بودجه محاسباتی مشخص دست نمی‌یافتند[2].

جوهر این فرضیه آن بود که برای استفاده بهینه از منابع محاسباتی، اندازه مدل و حجم داده‌های آموزشی باید به‌صورت متناسب با یکدیگر افزایش یابند. به بیان دیگر، با دو برابر کردن تعداد پارامترهای مدل، باید تعداد token‌های آموزشی نیز تقریباً دو برابر شود[1]. این نتیجه‌گیری با پژوهش‌های پیشین که ارزش افزایش اندازه مدل را بیش از حد برآورد می‌کردند در تضاد بود، چراکه آن پژوهش‌ها با حجم ثابتی از داده انجام شده بودند.

برای آزمون این فرضیه، تیم DeepMind آزمایش‌های گسترده‌ای انجام داد و بیش از ۴۰۰ مدل با اندازه‌های مختلف را بر روی مجموعه داده‌هایی از ۵ تا ۵۰۰ میلیارد token آموزش داد. نتایج تأیید کرد که مقیاس‌بندی موازی استراتژی بهینه است. بر اساس این یافته‌ها، مدل Chinchilla به‌عنوان آزمون عملی پارادایم جدید توسعه یافت[4].

معماری و آموزش

ویژگی‌های معماری

Chinchilla به خانواده transformer‌های خودبازگشتی تعلق دارد و از نظر معماری به مدل‌های GPT-2/GPT-3 نزدیک است[3]. این مدل بسیاری از رویکردهای Gopher را به ارث برده، اما با تفاوت‌های کلیدی در جهت کاهش اندازه و در عین حال حفظ عمق شبکه:

  • پارامترها: حدود ۷۰ میلیارد پارامتر توزیع‌شده در ۸۰ لایه.
  • عرض مدل: تعداد head‌های self-attention به ۶۴ کاهش یافته (در برابر ۱۲۸ در Gopher)، و ابعاد داخلی لایه‌ها به ۸۱۹۲ کاهش یافته (در برابر ~۱۶۳۸۴ در Gopher).
  • بهینه‌ساز: از AdamW به جای Adam استفاده می‌شود که سبب بهبود همگرایی بر روی مجموعه داده‌های بزرگ می‌شود[3].

این معماری به Chinchilla اجازه داد تا همان عمق شبکه Gopher را حفظ کند، اما با تعداد پارامترهای به‌مراتب کمتر، که این امر نیاز به حافظه و منابع محاسباتی را کاهش داد.

مقیاس‌بندی و داده‌های آموزشی

برای آزمون فرضیه، Chinchilla با همان بودجه محاسباتی Gopher آموزش دیده، اما با توزیع مجدد منابع به نفع داده. مدل با ۷۰ میلیارد پارامتر بر روی مجموعه‌ای به حجم ۱٫۴ تریلیون token آموزش دید، که تقریباً ۴ برابر حجم داده‌های استفاده‌شده برای Gopher است[1].

این نسبت، یعنی تقریباً ۲۰ token به ازای هر پارامتر، به‌عنوان نقطه Chinchilla (Chinchilla Point) شناخته شد و معیاری برای آموزش بهینه از نظر محاسباتی در LLM‌های مدرن به شمار می‌رود[5]. این آزمایش تأیید کرد که Chinchilla، با آموزش نزدیک‌تر به این حد بهینه، توانست پتانسیل خود را به‌مراتب کامل‌تر از مدل‌های کم‌آموزش‌دیده‌ای که هرچند بزرگ‌تر بودند، محقق سازد.

نتایج و عملکرد

در مجموعه گسترده‌ای از آزمون‌های استاندارد، Chinchilla برتری قابل‌توجهی نسبت به مدل‌های پیشین نشان داد. این مدل نه‌تنها Gopher، بلکه سایر LLM‌های پیشرفته آن زمان از جمله OpenAI GPT-3 (۱۷۵ میلیارد پارامتر) و Megatron-Turing NLG (۵۳۰ میلیارد پارامتر) را نیز پشت سر گذاشت[1].

بارزترین نتیجه در benchmark جامع MMLU (Measuring Massive Multitask Language Understanding) به دست آمد که دانش و استدلال در صدها وظیفه متنوع را ارزیابی می‌کند. Chinchilla به دقت متوسط ۶۷٫۵٪ دست یافت که رکورد جدیدی برای مدل‌های این رده بود و ۷ درصد امتیاز بیشتر از Gopher بود[4].

علاوه بر کارایی بالا، Chinchilla صرفه‌جویی در استفاده را نیز نشان داد. اندازه کوچک‌تر مدل (۷۰ میلیارد در برابر ۱۷۵+ میلیارد در مدل‌های مشابه) به این معناست که برای استنتاج (inference) و fine-tuning منابع محاسباتی به‌مراتب کمتری نیاز است، که کاربرد عملی آن را ساده‌تر می‌کند.

اهمیت و تأثیر

پژوهش Chinchilla تأثیری بنیادی بر رویکردهای آموزش مدل‌های زبانی بزرگ گذاشت.

  • قوانین مقیاس‌بندی Chinchilla (Chinchilla scaling laws): نسبت بهینه کشف‌شده بین اندازه مدل و حجم داده‌ها به استاندارد و معیار de facto برای توسعه‌های بعدی در صنعت تبدیل شد.
  • تغییر تمرکز از اندازه به داده: این پژوهش صنعت را ترغیب کرد تا توجه بیشتری به ساخت، پالایش و گسترش مجموعه داده‌های آموزشی معطوف کند، نه صرفاً به افزایش بی‌رویه تعداد پارامترها.
  • کاربرد در سیستم‌های چندوجهی: Chinchilla به‌عنوان مؤلفه زبانی اصلی در مدل چندوجهی Flamingo ساخته DeepMind استفاده شد، مدلی که قادر به درک تصاویر و متن است[6].

هرچند خود مدل Chinchilla در دسترس عموم قرار نگرفت، مفاهیم و نتایج منتشرشده در مقاله علمی آن، مسیر توسعه کل حوزه LLM را تغییر داد و راهی به سوی رشد توانمندی‌های هوش مصنوعی به‌گونه‌ای کارآمدتر و متعادل‌تر نشان داد.

منابع

  • Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
  • Loshchilov, I.; Hutter, F. (2017). Decoupled Weight Decay Regularization. arXiv:1711.05101.
  • Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
  • Kaplan, J.; et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Brown, T. B.; et al. (2020). Language Models are Few‑Shot Learners. arXiv:2005.14165.
  • Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Rae, J.; et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Hoffmann, J.; et al. (2022). Training Compute‑Optimal Large Language Models. arXiv:2203.15556.
  • Alayrac, J.‑B.; et al. (2022). Flamingo: A Visual Language Model for Few‑Shot Learning. arXiv:2204.14198.
  • Hendrycks, D.; et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.

یادداشت‌ها

  1. 1.0 1.1 1.2 1.3 Hoffmann, J. et al. (2022). «Training Compute-Optimal Large Language Models». NeurIPS 2022. [۱]
  2. 2.0 2.1 Wali, K. (2022). «DeepMind launches GPT-3 rival, Chinchilla». Analytics India Magazine. [۲]
  3. 3.0 3.1 3.2 Rae, J. et al. (2022). «Scaling Language Models: Methods, Analysis & Insights from Training Gopher». arXiv:2112.11446.
  4. 4.0 4.1 «Training Compute-Optimal Large Language Models». proceedings.neurips.cc.
  5. «What is the Chinchilla Point ("Chinchilla Optimal")?». Legal Genie.
  6. «Chinchilla (language model)». Wikipedia.