Chinchilla (language model) (FA)
Chinchilla — یک مدل زبانی بزرگ (LLM) است که توسط گروه پژوهشی DeepMind توسعه یافته و در مارس ۲۰۲۲ معرفی شد[1]. این مدل حاوی حدود ۷۰ میلیارد پارامتر است و بر روی مجموعهای از متون به حجم ۱٫۴ تریلیون token آموزش دیده است.
ویژگی کلیدی Chinchilla رویکرد بهینه از نظر محاسباتی در آموزش آن است. برخلاف مدلهای پیشین که تمرکز اصلی بر افزایش تعداد پارامترها بود، Chinchilla بر اساس فرضیهای درباره ضرورت مقیاسبندی متناسب هم اندازه مدل و هم حجم دادههای آموزشی ساخته شد. به لطف این رویکرد، Chinchilla برتری خود را نسبت به مدلهای بهمراتب بزرگتری همچون Gopher (۲۸۰ میلیارد پارامتر) و GPT-3 (۱۷۵ میلیارد) در طیف گستردهای از وظایف زبانی به اثبات رساند[2].
پیشینه و تاریخچه توسعه
توسعه Chinchilla نتیجه پژوهشی درباره مقیاسبندی LLM بود که در DeepMind و بر اساس خانواده مدلهای Gopher انجام شد[3]. مدل Gopher که در سال ۲۰۲۱ معرفی شد، دارای ۲۸۰ میلیارد پارامتر بود، اما بر روی مجموعه داده نسبتاً کوچکی به حجم ۳۰۰ میلیارد token آموزش دیده بود. در آن دوره، رویکردی در صنعت غالب بود که بر اساس آن عملکرد مدلها عمدتاً از طریق افزایش اندازه آنها (تعداد پارامترها) بهبود مییافت، در حالی که حجم دادهها نسبتاً ثابت میماند.
فرضیه آموزش بهینه از نظر محاسباتی
پژوهشگران DeepMind فرضیهای مطرح کردند که بر اساس آن بسیاری از مدلهای بزرگ، از جمله Gopher، نسبت به اندازه خود کمآموزشدیده (undertrained) بودند. این مدلها به دلیل کمبود دادههای آموزشی، به حداکثر کیفیت ممکن در ازای بودجه محاسباتی مشخص دست نمییافتند[2].
جوهر این فرضیه آن بود که برای استفاده بهینه از منابع محاسباتی، اندازه مدل و حجم دادههای آموزشی باید بهصورت متناسب با یکدیگر افزایش یابند. به بیان دیگر، با دو برابر کردن تعداد پارامترهای مدل، باید تعداد tokenهای آموزشی نیز تقریباً دو برابر شود[1]. این نتیجهگیری با پژوهشهای پیشین که ارزش افزایش اندازه مدل را بیش از حد برآورد میکردند در تضاد بود، چراکه آن پژوهشها با حجم ثابتی از داده انجام شده بودند.
برای آزمون این فرضیه، تیم DeepMind آزمایشهای گستردهای انجام داد و بیش از ۴۰۰ مدل با اندازههای مختلف را بر روی مجموعه دادههایی از ۵ تا ۵۰۰ میلیارد token آموزش داد. نتایج تأیید کرد که مقیاسبندی موازی استراتژی بهینه است. بر اساس این یافتهها، مدل Chinchilla بهعنوان آزمون عملی پارادایم جدید توسعه یافت[4].
معماری و آموزش
ویژگیهای معماری
Chinchilla به خانواده transformerهای خودبازگشتی تعلق دارد و از نظر معماری به مدلهای GPT-2/GPT-3 نزدیک است[3]. این مدل بسیاری از رویکردهای Gopher را به ارث برده، اما با تفاوتهای کلیدی در جهت کاهش اندازه و در عین حال حفظ عمق شبکه:
- پارامترها: حدود ۷۰ میلیارد پارامتر توزیعشده در ۸۰ لایه.
- عرض مدل: تعداد headهای self-attention به ۶۴ کاهش یافته (در برابر ۱۲۸ در Gopher)، و ابعاد داخلی لایهها به ۸۱۹۲ کاهش یافته (در برابر ~۱۶۳۸۴ در Gopher).
- بهینهساز: از AdamW به جای Adam استفاده میشود که سبب بهبود همگرایی بر روی مجموعه دادههای بزرگ میشود[3].
این معماری به Chinchilla اجازه داد تا همان عمق شبکه Gopher را حفظ کند، اما با تعداد پارامترهای بهمراتب کمتر، که این امر نیاز به حافظه و منابع محاسباتی را کاهش داد.
مقیاسبندی و دادههای آموزشی
برای آزمون فرضیه، Chinchilla با همان بودجه محاسباتی Gopher آموزش دیده، اما با توزیع مجدد منابع به نفع داده. مدل با ۷۰ میلیارد پارامتر بر روی مجموعهای به حجم ۱٫۴ تریلیون token آموزش دید، که تقریباً ۴ برابر حجم دادههای استفادهشده برای Gopher است[1].
این نسبت، یعنی تقریباً ۲۰ token به ازای هر پارامتر، بهعنوان نقطه Chinchilla (Chinchilla Point) شناخته شد و معیاری برای آموزش بهینه از نظر محاسباتی در LLMهای مدرن به شمار میرود[5]. این آزمایش تأیید کرد که Chinchilla، با آموزش نزدیکتر به این حد بهینه، توانست پتانسیل خود را بهمراتب کاملتر از مدلهای کمآموزشدیدهای که هرچند بزرگتر بودند، محقق سازد.
نتایج و عملکرد
در مجموعه گستردهای از آزمونهای استاندارد، Chinchilla برتری قابلتوجهی نسبت به مدلهای پیشین نشان داد. این مدل نهتنها Gopher، بلکه سایر LLMهای پیشرفته آن زمان از جمله OpenAI GPT-3 (۱۷۵ میلیارد پارامتر) و Megatron-Turing NLG (۵۳۰ میلیارد پارامتر) را نیز پشت سر گذاشت[1].
بارزترین نتیجه در benchmark جامع MMLU (Measuring Massive Multitask Language Understanding) به دست آمد که دانش و استدلال در صدها وظیفه متنوع را ارزیابی میکند. Chinchilla به دقت متوسط ۶۷٫۵٪ دست یافت که رکورد جدیدی برای مدلهای این رده بود و ۷ درصد امتیاز بیشتر از Gopher بود[4].
علاوه بر کارایی بالا، Chinchilla صرفهجویی در استفاده را نیز نشان داد. اندازه کوچکتر مدل (۷۰ میلیارد در برابر ۱۷۵+ میلیارد در مدلهای مشابه) به این معناست که برای استنتاج (inference) و fine-tuning منابع محاسباتی بهمراتب کمتری نیاز است، که کاربرد عملی آن را سادهتر میکند.
اهمیت و تأثیر
پژوهش Chinchilla تأثیری بنیادی بر رویکردهای آموزش مدلهای زبانی بزرگ گذاشت.
- قوانین مقیاسبندی Chinchilla (Chinchilla scaling laws): نسبت بهینه کشفشده بین اندازه مدل و حجم دادهها به استاندارد و معیار de facto برای توسعههای بعدی در صنعت تبدیل شد.
- تغییر تمرکز از اندازه به داده: این پژوهش صنعت را ترغیب کرد تا توجه بیشتری به ساخت، پالایش و گسترش مجموعه دادههای آموزشی معطوف کند، نه صرفاً به افزایش بیرویه تعداد پارامترها.
- کاربرد در سیستمهای چندوجهی: Chinchilla بهعنوان مؤلفه زبانی اصلی در مدل چندوجهی Flamingo ساخته DeepMind استفاده شد، مدلی که قادر به درک تصاویر و متن است[6].
هرچند خود مدل Chinchilla در دسترس عموم قرار نگرفت، مفاهیم و نتایج منتشرشده در مقاله علمی آن، مسیر توسعه کل حوزه LLM را تغییر داد و راهی به سوی رشد توانمندیهای هوش مصنوعی بهگونهای کارآمدتر و متعادلتر نشان داد.
منابع
- Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
- Loshchilov, I.; Hutter, F. (2017). Decoupled Weight Decay Regularization. arXiv:1711.05101.
- Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
- Kaplan, J.; et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Brown, T. B.; et al. (2020). Language Models are Few‑Shot Learners. arXiv:2005.14165.
- Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Rae, J.; et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
- Hoffmann, J.; et al. (2022). Training Compute‑Optimal Large Language Models. arXiv:2203.15556.
- Alayrac, J.‑B.; et al. (2022). Flamingo: A Visual Language Model for Few‑Shot Learning. arXiv:2204.14198.
- Hendrycks, D.; et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
یادداشتها
- ↑ 1.0 1.1 1.2 1.3 Hoffmann, J. et al. (2022). «Training Compute-Optimal Large Language Models». NeurIPS 2022. [۱]
- ↑ 2.0 2.1 Wali, K. (2022). «DeepMind launches GPT-3 rival, Chinchilla». Analytics India Magazine. [۲]
- ↑ 3.0 3.1 3.2 Rae, J. et al. (2022). «Scaling Language Models: Methods, Analysis & Insights from Training Gopher». arXiv:2112.11446.
- ↑ 4.0 4.1 «Training Compute-Optimal Large Language Models». proceedings.neurips.cc.
- ↑ «What is the Chinchilla Point ("Chinchilla Optimal")?». Legal Genie.
- ↑ «Chinchilla (language model)». Wikipedia.