Pre-training of large language models — پیش‌آموزش

From Systems analysis Wiki
Jump to navigation Jump to search

پیش‌آموزش مدل‌های زبانی بزرگ (LLM) — مرحله‌ای بنیادین در ساخت مدل‌های زبانی بزرگ مدرن است که طی آن این مدل‌ها بر روی مجموعه‌های عظیم و متنوعی از متن‌های بدون برچسب آموزش می‌بینند. این فرآیند به مدل‌ها امکان می‌دهد تا الگوهای کلی زبانی، دانش جهانی و روابط معناشناختی را فرا گیرند و به اصطلاح مدل پایه (foundation model) شکل گیرد که سپس می‌توان آن را برای حل وظایف خاص تطبیق داد.

پیش‌آموزش چیست؟

پیش‌آموزش (pre-training) مرحله‌ی آغازین آموزش است که در آن LLM با استفاده از روش‌های یادگیری خودنظارتی (self-supervised learning) بر روی مجموعه داده‌های متنی گسترده آموزش می‌بیند. این بدان معناست که سیگنال‌های آموزشی (برچسب‌ها) از خود داده‌ها تولید می‌شوند و نیازی به برچسب‌گذاری دستی توسط انسان نیست.

هدف اصلی این مرحله پیش‌بینی بخش‌های پنهان یا آینده‌ی متن است. بسته به معماری، دو وظیفه اصلی مورد استفاده قرار می‌گیرند:

  • مدل‌سازی زبانی علّی (Causal Language Modeling, CLM): مدل می‌آموزد که کلمه (token) بعدی در دنباله را بر اساس تمام کلمات پیشین پیش‌بینی کند. این رویکرد پایه‌ی مدل‌های مولد مانند GPT است.
  • مدل‌سازی زبانی ماسک‌شده (Masked Language Modeling, MLM): مدل می‌آموزد کلمات «ماسک‌شده» (پنهان) را در متن بازیابی کند و از بافت دوطرفه‌ی پیرامون آن‌ها (کلمات چپ و راست) بهره می‌برد. این روش در مدل‌هایی مانند BERT به کار می‌رود.

به لطف این وظایف، مدل ناگزیر است نحو، معناشناسی و دانش واقعی از جهان را بیاموزد تا بتواند پیش‌بینی‌های موفقیت‌آمیز داشته باشد.

داده‌های پیش‌آموزش

اثربخشی پیش‌آموزش تا حد زیادی به کیفیت و تنوع داده‌های آموزشی بستگی دارد. منابع اصلی زیر مورد استفاده قرار می‌گیرند:

  • صفحات وب: مجموعه داده‌هایی مانند Common Crawl و C4 طیف گسترده‌ای از موضوعات، سبک‌ها و زبان‌ها را پوشش می‌دهند و «تصویری از اینترنت» ارائه می‌دهند.
  • کتاب‌ها: مجموعه‌هایی مانند BookCorpus و The Pile متن ساختارمند و منسجمی فراهم می‌کنند که برای درک وابستگی‌های بلندمدت و روایت‌ها مفیدند.
  • داده‌های مکالمه‌ای: داده‌های انجمن‌هایی مانند Reddit و شبکه‌های اجتماعی که به مدل‌ها کمک می‌کنند زبان غیررسمی و الگوهای گفتگو را فرا گیرند.
  • داده‌های تخصصی: مقالات علمی (از arXiv)، کد برنامه‌نویسی (از GitHub و The Stack) یا متون چندزبانه برای بهبود قابلیت‌های خاص مدل.

نمونه‌های توزیع داده

مدل‌های مختلف از نسبت‌های متفاوتی از منابع استفاده می‌کنند که بر توانایی‌های نهایی آن‌ها تأثیر می‌گذارد:

  • GPT-3 (۱۷۵ میلیارد پارامتر):** ۱۶٪ کتاب، ۸۴٪ صفحات وب.
  • PaLM (۵۴۰ میلیارد پارامتر):** ۵٪ کتاب، ۱۴٪ صفحات وب، ۵۰٪ داده‌های مکالمه‌ای، ۳۱٪ سایر.
  • LLaMA (۶۵ میلیارد پارامتر):** ۵٪ کتاب، ۲٪ صفحات وب، ۸۷٪ داده‌های مکالمه‌ای.

این توزیع‌ها نشان می‌دهند که انتخاب داده‌ها یک تصمیم راهبردی است که بسته به اهداف مدل متفاوت است.

مجموعه‌های داده‌ی پرکاربرد

مجموعه داده‌های پرکاربرد برای پیش‌آموزش LLM
مجموعه داده حجم منبع آخرین به‌روزرسانی
BookCorpus 5GB کتاب‌ها دک-2015
Gutenberg - کتاب‌ها دک-2021
C4 800GB Common Crawl آوریل-2019
CC-Stories-R 31GB Common Crawl سپتامبر-2019
CC-NEWS 78GB Common Crawl فوریه-2019
REALNEWS 120GB Common Crawl آوریل-2019
OpenWebText 38GB لینک‌های Reddit مارس-2023
Pushshift.io 2TB لینک‌های Reddit مارس-2023
Wikipedia 21GB ویکی‌پدیا مارس-2023
The Pile 800GB سایر دک-2020
ROOTS 1.6TB سایر ژوئن-2022

تکنیک‌های آموزش

پیش‌آموزش LLM به منابع محاسباتی قابل توجهی نیاز دارد. برای مدیریت این فرآیند از تکنیک‌های زیر استفاده می‌شود:

  • آموزش توزیع‌شده: استفاده از چندین GPU یا TPU برای پردازش موازی.
  • دقت مختلط (Mixed Precision): استفاده از فرمت‌های عددی با دقت کمتر (مثلاً ۱۶ بیتی به جای ۳۲ بیتی) برای تسریع محاسبات و کاهش مصرف حافظه.
  • نقاط بازیابی گرادیان (Gradient Checkpointing): تکنیکی برای صرفه‌جویی در حافظه با محاسبه مجدد به جای ذخیره‌سازی برخی از فعال‌سازی‌های میانی.
  • موازی‌سازی مدل (Model Parallelism): توزیع خود مدل در میان چندین دستگاه.

آموزش مدلی مانند GPT-3 ممکن است چندین ماه بر روی هزاران GPU زمان ببرد.

قوانین مقیاس‌بندی

پژوهش‌هایی مانند کار OpenAI (Kaplan et al., 2020) نشان داده‌اند که عملکرد مدل‌های زبانی با افزایش سه عامل زیر به‌شکل قابل پیش‌بینی بهبود می‌یابد:

  • اندازه مدل (تعداد پارامترها).
  • حجم داده‌ها.
  • منابع محاسباتی.

این وابستگی‌های تجربی که به قوانین مقیاس‌بندی (scaling laws) معروفند، راهنمایی برای توسعه‌دهندگان در طراحی و آموزش مدل‌های بزرگ‌تر و قدرتمندتر فراهم می‌کنند و امکان تخصیص بهینه بودجه محاسباتی را می‌دهند.

چالش‌ها و دستاوردها

  • مقیاس‌بندی: دستاورد اصلی پیش‌آموزش امکان ایجاد تعادل میان اندازه مدل، داده‌ها و محاسبات برای دستیابی به عملکرد بهینه است.
  • کیفیت داده: اطمینان از پاکی، تنوع و نبود تعصب در داده‌های آموزشی یک چالش کلیدی است.
  • کارایی: توسعه روش‌هایی برای کاهش هزینه‌های محاسباتی، مانند پیش‌آموزش پیوسته یا معماری‌های کارآمدتر.
  • چندزبانگی: ساخت مدل‌هایی که قادر به پردازش مؤثر چندین زبان باشند، نیاز به انتخاب و توازن دقیق داده‌ها دارد.

همچنین ببینید

  • مدل‌های زبانی بزرگ
  • BERT
  • GPT