Pre-training of large language models — پیشآموزش
پیشآموزش مدلهای زبانی بزرگ (LLM) — مرحلهای بنیادین در ساخت مدلهای زبانی بزرگ مدرن است که طی آن این مدلها بر روی مجموعههای عظیم و متنوعی از متنهای بدون برچسب آموزش میبینند. این فرآیند به مدلها امکان میدهد تا الگوهای کلی زبانی، دانش جهانی و روابط معناشناختی را فرا گیرند و به اصطلاح مدل پایه (foundation model) شکل گیرد که سپس میتوان آن را برای حل وظایف خاص تطبیق داد.
پیشآموزش چیست؟
پیشآموزش (pre-training) مرحلهی آغازین آموزش است که در آن LLM با استفاده از روشهای یادگیری خودنظارتی (self-supervised learning) بر روی مجموعه دادههای متنی گسترده آموزش میبیند. این بدان معناست که سیگنالهای آموزشی (برچسبها) از خود دادهها تولید میشوند و نیازی به برچسبگذاری دستی توسط انسان نیست.
هدف اصلی این مرحله پیشبینی بخشهای پنهان یا آیندهی متن است. بسته به معماری، دو وظیفه اصلی مورد استفاده قرار میگیرند:
- مدلسازی زبانی علّی (Causal Language Modeling, CLM): مدل میآموزد که کلمه (token) بعدی در دنباله را بر اساس تمام کلمات پیشین پیشبینی کند. این رویکرد پایهی مدلهای مولد مانند GPT است.
- مدلسازی زبانی ماسکشده (Masked Language Modeling, MLM): مدل میآموزد کلمات «ماسکشده» (پنهان) را در متن بازیابی کند و از بافت دوطرفهی پیرامون آنها (کلمات چپ و راست) بهره میبرد. این روش در مدلهایی مانند BERT به کار میرود.
به لطف این وظایف، مدل ناگزیر است نحو، معناشناسی و دانش واقعی از جهان را بیاموزد تا بتواند پیشبینیهای موفقیتآمیز داشته باشد.
دادههای پیشآموزش
اثربخشی پیشآموزش تا حد زیادی به کیفیت و تنوع دادههای آموزشی بستگی دارد. منابع اصلی زیر مورد استفاده قرار میگیرند:
- صفحات وب: مجموعه دادههایی مانند Common Crawl و C4 طیف گستردهای از موضوعات، سبکها و زبانها را پوشش میدهند و «تصویری از اینترنت» ارائه میدهند.
- کتابها: مجموعههایی مانند BookCorpus و The Pile متن ساختارمند و منسجمی فراهم میکنند که برای درک وابستگیهای بلندمدت و روایتها مفیدند.
- دادههای مکالمهای: دادههای انجمنهایی مانند Reddit و شبکههای اجتماعی که به مدلها کمک میکنند زبان غیررسمی و الگوهای گفتگو را فرا گیرند.
- دادههای تخصصی: مقالات علمی (از arXiv)، کد برنامهنویسی (از GitHub و The Stack) یا متون چندزبانه برای بهبود قابلیتهای خاص مدل.
نمونههای توزیع داده
مدلهای مختلف از نسبتهای متفاوتی از منابع استفاده میکنند که بر تواناییهای نهایی آنها تأثیر میگذارد:
- GPT-3 (۱۷۵ میلیارد پارامتر):** ۱۶٪ کتاب، ۸۴٪ صفحات وب.
- PaLM (۵۴۰ میلیارد پارامتر):** ۵٪ کتاب، ۱۴٪ صفحات وب، ۵۰٪ دادههای مکالمهای، ۳۱٪ سایر.
- LLaMA (۶۵ میلیارد پارامتر):** ۵٪ کتاب، ۲٪ صفحات وب، ۸۷٪ دادههای مکالمهای.
این توزیعها نشان میدهند که انتخاب دادهها یک تصمیم راهبردی است که بسته به اهداف مدل متفاوت است.
مجموعههای دادهی پرکاربرد
| مجموعه داده | حجم | منبع | آخرین بهروزرسانی |
|---|---|---|---|
| BookCorpus | 5GB | کتابها | دک-2015 |
| Gutenberg | - | کتابها | دک-2021 |
| C4 | 800GB | Common Crawl | آوریل-2019 |
| CC-Stories-R | 31GB | Common Crawl | سپتامبر-2019 |
| CC-NEWS | 78GB | Common Crawl | فوریه-2019 |
| REALNEWS | 120GB | Common Crawl | آوریل-2019 |
| OpenWebText | 38GB | لینکهای Reddit | مارس-2023 |
| Pushshift.io | 2TB | لینکهای Reddit | مارس-2023 |
| Wikipedia | 21GB | ویکیپدیا | مارس-2023 |
| The Pile | 800GB | سایر | دک-2020 |
| ROOTS | 1.6TB | سایر | ژوئن-2022 |
تکنیکهای آموزش
پیشآموزش LLM به منابع محاسباتی قابل توجهی نیاز دارد. برای مدیریت این فرآیند از تکنیکهای زیر استفاده میشود:
- آموزش توزیعشده: استفاده از چندین GPU یا TPU برای پردازش موازی.
- دقت مختلط (Mixed Precision): استفاده از فرمتهای عددی با دقت کمتر (مثلاً ۱۶ بیتی به جای ۳۲ بیتی) برای تسریع محاسبات و کاهش مصرف حافظه.
- نقاط بازیابی گرادیان (Gradient Checkpointing): تکنیکی برای صرفهجویی در حافظه با محاسبه مجدد به جای ذخیرهسازی برخی از فعالسازیهای میانی.
- موازیسازی مدل (Model Parallelism): توزیع خود مدل در میان چندین دستگاه.
آموزش مدلی مانند GPT-3 ممکن است چندین ماه بر روی هزاران GPU زمان ببرد.
قوانین مقیاسبندی
پژوهشهایی مانند کار OpenAI (Kaplan et al., 2020) نشان دادهاند که عملکرد مدلهای زبانی با افزایش سه عامل زیر بهشکل قابل پیشبینی بهبود مییابد:
- اندازه مدل (تعداد پارامترها).
- حجم دادهها.
- منابع محاسباتی.
این وابستگیهای تجربی که به قوانین مقیاسبندی (scaling laws) معروفند، راهنمایی برای توسعهدهندگان در طراحی و آموزش مدلهای بزرگتر و قدرتمندتر فراهم میکنند و امکان تخصیص بهینه بودجه محاسباتی را میدهند.
چالشها و دستاوردها
- مقیاسبندی: دستاورد اصلی پیشآموزش امکان ایجاد تعادل میان اندازه مدل، دادهها و محاسبات برای دستیابی به عملکرد بهینه است.
- کیفیت داده: اطمینان از پاکی، تنوع و نبود تعصب در دادههای آموزشی یک چالش کلیدی است.
- کارایی: توسعه روشهایی برای کاهش هزینههای محاسباتی، مانند پیشآموزش پیوسته یا معماریهای کارآمدتر.
- چندزبانگی: ساخت مدلهایی که قادر به پردازش مؤثر چندین زبان باشند، نیاز به انتخاب و توازن دقیق دادهها دارد.
همچنین ببینید
- مدلهای زبانی بزرگ
- BERT
- GPT