Theoretical foundations of large language models — مبانی نظری مدلهای زبانی بزرگ
مبانی نظری مدلهای زبانی بزرگ (بر پایه معماری transformer) — مجموعهای از اصول ریاضی، آماری و نظریه اطلاعات است که زیربنای عملکرد، آموزش و قابلیتهای مدلهای زبانی بزرگ (LLM) مدرن را تشکیل میدهد. این مبانی توضیح میدهند که چگونه مدلهای ساختهشده بر معماری Transformer قادرند زبان انسانی را با درجه بالایی از انسجام درک و تولید کنند.
مبانی معماری: معماری Transformer
مدلهای LLM مدرن تقریباً بهطور کامل بر معماری Transformer استوارند که در سال ۲۰۱۷ در مقاله «Attention Is All You Need» معرفی شد. این معماری از لایههای بازگشتی (مانند RNN و LSTM) صرفنظر کرد و بر مکانیزم توجه (attention) تأکید گذاشت، که امکان پردازش کارآمد دنبالههای طولانی و موازیسازی محاسبات را فراهم ساخت.
Self-Attention - مکانیزم خودتوجهی
این هسته اصلی معماری Transformer است. مکانیزم خودتوجهی به مدل امکان میدهد اهمیت هر کلمه (token) در یک دنباله را نسبت به تمام کلمات دیگر در همان دنباله وزندهی کند. برای هر token سه بردار ساخته میشود:
- Query (Q، پرسوجو): برداری که کلمه جاری را نمایش میدهد.
- Key (K، کلید): برداری که پرسوجوهای کلمات دیگر با آن مقایسه میشوند.
- Value (V، مقدار): برداری که اطلاعات کلمه را در خود دارد و به مراحل بعدی منتقل میشود.
امتیاز توجه بهصورت حاصلضرب داخلی مقیاسشده محاسبه میشود:
که در آن بُعد بردارهای کلید است. این مکانیزم به مدل امکان میدهد وابستگیهای پیچیده متنی را صرفنظر از فاصله میان کلمات دریابد.
Multi-Head Attention - توجه چندسری — اجرای موازی چندین محاسبه از این نوع با ماتریسهای تصویر متفاوت است که به مدل امکان میدهد بهطور همزمان بر جنبههای مختلف نحو و معناشناسی تمرکز کند.
انواع معماریهای مبتنی بر Transformer
سه نوع اصلی از کاربرد اجزای Transformer وجود دارد:
- Encoder-Decoder - رمزگذار-رمزگشا: معماری کلاسیک برای وظایف تبدیل دنباله به دنباله (مانند ترجمه ماشینی). رمزگذار دنباله ورودی را پردازش میکند و رمزگشا دنباله خروجی را تولید میکند. نمونهها: T5، BART.
- Encoder-Only - فقط رمزگذار: مدلهایی که تنها از پشته رمزگذار استفاده میکنند. برای وظایفی که نیاز به درک عمیق زمینه کل دنباله دارند مناسبند (طبقهبندی متن، شناسایی موجودیتهای نامدار). نمونه: BERT.
- Decoder-Only - فقط رمزگشا: مدلهایی که تنها از پشته رمزگشا استفاده میکنند. این مدلها بهصورت خودبازگشتی کار میکنند و token بعدی را بر اساس tokenهای قبلی پیشبینی میکنند. این استاندارد مدلهای مولد است. نمونهها: GPT، LLaMA، Claude.
کدگذاری موقعیتی
از آنجا که مکانیزم خودتوجهی ترتیب کلمات را در نظر نمیگیرد، کدگذاری موقعیتی به معماری افزوده میشود. بردارهایی که موقعیت tokenها را در دنباله رمزگذاری میکنند به embeddingهای آنها افزوده میشوند. در مدل اصلی از توابع سینوسی استفاده شد:
در مدلهای مدرن، کدگذاریهای موقعیتی قابلیادگیری و چرخشی (Rotary Position Embeddings, RoPE) نیز بهکار میروند.
اصول آموزش: از احتمال تا بهینهسازی
مدلسازی زبانی بهعنوان مسئلهای احتمالی
زیربنای LLM وظیفه مدلسازی زبانی است — پیشبینی احتمال یک دنباله متنی. بهطور رسمی، برای دنباله مدل احتمال را تخمین میزند. با استفاده از قانون زنجیره احتمالات، این به ضرب احتمالات شرطی تجزیه میشود:
بدینترتیب، آموزش مدل به پیشبینی token بعدی بر اساس زمینه tokenهای قبلی تقلیل مییابد.
تابع زیان و نظریه اطلاعات
برای ارزیابی کیفیت پیشبینیها و آموزش مدل از تابع زیان آنتروپی متقاطع استفاده میشود. این تابع اختلاف میان توزیع احتمالی پیشبینیشده توسط مدل () و توزیع واقعی () را اندازهگیری میکند، جایی که token صحیح بعدی احتمال ۱ و بقیه احتمال ۰ دارند.
کمینهسازی آنتروپی متقاطع معادل بیشینهسازی درستنمایی دادههای آموزشی است.
معیار کیفیت مرتبط، پیچیدگی (perplexity) است که بهصورت نمای آنتروپی متقاطع تعریف میشود: . بهطور شهودی، پیچیدگی میانگین تعداد گزینههایی را نشان میدهد که مدل در هر گام از میان آنها «انتخاب میکند». هرچه پیچیدگی کمتر باشد، مدل مطمئنتر و دقیقتر است.
بهینهسازی
آموزش LLM فرآیند کمینهسازی تابع زیان از طریق تنظیم میلیاردها پارامتر مدل است. برای این منظور از روشهای مبتنی بر گرادیان کاهشی استفاده میشود. رایجترین آنها بهینهساز Adam (Adaptive Moment Estimation) و انواع آن (مانند AdamW) است که نرخ یادگیری را برای هر پارامتر بهصورت تطبیقی تنظیم میکند.
پارادایمهای آموزش
- پیشآموزش (Pre-training): مدل بر روی مجموعههای متنی غیرعلامتگذاریشده عظیم (Common Crawl، The Pile، C4) با استفاده از وظایف خودنظارتی آموزش میبیند، از جمله:
- مدلسازی زبانی علّی (CLM): پیشبینی token بعدی (استفادهشده در GPT).
- مدلسازی زبانی ماسکشده (MLM): بازیابی tokenهای ماسکشده بهصورت تصادفی در متن (استفادهشده در BERT).
- fine-tuning - دقیقتنظیمی: پس از پیشآموزش، مدل برای وظایف خاص بر روی مجموعه دادههای کوچک علامتگذاریشده تطبیق مییابد.
- همسویی (Alignment): مرحله خاصی از دقیقتنظیمی که هدف آن هماهنگسازی رفتار مدل با ترجیحات و ارزشهای انسانی است. روش کلیدی — RLHF (Reinforcement Learning from Human Feedback) — است که در آن مدل با استفاده از سیگنال پاداش از مدلی که ترجیحات انسانی را پیشبینی میکند، دقیقتنظیم میشود.
قوانین مقیاسبندی و قابلیتهای نوظهور
تحقیقات تجربی نشان دادهاند که عملکرد LLM بهطور قابلپیشبینی با افزایش سه عامل بهبود مییابد: اندازه مدل (تعداد پارامترها، )، اندازه مجموعه داده آموزشی () و حجم محاسبات (). این وابستگی با قوانین توانی (scaling laws) توصیف میشود.
قانون پیشنهادشده در کار OpenAI (Kaplan et al., 2020) نشان میدهد که تابع زیان بهصورت تابع توانی از ، و کاهش مییابد. کار بعدی DeepMind (Hoffmann et al., 2022) این قوانین را دقیقتر کرد (قوانین Chinchilla) و نشان داد که برای آموزش بهینه لازم است هم اندازه مدل و هم حجم داده بهصورت متوازن افزایش یابند.
پیامد مهم مقیاسبندی، ظهور قابلیتهای نوظهور است — جهشهای کیفی در عملکرد، زمانی که مدل شروع به حل وظایفی میکند که بهطور صریح برای آنها آموزش ندیده است (مانند حساب، استدلال منطقی، نوشتن کد). این قابلیتها معمولاً در مدلهای کوچکتر وجود ندارند و تنها پس از رسیدن به آستانهای معین از مقیاس ظاهر میشوند.
تولید متن: راهبردهای رمزگشایی
پس از آموزش، مدل با پیشبینی تکراری token بعدی متن تولید میکند. انتخاب token بعدی از توزیع احتمالی ارائهشده توسط مدل با استفاده از راهبردهای رمزگشایی مختلف انجام میشود:
- جستجوی حریصانه (Greedy Search): همیشه محتملترین token انتخاب میشود. سریع است اما اغلب به متن تکراری و کسلکننده منجر میشود.
- جستجوی پرتویی (Beam Search): در هر گام دنباله محتملتر نگه داشته میشود که امکان یافتن راهحلهای بهینهتر کلی را فراهم میسازد.
- نمونهگیری با دما: احتمالات tokenها با پارامتر دما () تنظیم میشوند. در توزیع یکنواختتر میشود (خلاقیت بیشتر)، در قلهایتر میشود (تصادفی بودن کمتر).
- نمونهگیری Top-k: در هر گام نمونهگیری به token محتملتر محدود میشود.
- نمونهگیری Top-p (Nucleus): نمونهگیری به حداقل مجموعهای از tokenها محدود میشود که احتمال تجمعی آنها از آستانه تجاوز میکند. این امکان تطبیق پویای اندازه مخزن کاندیداها را فراهم میکند.
مسائل نظری و محدودیتها
- توهمزایی (Hallucination): گرایش مدلها به تولید اطلاعات واقعاً نادرست اما قانعکننده. این به آن دلیل است که مدلها احتمال متن را بهینه میکنند، نه صحت آن را.
- تعصب (Bias): مدلهای LLM تعصبات اجتماعی، فرهنگی و دیگر تعصبات موجود در دادههای آموزشی را به ارث میبرند و تقویت میکنند.
- تفسیرپذیری («جعبه سیاه»): به دلیل تعداد بسیار زیاد پارامترها، درک دقیق نحوه تصمیمگیری مدل بسیار دشوار است که اشکالزدایی را سختتر میکند و خطراتی ایجاد مینماید.
- پیچیدگی محاسباتی: مکانیزم خودتوجهی پیچیدگی درجه دوم نسبت به طول دنباله دارد ()، که حداکثر طول زمینه قابل پردازش را محدود میکند.
همچنین ببینید
- مدلهای زبانی بزرگ
- BERT
- GPT
منابع
- Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
- Brown, T. B. et al. (2020). Language Models Are Few-Shot Learners. arXiv:2005.14165.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Bubeck, S. et al. (2023). Sparks of Artificial General Intelligence: Early Experiments with GPT-4. arXiv:2303.12712.
- Touvron, H. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
- Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. DOI:10.1145/3442188.3445922.