Theoretical foundations of large language models — مبانی نظری مدل‌های زبانی بزرگ

From Systems analysis Wiki
Jump to navigation Jump to search

مبانی نظری مدل‌های زبانی بزرگ (بر پایه معماری transformer) — مجموعه‌ای از اصول ریاضی، آماری و نظریه اطلاعات است که زیربنای عملکرد، آموزش و قابلیت‌های مدل‌های زبانی بزرگ (LLM) مدرن را تشکیل می‌دهد. این مبانی توضیح می‌دهند که چگونه مدل‌های ساخته‌شده بر معماری Transformer قادرند زبان انسانی را با درجه بالایی از انسجام درک و تولید کنند.

مبانی معماری: معماری Transformer

مدل‌های LLM مدرن تقریباً به‌طور کامل بر معماری Transformer استوارند که در سال ۲۰۱۷ در مقاله «Attention Is All You Need» معرفی شد. این معماری از لایه‌های بازگشتی (مانند RNN و LSTM) صرف‌نظر کرد و بر مکانیزم توجه (attention) تأکید گذاشت، که امکان پردازش کارآمد دنباله‌های طولانی و موازی‌سازی محاسبات را فراهم ساخت.

Self-Attention - مکانیزم خودتوجهی

این هسته اصلی معماری Transformer است. مکانیزم خودتوجهی به مدل امکان می‌دهد اهمیت هر کلمه (token) در یک دنباله را نسبت به تمام کلمات دیگر در همان دنباله وزن‌دهی کند. برای هر token سه بردار ساخته می‌شود:

  • Query (Q، پرس‌وجو): برداری که کلمه جاری را نمایش می‌دهد.
  • Key (K، کلید): برداری که پرس‌وجوهای کلمات دیگر با آن مقایسه می‌شوند.
  • Value (V، مقدار): برداری که اطلاعات کلمه را در خود دارد و به مراحل بعدی منتقل می‌شود.

امتیاز توجه به‌صورت حاصل‌ضرب داخلی مقیاس‌شده محاسبه می‌شود:

Attention(Q,K,V)=softmax(QKTdk)V

که در آن dk بُعد بردارهای کلید است. این مکانیزم به مدل امکان می‌دهد وابستگی‌های پیچیده متنی را صرف‌نظر از فاصله میان کلمات دریابد.

Multi-Head Attention - توجه چندسری — اجرای موازی چندین محاسبه از این نوع با ماتریس‌های تصویر متفاوت است که به مدل امکان می‌دهد به‌طور همزمان بر جنبه‌های مختلف نحو و معناشناسی تمرکز کند.

انواع معماری‌های مبتنی بر Transformer

سه نوع اصلی از کاربرد اجزای Transformer وجود دارد:

  1. Encoder-Decoder - رمزگذار-رمزگشا: معماری کلاسیک برای وظایف تبدیل دنباله به دنباله (مانند ترجمه ماشینی). رمزگذار دنباله ورودی را پردازش می‌کند و رمزگشا دنباله خروجی را تولید می‌کند. نمونه‌ها: T5، BART.
  2. Encoder-Only - فقط رمزگذار: مدل‌هایی که تنها از پشته رمزگذار استفاده می‌کنند. برای وظایفی که نیاز به درک عمیق زمینه کل دنباله دارند مناسبند (طبقه‌بندی متن، شناسایی موجودیت‌های نام‌دار). نمونه: BERT.
  3. Decoder-Only - فقط رمزگشا: مدل‌هایی که تنها از پشته رمزگشا استفاده می‌کنند. این مدل‌ها به‌صورت خودبازگشتی کار می‌کنند و token بعدی را بر اساس token‌های قبلی پیش‌بینی می‌کنند. این استاندارد مدل‌های مولد است. نمونه‌ها: GPT، LLaMA، Claude.

کدگذاری موقعیتی

از آنجا که مکانیزم خودتوجهی ترتیب کلمات را در نظر نمی‌گیرد، کدگذاری موقعیتی به معماری افزوده می‌شود. بردارهایی که موقعیت token‌ها را در دنباله رمزگذاری می‌کنند به embedding‌های آن‌ها افزوده می‌شوند. در مدل اصلی از توابع سینوسی استفاده شد:

PE(pos,2i)=sin(pos/100002i/dmodel)
PE(pos,2i+1)=cos(pos/100002i/dmodel)

در مدل‌های مدرن، کدگذاری‌های موقعیتی قابل‌یادگیری و چرخشی (Rotary Position Embeddings, RoPE) نیز به‌کار می‌روند.

اصول آموزش: از احتمال تا بهینه‌سازی

مدل‌سازی زبانی به‌عنوان مسئله‌ای احتمالی

زیربنای LLM وظیفه مدل‌سازی زبانی است — پیش‌بینی احتمال یک دنباله متنی. به‌طور رسمی، برای دنباله X=(x1,x2,,xT) مدل احتمال P(X) را تخمین می‌زند. با استفاده از قانون زنجیره احتمالات، این به ضرب احتمالات شرطی تجزیه می‌شود:

P(X)=t=1TP(xt|x1,,xt1)

بدین‌ترتیب، آموزش مدل به پیش‌بینی token بعدی xt بر اساس زمینه token‌های قبلی تقلیل می‌یابد.

تابع زیان و نظریه اطلاعات

برای ارزیابی کیفیت پیش‌بینی‌ها و آموزش مدل از تابع زیان آنتروپی متقاطع استفاده می‌شود. این تابع اختلاف میان توزیع احتمالی پیش‌بینی‌شده توسط مدل (q) و توزیع واقعی (p) را اندازه‌گیری می‌کند، جایی که token صحیح بعدی احتمال ۱ و بقیه احتمال ۰ دارند.

H(p,q)=ip(i)logq(i)

کمینه‌سازی آنتروپی متقاطع معادل بیشینه‌سازی درستنمایی داده‌های آموزشی است.

معیار کیفیت مرتبط، پیچیدگی (perplexity) است که به‌صورت نمای آنتروپی متقاطع تعریف می‌شود: Perplexity=2H(p,q). به‌طور شهودی، پیچیدگی میانگین تعداد گزینه‌هایی را نشان می‌دهد که مدل در هر گام از میان آن‌ها «انتخاب می‌کند». هرچه پیچیدگی کمتر باشد، مدل مطمئن‌تر و دقیق‌تر است.

بهینه‌سازی

آموزش LLM فرآیند کمینه‌سازی تابع زیان از طریق تنظیم میلیاردها پارامتر مدل است. برای این منظور از روش‌های مبتنی بر گرادیان کاهشی استفاده می‌شود. رایج‌ترین آن‌ها بهینه‌ساز Adam (Adaptive Moment Estimation) و انواع آن (مانند AdamW) است که نرخ یادگیری را برای هر پارامتر به‌صورت تطبیقی تنظیم می‌کند.

پارادایم‌های آموزش

  1. پیش‌آموزش (Pre-training): مدل بر روی مجموعه‌های متنی غیرعلامت‌گذاری‌شده عظیم (Common Crawl، The Pile، C4) با استفاده از وظایف خودنظارتی آموزش می‌بیند، از جمله:
    • مدل‌سازی زبانی علّی (CLM): پیش‌بینی token بعدی (استفاده‌شده در GPT).
    • مدل‌سازی زبانی ماسک‌شده (MLM): بازیابی token‌های ماسک‌شده به‌صورت تصادفی در متن (استفاده‌شده در BERT).
  2. fine-tuning - دقیق‌تنظیمی: پس از پیش‌آموزش، مدل برای وظایف خاص بر روی مجموعه داده‌های کوچک علامت‌گذاری‌شده تطبیق می‌یابد.
  3. همسویی (Alignment): مرحله خاصی از دقیق‌تنظیمی که هدف آن هماهنگ‌سازی رفتار مدل با ترجیحات و ارزش‌های انسانی است. روش کلیدی — RLHF (Reinforcement Learning from Human Feedback) — است که در آن مدل با استفاده از سیگنال پاداش از مدلی که ترجیحات انسانی را پیش‌بینی می‌کند، دقیق‌تنظیم می‌شود.

قوانین مقیاس‌بندی و قابلیت‌های نوظهور

تحقیقات تجربی نشان داده‌اند که عملکرد LLM به‌طور قابل‌پیش‌بینی با افزایش سه عامل بهبود می‌یابد: اندازه مدل (تعداد پارامترها، N)، اندازه مجموعه داده آموزشی (D) و حجم محاسبات (C). این وابستگی با قوانین توانی (scaling laws) توصیف می‌شود.

قانون پیشنهادشده در کار OpenAI (Kaplan et al., 2020) نشان می‌دهد که تابع زیان L به‌صورت تابع توانی از N، D و C کاهش می‌یابد. کار بعدی DeepMind (Hoffmann et al., 2022) این قوانین را دقیق‌تر کرد (قوانین Chinchilla) و نشان داد که برای آموزش بهینه لازم است هم اندازه مدل و هم حجم داده به‌صورت متوازن افزایش یابند.

پیامد مهم مقیاس‌بندی، ظهور قابلیت‌های نوظهور است — جهش‌های کیفی در عملکرد، زمانی که مدل شروع به حل وظایفی می‌کند که به‌طور صریح برای آن‌ها آموزش ندیده است (مانند حساب، استدلال منطقی، نوشتن کد). این قابلیت‌ها معمولاً در مدل‌های کوچک‌تر وجود ندارند و تنها پس از رسیدن به آستانه‌ای معین از مقیاس ظاهر می‌شوند.

تولید متن: راهبردهای رمزگشایی

پس از آموزش، مدل با پیش‌بینی تکراری token بعدی متن تولید می‌کند. انتخاب token بعدی از توزیع احتمالی ارائه‌شده توسط مدل با استفاده از راهبردهای رمزگشایی مختلف انجام می‌شود:

  • جستجوی حریصانه (Greedy Search): همیشه محتمل‌ترین token انتخاب می‌شود. سریع است اما اغلب به متن تکراری و کسل‌کننده منجر می‌شود.
  • جستجوی پرتویی (Beam Search): در هر گام k دنباله محتمل‌تر نگه داشته می‌شود که امکان یافتن راه‌حل‌های بهینه‌تر کلی را فراهم می‌سازد.
  • نمونه‌گیری با دما: احتمالات token‌ها با پارامتر دما (T) تنظیم می‌شوند. در T>1 توزیع یکنواخت‌تر می‌شود (خلاقیت بیشتر)، در T<1 قله‌ای‌تر می‌شود (تصادفی بودن کمتر).
  • نمونه‌گیری Top-k: در هر گام نمونه‌گیری به k token محتمل‌تر محدود می‌شود.
  • نمونه‌گیری Top-p (Nucleus): نمونه‌گیری به حداقل مجموعه‌ای از token‌ها محدود می‌شود که احتمال تجمعی آن‌ها از آستانه p تجاوز می‌کند. این امکان تطبیق پویای اندازه مخزن کاندیداها را فراهم می‌کند.

مسائل نظری و محدودیت‌ها

  • توهم‌زایی (Hallucination): گرایش مدل‌ها به تولید اطلاعات واقعاً نادرست اما قانع‌کننده. این به آن دلیل است که مدل‌ها احتمال متن را بهینه می‌کنند، نه صحت آن را.
  • تعصب (Bias): مدل‌های LLM تعصبات اجتماعی، فرهنگی و دیگر تعصبات موجود در داده‌های آموزشی را به ارث می‌برند و تقویت می‌کنند.
  • تفسیرپذیری («جعبه سیاه»): به دلیل تعداد بسیار زیاد پارامترها، درک دقیق نحوه تصمیم‌گیری مدل بسیار دشوار است که اشکال‌زدایی را سخت‌تر می‌کند و خطراتی ایجاد می‌نماید.
  • پیچیدگی محاسباتی: مکانیزم خودتوجهی پیچیدگی درجه دوم نسبت به طول دنباله دارد (O(n2))، که حداکثر طول زمینه قابل پردازش را محدود می‌کند.

همچنین ببینید

  • مدل‌های زبانی بزرگ
  • BERT
  • GPT

منابع

  • Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
  • Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
  • Brown, T. B. et al. (2020). Language Models Are Few-Shot Learners. arXiv:2005.14165.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Bubeck, S. et al. (2023). Sparks of Artificial General Intelligence: Early Experiments with GPT-4. arXiv:2303.12712.
  • Touvron, H. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
  • Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. DOI:10.1145/3442188.3445922.