Decoder-only models (architecture) (FA)
مدلهای فقط-دیکودر (انگلیسی: Decoder-Only Models) — دستهی غالب از معماریهای مدلهای زبانی بزرگ (LLM) هستند که تنها بر پایهی بخش دیکودر معماری Transformer بنا شدهاند. این مدلها در وظایف تولید متن تخصص دارند و پایهی اکثر چتباتها و دستیارهای هوش مصنوعی مدرن به شمار میروند.
خط محصولات پرچمداری که این رویکرد را محبوب ساخت، سری مدلهای GPT از OpenAI است.
مفهوم و معماری
ایدهی اصلی مدلهای فقط-دیکودر در تولید خودبازگشتی (autoregressive) دنبالهها نهفته است. این بدان معناست که مدل توکن بعدی را بر اساس تمام توکنهای پیشین تولیدشده پیشبینی میکند. prompt ورودی (درخواست کاربر) و متن از پیش تولیدشده بهعنوان یک دنبالهی واحد در نظر گرفته میشوند که مدل آن را ادامه میدهد.
از نظر معماری، مدل از یک پشته متشکل از لایهی یکسان دیکودر تشکیل شده است. هر لایه، برخلاف encoder یا دیکودر کامل، تنها دارای دو زیرلایهی اصلی است:
- توجه چندسری پوشیده به خود (Masked Multi-Head Self-Attention): این مکانیزم کلیدی است که ویژگی خودبازگشتی را تضمین میکند. در حین پردازش دنباله، یک ماسک علّی (causal mask) ویژه مانع از آن میشود که هر توکن به توکنهای بعدی «نگاه کند». بدین ترتیب، پیشبینی برای موقعیت تنها به توکنهای موقعیتهای وابسته است.
- شبکهی عصبی تماممتصل (Feed-Forward Network): یک تبدیل غیرخطی بر بازنمایی هر توکن اعمال میکند.
در مدلهای فقط-دیکودر مکانیزم توجه متقاطع (cross-attention) وجود ندارد، چرا که encoderای برای «توجه کردن» به آن وجود ندارد.
وظایف پیشآموزش
مدلهای فقط-دیکودر بر روی یک وظیفهی خودنظارتی واحد اما بسیار قدرتمند آموزش میبینند:
مدلسازی زبانی علّی (Causal Language Modeling, CLM)
- اصل کار: مدل آموزش میبیند تا توکن بعدی در یک دنباله را پیشبینی کند. در هر گام آموزشی، یک قطعه متن دریافت کرده و باید توزیع احتمال برای توکن بعدی را تولید کند.
- هدف: بیشینهسازی احتمال توکن بعدی صحیح بر روی حجم عظیمی از دادههای متنی. این وظیفه که در نگاه اول ساده به نظر میرسد، مدل را وادار میکند تا دستور زبان، نحو، حقایق مربوط به جهان و الگوهای پیچیدهی زبانی را فرا گیرد.
کاربردها
به دلیل ماهیت خودبازگشتی خود، مدلهای فقط-دیکودر برای هر وظیفهای که نیاز به تولید متن دارد ایدهآل هستند:
- تولید متن آزاد: نوشتن مقاله، شعر، فیلمنامه و غیره.
- سیستمهای گفتگو و چتباتها: پاسخ به سؤالات کاربران به شیوهای محاورهای.
- خلاصهسازی: ایجاد خلاصهای از متون طولانی.
- ترجمهی ماشینی: با اینکه برای این منظور اغلب از مدلهای encoder-decoder استفاده میشود، مدلهای فقط-دیکودر نیز میتوانند از عهدهی ترجمه برآیند، به شرطی که وظیفه در prompt صورتبندی شده باشد (مثلاً «از انگلیسی به فارسی ترجمه کن: ...»).
- نوشتن کد: تولید کد بر اساس توضیحات متنی.
- یادگیری در متن (In-context learning): به لطف مقیاس، مدلهای دیکودر بزرگ توانایی حل وظایف جدید را تنها با دریافت چند نمونه (few-shot) یا حتی بدون هیچ نمونهای (zero-shot) مستقیماً در prompt، بدون نیاز به fine-tuning، از خود نشان میدهند.
مدلهای اصلی و تکامل آنها
- سری GPT (۲۰۱۸-اکنون): پیشگامان و محبوبسازان این رویکرد. GPT-1 اثربخشی پیشآموزش را نشان داد، GPT-2 قدرت مقیاسپذیری را به نمایش گذاشت، و GPT-3 ظهور قابلیتهای few-shot را آشکار کرد. ChatGPT و GPT-4 این معماری را به استاندارد دستیارهای هوش مصنوعی تبدیل کردند.
- LLaMA (۲۰۲۳-اکنون): سری مدلهای متنباز از Meta که دسترسی به LLMهای قدرتمند را دموکراتیک کرد و موجی از نوآوری در جامعه را برانگیخت.
- Claude (۲۰۲۳-اکنون): خانوادهی مدلهای Anthropic که با تمرکز بر ایمنی و قابلیت کنترل از طریق Constitutional AI طراحی شده است.
- PaLM و Gemini (۲۰۲۲-اکنون): مدلهای پرچمدار Google. Gemini همچنین یک مدل فقط-دیکودر بومی چندوجهی (multimodal) است.
مقایسه با سایر معماریها
| معماری | وظیفهی اصلی | جهت زمینه | مدلهای نمونه |
|---|---|---|---|
| فقط-دیکودر | تولید متن | یکطرفه (چپ به راست) | GPT, LLaMA, Claude, Gemini |
| فقط-encoder | درک متن | دوطرفه | BERT, RoBERTa |
| Encoder-decoder | تبدیل دنباله به دنباله | دوطرفه (encoder) + یکطرفه (decoder) | T5, BART, Transformer اصلی |
همچنین ببینید
- GPT