Encoder-only models — معماری تنها-رمزگذار
مدلهای تنها-رمزگذار (انگلیسی: Encoder-Only Models) — دستهای از معماریهای مدلهای زبانی بزرگ (LLM) هستند که تنها بر پایهی بخش رمزگذار (encoder) معماری Transformer ساخته شدهاند. بر خلاف مدلهایی که از decoder یا معماری کامل encoder-decoder بهره میبرند، این مدلها در وظایف درک زبان طبیعی (Natural Language Understanding, NLU) تخصص دارند.
مدل پیشرو و پیشگام این رویکرد، BERT (Bidirectional Encoder Representations from Transformers) است که در سال ۲۰۱۸ توسط Google توسعه یافت.
مفهوم و معماری
ایدهی اصلی مدلهای تنها-رمزگذار، ایجاد بازنماییهای عمیق و زمینهمحور (embedding) برای هر token در دنبالهی ورودی است. با بهرهگیری از مکانیزم خودتوجهی (self-attention) در Transformer، هر token میتواند همهی tokenهای دیگر در دنباله را «ببیند» و با آنها تعامل داشته باشد؛ این ویژگی به مدل امکان میدهد زمینهی غنی را درک کند.
ویژگی کلیدی این مدلها دوطرفهبودن است: بازنمایی هر token هم بر پایهی زمینهی چپ و هم زمینهی راست آن بهصورت همزمان شکل میگیرد. این ویژگی آنها را بهطور اساسی از مدلهای خودبازگشتی تنها-رمزگشا (مانند GPT) که ذاتاً یکطرفه هستند، متمایز میکند.
از نظر معماری، این مدل از یک پشتهی لایهی یکسان encoder تشکیل شده است. هر لایه از دو زیرلایهی اصلی تشکیل شده است:
- توجه چندسرهی خودمرجع (Multi-Head Self-Attention): بازنمایی زمینهمحور را برای هر token محاسبه میکند.
- شبکهی عصبی پیشخور (Feed-Forward Network): تبدیل غیرخطی را بر هر بازنمایی token اعمال میکند.
در خروجی، مدل دنبالهای از بردارها به همان طول دنبالهی ورودی تولید میکند که هر بردار، بازنمایی غنی token ورودی متناظر خود است.
وظایف پیشآموزش
برای آموزش درک زبان در زمینهی دوطرفه، از وظایف خودنظارتی ویژهای در پیشآموزش استفاده میشود:
مدلسازی زبانی پوشانده (Masked Language Modeling, MLM)
این مهمترین و اصلیترین وظیفه برای مدلهای تنها-رمزگذار است که برای نخستین بار در BERT معرفی شد.
- اصل کار: از دنبالهی ورودی، درصد کمی از tokenها (معمولاً ۱۵٪) بهصورت تصادفی مخفی (پوشانده) میشوند. وظیفهی مدل پیشبینی مقادیر اصلی این tokenهای پوشانده شده با استفاده از زمینهی دوطرفهی پیرامون آنهاست.
- هدف: این وظیفه مدل را وادار میکند تا پیوندهای معنایی و نحوی عمیق میان کلمات را بیاموزد.
پیشبینی جملهی بعدی (Next Sentence Prediction, NSP)
این وظیفه (که همچنین از BERT اصلی است) برای آموزش درک رابطهی میان جملات به مدل طراحی شده است.
- اصل کار: به مدل یک جفت جمله داده میشود و مدل باید تشخیص دهد که آیا جملهی دوم در متن اصلی دنبالهی منطقی جملهی اول است یا خیر.
- وضعیت: پژوهشهای بعدی (مانند مدل RoBERTa) نشان دادند که NSP از MLM کماثرتر است و اغلب با وظایف دیگری جایگزین یا بهکلی حذف میشود.
کاربردها
مدلهای تنها-رمزگذار برای تولید آزاد متن طراحی نشدهاند، زیرا decoder خودبازگشتی ندارند. نقطهی قوت آنها در تحلیل و درک متن است. بازنماییهای برداری خروجی مدل برای حل طیف گستردهای از وظایف NLU استفاده میشوند:
- دستهبندی متن: برای وظایفی مانند تحلیل احساسات یا تشخیص موضوع، از بازنمایی token ویژهی `[CLS]` که در ابتدای هر دنباله افزوده میشود استفاده میگردد. بردار نهایی آن اطلاعات کل دنباله را تجمیع میکند.
- دستهبندی tokenها: برای وظایفی مانند تشخیص موجودیتهای نامدار (NER) یا برچسبگذاری اجزای کلام (POS-tagging)، از بازنمایی برداری هر token بهتنهایی استفاده میشود.
- پاسخ به پرسش (Question Answering): در وظایفی که پاسخ یک قطعه از متن دادهشده است (extractive QA)، مدل آموزش میبیند تا tokenهای آغاز و پایان پاسخ را پیشبینی کند.
- بهدستآوردن embedding: مدلهای encoder اغلب بهعنوان رمزگذارهای همهمنظورهی متن برای بهدست آوردن embeddingهای باکیفیت از جملات یا اسناد استفاده میشوند که سپس میتوانند در موتورهای جستجو یا وظایف شباهت معنایی بهکار روند.
مدلهای اصلی و سیر تکاملشان
- BERT (2018): پیشگام این معماری که رکوردهای جدیدی را در benchmarkهای متعدد NLP برقرار کرد.
- RoBERTa (2019): «BERT بهینهشدهی قوی». نشان داد که با آموزش طولانیتر بر دادههای بیشتر و حذف وظیفهی NSP میتوان عملکرد BERT را بهطور چشمگیری بهبود بخشید.
- ALBERT (2019): «A Lite BERT». مدلی با تعداد پارامتر بسیار کمتر از طریق تکنیکهای فاکتورسازی embedding و اشتراکگذاری پارامتر میان لایهها.
- DistilBERT (2019): نسخهی کوچکشدهی BERT که با دستیابی از طریق تقطیر دانش ساخته شده، سریعتر و سبکتر است اما بخش بزرگی از عملکرد نسخهی اصلی را حفظ میکند.
- ELECTRA (2020): وظیفهی پیشآموزش کارآمدتری به نام replaced token detection را معرفی کرد که در آن مدل میآموزد tokenهای اصلی را از tokenهای «جعلی» که توسط یک مدل مولد کوچک تولید شدهاند تشخیص دهد.
- DeBERTa (2020): مکانیزم «توجه جداسازیشده» (disentangled attention) را معرفی کرد که محتوا و موقعیتهای نسبی tokenها را بهصورت مجزا رمزگذاری میکند.
همچنین ببینید
- BERT