Reinforcement learning from human feedback (RLHF) (FA)
یادگیری تقویتی با بازخورد انسانی (Reinforcement Learning from Human Feedback، RLHF) — روشی در Machine Learning است که در آن ابتدا بر اساس بازخورد انسانها یک «مدل پاداش» (reward model) ویژه آموزش داده میشود، سپس این مدل در فرآیند Reinforcement Learning (RL) برای بهینهسازی رفتار عامل هوشمند به کار میرود[1].
RLHF امکان صورتبندی اهداف پیچیده یا سختتعریفشده (مانند پاسخ «مفید»، «ایمن» یا «بامزه») را از طریق ارزیابیهای انسانی فراهم میکند. به جای تعریف دستی یک تابع پاداش پیچیده، RLHF اجازه میدهد مدل پاداش مستقیماً بر اساس ترجیحات انسانی آموزش ببیند. این رویکرد به عنصر کلیدی «همراستاسازی» (alignment) مدلهای زبانی بزرگ (LLM) تبدیل شده است، یعنی تطبیق رفتار آنها با ارزشها و نیات انسانی[2].
توسعه روش و دستاوردهای اولیه
ایده آموزش عاملها با استفاده از بازخورد انسانی در دهه ۲۰۱۰ شکل گرفت. یکی از نخستین نتایج قابل توجه، پژوهش Paul Christiano و همکارانش از OpenAI و DeepMind در سال ۲۰۱۷ بود. آنها نشان دادند که ترجیحات انسانی میتوانند جایگزین تابع پاداش تعریفشده دستی در مسائل پیچیده RL شوند. در آزمایش آنها، یک انسان قطعاتی از رفتار عامل (برای مثال در بازی Atari) را مشاهده میکرد و گزینه مطلوبتر را انتخاب مینمود. بر اساس این مقایسههای زوجی، یک مدل پاداش آموزش دیده شد که امکان حل موفقیتآمیز تعدادی از مسائل دشوار را با دریافت بازخورد برای کمتر از ۱٪ از اقدامات عامل فراهم کرد[3].
در سالهای بعد، این روش برای آموزش مدلهای زبانی به کار گرفته شد. در سال ۲۰۲۰، پژوهشگران OpenAI برای نخستین بار RLHF را در وظیفه خلاصهسازی متن به کار بردند. آنها یک مدل پاداش آموزش دادند که پیشبینی میکرد کدام خلاصه مورد پسند انسان خواهد بود، و با استفاده از RL مدل را برای بهینهسازی این ارزیابی fine-tune کردند. نتیجه کیفیت خلاصهسازی به مراتب بهتری نشان داد که حتی از مدلهای آموزشدیده بر نمونههای مرجع انسانی پیشی گرفت[4].
RLHF در مدلهای زبانی بزرگ
مدلهای زبانی بزرگ از پیادهسازی RLHF برای بهبود پاسخهایشان از نظر مفید بودن، دقت و پیروی از دستورالعملها بهره قابل توجهی بردهاند.
InstructGPT و ChatGPT
یکی از گامهای کلیدی، پژوهش OpenAI بود که مدلهای InstructGPT (۲۰۲۲) — نسخههایی از GPT-3 که با مشارکت انسان fine-tune شدهاند — را معرفی کرد[5]. روششناسی از سه مرحله تشکیل میشد:
- Supervised Fine-Tuning (SFT): مدل بر روی مجموعه کوچکی از نمونههای نمایشی با کیفیت بالا fine-tune میشود، جایی که ارزیابهای انسانی به صورت دستی نمونههایی از پاسخهای مطلوب به درخواستهای مختلف مینویسند.
- آموزش مدل پاداش (Reward Model): برای تعداد زیادی از درخواستها، چندین پاسخ مدل تولید میشود. ارزیابهای انسانی این پاسخها را از بهترین به بدترین رتبهبندی میکنند. بر اساس این دادههای ترجیحی، یک مدل پاداش آموزش میبیند که یاد میگیرد به پاسخهایی که انسانها ترجیح میدهند امتیاز بالاتری بدهد.
- بهینهسازی با استفاده از RL: مدل زبانی اصلی با استفاده از الگوریتم بهینهسازی سیاست پروگزیمال (PPO) fine-tune میشود تا امتیاز ارائهشده توسط مدل پاداش را به حداکثر برساند. در فرآیند بهینهسازی، جریمهای برای انحراف شدید از مدل SFT اولیه نیز اعمال میشود تا از افت تواناییهای زبانی جلوگیری شود.
آزمایشها نشان داد که حتی مدل نسبتاً کوچک InstructGPT (با ۱.۳ میلیارد پارامتر) از نظر مفید بودن از مدل عظیم GPT-3 (با ۱۷۵ میلیارد پارامتر) پیشی گرفت. مدلهای InstructGPT همچنین به طور قابل ملاحظهای محتوای سمی، جانبدارانه یا نادرست کمتری تولید کردند[5].
توسعه این مسیر به ایجاد مدلهای مکالمهای انجامید که مشهورترین آنها ChatGPT (OpenAI، اواخر ۲۰۲۲) بود. ChatGPT یک مدل از سری GPT-3.5 است که به طور ویژه برای انجام مکالمه با استفاده از RLHF و روششناسی مشابه fine-tune شده است[6].
پذیرش در صنعت
روش RLHF توسط سایر سازمانهای پیشرو نیز به کار گرفته شد. DeepMind عامل مکالمهای Sparrow (۲۰۲۲) را توسعه داد که با استفاده از RLHF و افزودن مجموعهای از قوانین به زبان طبیعی (مانند «توصیههای خطرناک ندهید») آموزش دیده بود[7]. شرکت Anthropic نیز اصول مشابهی را برای آموزش مدلهای خود به کار برد. تا سال ۲۰۲۳، RLHF به یک جزء تقریباً استاندارد در ساخت پیشرفتهترین مدلهای زبانی تبدیل شده بود[1].
مزایای استفاده از RLHF
- تطابق با نیات کاربر: مدلهایی که با RLHF fine-tune شدهاند، به طور قابل ملاحظهای بهتر از دستورالعملها پیروی کرده و پاسخهای مرتبطتر و مفیدتری ارائه میدهند[5].
- کاهش محتوای سمی و مضر: گنجاندن انسان در چرخه آموزش امکان تنبیه صریح اشکال نامطلوب پاسخ را فراهم میکند. در نتیجه، مدلهای RLHF محتوای بسیار کمتر سمی و جانبدارانه تولید میکنند[5].
- بهبود صداقت و کاهش «توهمات»: ارزیابها میتوانند رتبه پاسخهای حاوی واقعیتهای ساختگی را کاهش دهند و مدل را به دقت بیشتر ترغیب کنند. مدلهای InstructGPT و ChatGPT در مقایسه با پیشینیان خود کمتر واقعیت «میسازند»[5].
- کارایی آموزش: RLHF امکان بهبود مدل را بدون افزایش متناسب حجم داده آموزشی فراهم میکند. به جای حجم عظیم دادهها، ارزیابیهای کیفی ترجیحات مورد نیاز است.
محدودیتها و چالشها
علیرغم موفقیتها، روش RLHF دارای تعدادی محدودیت و مشکلات حلنشده است.
- کیفیت و هزینه جمعآوری دادههای انسانی: اثربخشی RLHF مستقیماً به کیفیت بازخورد بستگی دارد. جمعآوری چنین dataset ای فرآیندی زمانبر و پرهزینه است. علاوه بر این، اگر نمونه ارزیابها یا معیارهای آنها جانبدارانه باشد، مدل ممکن است آن تعصب را به ارث ببرد[2].
- خطر «تطابق آموختهشده» (Reward Hacking): مدلی که برای یک تابع پاداش مشخص بهینه میشود، ممکن است شروع به تطبیق با همان تابع کند، نه هدف واقعی. برای مثال، ممکن است یاد بگیرد پاسخهای طولانیتری بدهد اگر ارزیابها به طول ارزش میدهند، یا از ادعاها پرهیز کند اگر برای نادقیق بودن جریمه میشوند.
- فقدان تضمین حقیقت: RLHF دانش واقعی جدیدی را به مدل وارد نمیکند، بلکه فقط شکل پاسخی را که انسانها دوست دارند به آن میآموزد. بنابراین مشکل توهمات به طور کامل حل نمیشود. مدل ممکن است یاد بگیرد عدم اطمینان را بهتر پنهان کند، اما همیشه قادر به تأیید واقعیتها نخواهد بود[6].
- مقیاسبندی ترجیحات: انتقال مدل پاداش به وظایف دیگر نیز سؤالبرانگیز است. مدلی که بر اساس ترجیحات برای یک مجموعه درخواستها آموزش دیده، ممکن است هنگام مواجهه با وظایف جدید از نظر سبک یا موضوع، رفتار غیرقابل پیشبینی داشته باشد.
نتیجهگیری
RLHF به عنوان روشی مهم برای «همراستاسازی» مدلهای زبانی بزرگ با تصورات انسانی از پاسخهای خوب، تثبیت شده است. این روش امکان بهبود قابل توجه کیفیت تعامل با دستیارهای هوش مصنوعی را فراهم کرده و پاسخهای آنها را مفیدتر و ایمنتر ساخته است. RLHF به عنوان ابزاری کلیدی در مسیر ساخت مدلهایی در نظر گرفته میشود که نه تنها قادر به تولید متن قابل قبول هستند، بلکه میتوانند ارزشها، ترجیحات و نیات انسانی را در فرآیند ارتباط در نظر بگیرند[8].
ادبیات
- Christiano, P. et al. (2017). Deep Reinforcement Learning from Human Preferences. arXiv:1706.03741.
- Stiennon, N. et al. (2020). Learning to Summarize from Human Feedback. arXiv:2009.01325.
- Nakano, R. et al. (2021). WebGPT: Browser-Assisted Question-Answering with Human Feedback. arXiv:2112.09332.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Glaese, A. et al. (2022). Improving Alignment of Dialogue Agents via Targeted Human Judgements. arXiv:2209.14375.
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
- Liu, T. et al. (2023). A Survey of Reinforcement Learning from Human Feedback. arXiv:2312.14925.
- Zhang, Y. et al. (2024). A Survey on Human Preference Learning for Large Language Models. arXiv:2406.11191.
- Li, P. et al. (2024). Advancing Translation Preference Modeling with RLHF. arXiv:2402.11525.
- McAleese, N. et al. (2024). LLM Critics Help Catch LLM Bugs. arXiv:2407.00215.
منابع
- مقاله OpenAI درباره fine-tune کردن مدلها برای پیروی از دستورالعملها
- مرور RLHF از IBM
یادداشتها
- ↑ 1.0 1.1 «What Is Reinforcement Learning From Human Feedback (RLHF)?». IBM. [۱]
- ↑ 2.0 2.1 «Reinforcement learning from human feedback». In Wikipedia. [۲]
- ↑ Christiano, P. et al. «Deep reinforcement learning from human preferences». arXiv:1706.03741, 2017. [۳]
- ↑ Stiennon, N. et al. «Learning to summarize from human feedback». arXiv:2009.01325, 2020. [۴]
- ↑ 5.0 5.1 5.2 5.3 5.4 Ouyang, L. et al. «Training language models to follow instructions with human feedback». arXiv:2203.02155, 2022. [۵]
- ↑ 6.0 6.1 «Introducing ChatGPT». OpenAI, 2022. [۶]
- ↑ Glaese, A. et al. «Improving alignment of dialogue agents via targeted human judgements». arXiv:2209.14375, 2022. [۷]
- ↑ «Aligning language models to follow instructions». OpenAI. [۸]