Reinforcement learning from human feedback (RLHF) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

یادگیری تقویتی با بازخورد انسانی (Reinforcement Learning from Human Feedback، RLHF) — روشی در Machine Learning است که در آن ابتدا بر اساس بازخورد انسان‌ها یک «مدل پاداش» (reward model) ویژه آموزش داده می‌شود، سپس این مدل در فرآیند Reinforcement Learning (RL) برای بهینه‌سازی رفتار عامل هوشمند به کار می‌رود[1].

RLHF امکان صورت‌بندی اهداف پیچیده یا سخت‌تعریف‌شده (مانند پاسخ «مفید»، «ایمن» یا «بامزه») را از طریق ارزیابی‌های انسانی فراهم می‌کند. به جای تعریف دستی یک تابع پاداش پیچیده، RLHF اجازه می‌دهد مدل پاداش مستقیماً بر اساس ترجیحات انسانی آموزش ببیند. این رویکرد به عنصر کلیدی «همراستاسازی» (alignment) مدل‌های زبانی بزرگ (LLM) تبدیل شده است، یعنی تطبیق رفتار آن‌ها با ارزش‌ها و نیات انسانی[2].

توسعه روش و دستاوردهای اولیه

ایده آموزش عامل‌ها با استفاده از بازخورد انسانی در دهه ۲۰۱۰ شکل گرفت. یکی از نخستین نتایج قابل توجه، پژوهش Paul Christiano و همکارانش از OpenAI و DeepMind در سال ۲۰۱۷ بود. آن‌ها نشان دادند که ترجیحات انسانی می‌توانند جایگزین تابع پاداش تعریف‌شده دستی در مسائل پیچیده RL شوند. در آزمایش آن‌ها، یک انسان قطعاتی از رفتار عامل (برای مثال در بازی Atari) را مشاهده می‌کرد و گزینه مطلوب‌تر را انتخاب می‌نمود. بر اساس این مقایسه‌های زوجی، یک مدل پاداش آموزش دیده شد که امکان حل موفقیت‌آمیز تعدادی از مسائل دشوار را با دریافت بازخورد برای کمتر از ۱٪ از اقدامات عامل فراهم کرد[3].

در سال‌های بعد، این روش برای آموزش مدل‌های زبانی به کار گرفته شد. در سال ۲۰۲۰، پژوهشگران OpenAI برای نخستین بار RLHF را در وظیفه خلاصه‌سازی متن به کار بردند. آن‌ها یک مدل پاداش آموزش دادند که پیش‌بینی می‌کرد کدام خلاصه مورد پسند انسان خواهد بود، و با استفاده از RL مدل را برای بهینه‌سازی این ارزیابی fine-tune کردند. نتیجه کیفیت خلاصه‌سازی به مراتب بهتری نشان داد که حتی از مدل‌های آموزش‌دیده بر نمونه‌های مرجع انسانی پیشی گرفت[4].

RLHF در مدل‌های زبانی بزرگ

مدل‌های زبانی بزرگ از پیاده‌سازی RLHF برای بهبود پاسخ‌هایشان از نظر مفید بودن، دقت و پیروی از دستورالعمل‌ها بهره قابل توجهی برده‌اند.

InstructGPT و ChatGPT

یکی از گام‌های کلیدی، پژوهش OpenAI بود که مدل‌های InstructGPT (۲۰۲۲) — نسخه‌هایی از GPT-3 که با مشارکت انسان fine-tune شده‌اند — را معرفی کرد[5]. روش‌شناسی از سه مرحله تشکیل می‌شد:

  1. Supervised Fine-Tuning (SFT): مدل بر روی مجموعه کوچکی از نمونه‌های نمایشی با کیفیت بالا fine-tune می‌شود، جایی که ارزیاب‌های انسانی به صورت دستی نمونه‌هایی از پاسخ‌های مطلوب به درخواست‌های مختلف می‌نویسند.
  2. آموزش مدل پاداش (Reward Model): برای تعداد زیادی از درخواست‌ها، چندین پاسخ مدل تولید می‌شود. ارزیاب‌های انسانی این پاسخ‌ها را از بهترین به بدترین رتبه‌بندی می‌کنند. بر اساس این داده‌های ترجیحی، یک مدل پاداش آموزش می‌بیند که یاد می‌گیرد به پاسخ‌هایی که انسان‌ها ترجیح می‌دهند امتیاز بالاتری بدهد.
  3. بهینه‌سازی با استفاده از RL: مدل زبانی اصلی با استفاده از الگوریتم بهینه‌سازی سیاست پروگزیمال (PPO) fine-tune می‌شود تا امتیاز ارائه‌شده توسط مدل پاداش را به حداکثر برساند. در فرآیند بهینه‌سازی، جریمه‌ای برای انحراف شدید از مدل SFT اولیه نیز اعمال می‌شود تا از افت توانایی‌های زبانی جلوگیری شود.

آزمایش‌ها نشان داد که حتی مدل نسبتاً کوچک InstructGPT (با ۱.۳ میلیارد پارامتر) از نظر مفید بودن از مدل عظیم GPT-3 (با ۱۷۵ میلیارد پارامتر) پیشی گرفت. مدل‌های InstructGPT همچنین به طور قابل ملاحظه‌ای محتوای سمی، جانب‌دارانه یا نادرست کمتری تولید کردند[5].

توسعه این مسیر به ایجاد مدل‌های مکالمه‌ای انجامید که مشهورترین آن‌ها ChatGPT (OpenAI، اواخر ۲۰۲۲) بود. ChatGPT یک مدل از سری GPT-3.5 است که به طور ویژه برای انجام مکالمه با استفاده از RLHF و روش‌شناسی مشابه fine-tune شده است[6].

پذیرش در صنعت

روش RLHF توسط سایر سازمان‌های پیشرو نیز به کار گرفته شد. DeepMind عامل مکالمه‌ای Sparrow (۲۰۲۲) را توسعه داد که با استفاده از RLHF و افزودن مجموعه‌ای از قوانین به زبان طبیعی (مانند «توصیه‌های خطرناک ندهید») آموزش دیده بود[7]. شرکت Anthropic نیز اصول مشابهی را برای آموزش مدل‌های خود به کار برد. تا سال ۲۰۲۳، RLHF به یک جزء تقریباً استاندارد در ساخت پیشرفته‌ترین مدل‌های زبانی تبدیل شده بود[1].

مزایای استفاده از RLHF

  • تطابق با نیات کاربر: مدل‌هایی که با RLHF fine-tune شده‌اند، به طور قابل ملاحظه‌ای بهتر از دستورالعمل‌ها پیروی کرده و پاسخ‌های مرتبط‌تر و مفیدتری ارائه می‌دهند[5].
  • کاهش محتوای سمی و مضر: گنجاندن انسان در چرخه آموزش امکان تنبیه صریح اشکال نامطلوب پاسخ را فراهم می‌کند. در نتیجه، مدل‌های RLHF محتوای بسیار کمتر سمی و جانب‌دارانه تولید می‌کنند[5].
  • بهبود صداقت و کاهش «توهمات»: ارزیاب‌ها می‌توانند رتبه پاسخ‌های حاوی واقعیت‌های ساختگی را کاهش دهند و مدل را به دقت بیشتر ترغیب کنند. مدل‌های InstructGPT و ChatGPT در مقایسه با پیشینیان خود کمتر واقعیت «می‌سازند»[5].
  • کارایی آموزش: RLHF امکان بهبود مدل را بدون افزایش متناسب حجم داده آموزشی فراهم می‌کند. به جای حجم عظیم داده‌ها، ارزیابی‌های کیفی ترجیحات مورد نیاز است.

محدودیت‌ها و چالش‌ها

علی‌رغم موفقیت‌ها، روش RLHF دارای تعدادی محدودیت و مشکلات حل‌نشده است.

  • کیفیت و هزینه جمع‌آوری داده‌های انسانی: اثربخشی RLHF مستقیماً به کیفیت بازخورد بستگی دارد. جمع‌آوری چنین dataset ای فرآیندی زمان‌بر و پرهزینه است. علاوه بر این، اگر نمونه ارزیاب‌ها یا معیارهای آن‌ها جانب‌دارانه باشد، مدل ممکن است آن تعصب را به ارث ببرد[2].
  • خطر «تطابق آموخته‌شده» (Reward Hacking): مدلی که برای یک تابع پاداش مشخص بهینه می‌شود، ممکن است شروع به تطبیق با همان تابع کند، نه هدف واقعی. برای مثال، ممکن است یاد بگیرد پاسخ‌های طولانی‌تری بدهد اگر ارزیاب‌ها به طول ارزش می‌دهند، یا از ادعاها پرهیز کند اگر برای نادقیق بودن جریمه می‌شوند.
  • فقدان تضمین حقیقت: RLHF دانش واقعی جدیدی را به مدل وارد نمی‌کند، بلکه فقط شکل پاسخی را که انسان‌ها دوست دارند به آن می‌آموزد. بنابراین مشکل توهمات به طور کامل حل نمی‌شود. مدل ممکن است یاد بگیرد عدم اطمینان را بهتر پنهان کند، اما همیشه قادر به تأیید واقعیت‌ها نخواهد بود[6].
  • مقیاس‌بندی ترجیحات: انتقال مدل پاداش به وظایف دیگر نیز سؤال‌برانگیز است. مدلی که بر اساس ترجیحات برای یک مجموعه درخواست‌ها آموزش دیده، ممکن است هنگام مواجهه با وظایف جدید از نظر سبک یا موضوع، رفتار غیرقابل پیش‌بینی داشته باشد.

نتیجه‌گیری

RLHF به عنوان روشی مهم برای «همراستاسازی» مدل‌های زبانی بزرگ با تصورات انسانی از پاسخ‌های خوب، تثبیت شده است. این روش امکان بهبود قابل توجه کیفیت تعامل با دستیارهای هوش مصنوعی را فراهم کرده و پاسخ‌های آن‌ها را مفیدتر و ایمن‌تر ساخته است. RLHF به عنوان ابزاری کلیدی در مسیر ساخت مدل‌هایی در نظر گرفته می‌شود که نه تنها قادر به تولید متن قابل قبول هستند، بلکه می‌توانند ارزش‌ها، ترجیحات و نیات انسانی را در فرآیند ارتباط در نظر بگیرند[8].

ادبیات

  • Christiano, P. et al. (2017). Deep Reinforcement Learning from Human Preferences. arXiv:1706.03741.
  • Stiennon, N. et al. (2020). Learning to Summarize from Human Feedback. arXiv:2009.01325.
  • Nakano, R. et al. (2021). WebGPT: Browser-Assisted Question-Answering with Human Feedback. arXiv:2112.09332.
  • Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
  • Glaese, A. et al. (2022). Improving Alignment of Dialogue Agents via Targeted Human Judgements. arXiv:2209.14375.
  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
  • Liu, T. et al. (2023). A Survey of Reinforcement Learning from Human Feedback. arXiv:2312.14925.
  • Zhang, Y. et al. (2024). A Survey on Human Preference Learning for Large Language Models. arXiv:2406.11191.
  • Li, P. et al. (2024). Advancing Translation Preference Modeling with RLHF. arXiv:2402.11525.
  • McAleese, N. et al. (2024). LLM Critics Help Catch LLM Bugs. arXiv:2407.00215.

منابع

  • مقاله OpenAI درباره fine-tune کردن مدل‌ها برای پیروی از دستورالعمل‌ها
  • مرور RLHF از IBM

یادداشت‌ها

  1. 1.0 1.1 «What Is Reinforcement Learning From Human Feedback (RLHF)?». IBM. [۱]
  2. 2.0 2.1 «Reinforcement learning from human feedback». In Wikipedia. [۲]
  3. Christiano, P. et al. «Deep reinforcement learning from human preferences». arXiv:1706.03741, 2017. [۳]
  4. Stiennon, N. et al. «Learning to summarize from human feedback». arXiv:2009.01325, 2020. [۴]
  5. 5.0 5.1 5.2 5.3 5.4 Ouyang, L. et al. «Training language models to follow instructions with human feedback». arXiv:2203.02155, 2022. [۵]
  6. 6.0 6.1 «Introducing ChatGPT». OpenAI, 2022. [۶]
  7. Glaese, A. et al. «Improving alignment of dialogue agents via targeted human judgements». arXiv:2209.14375, 2022. [۷]
  8. «Aligning language models to follow instructions». OpenAI. [۸]