Reinforcement learning from human feedback (RLHF) (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

Обучение с подкрепление с обратна връзка от човека (Reinforcement Learning from Human Feedback, RLHF) — това е метод за машинно обучение, при който първо въз основа на обратна връзка от хора се обучава специален „модел на възнаграждение" (reward model), след което той се използва в процеса на обучение с подкрепление (RL) за оптимизиране на поведението на интелигентен агент[1].

RLHF позволява да се формализират сложни или трудно определими цели (например „полезен", „безопасен" или „смешен" отговор) чрез оценки на хора. Вместо ръчно да се дефинира сложна функция на възнаграждение, RLHF позволява да се обучи модел на възнаграждение директно върху човешки предпочитания. Този подход се превърна в ключов за „изравняването" (alignment) на големите езикови модели (LLM), тоест привеждането на поведението им в съответствие с човешките ценности и намерения[2].

Развитие на метода и първите постижения

Идеята за обучение на агенти с използване на обратна връзка от човека се зароди през 2010-те години. Един от първите значими резултати е работата на Пол Кристиано и колеги от OpenAI и DeepMind през 2017 г. Те показаха, че човешките предпочитания могат да заменят ръчно зададена функция на възнаграждение при сложни задачи на RL. В техния експеримент човек разглеждал фрагменти от поведението на агента (например в играта Atari) и избирал по-предпочитания вариант. Въз основа на тези двойни сравнения бил обучен модел на възнаграждение, което позволило успешното решаване на редица сложни задачи, получавайки обратна връзка за по-малко от 1% от действията на агента[3].

В следващите години методът започнал да се прилага за обучение на езикови модели. През 2020 г. изследователи от OpenAI за първи път приложили RLHF за задачата за обобщаване на текст. Те обучили модел на възнаграждение, предсказващ кое резюме ще предпочете човек, и с помощта на RL дообучили модела за оптимизиране на тази оценка. Резултатът показал значително по-високо качество на обобщаването, надминавайки дори модели, обучени върху човешки референтни примери[4].

RLHF в големите езикови модели

Големите езикови модели получиха съществена полза от въвеждането на RLHF за подобряване на отговорите им от гледна точка на полезност, точност и съответствие с инструкциите.

InstructGPT и ChatGPT

Една от ключовите стъпки е изследването на OpenAI, представило моделите InstructGPT (2022) — версии на GPT-3, дообучени с участието на хора[5]. Методологията се състои от три етапа:

  1. Supervised Fine-Tuning (SFT): Моделът се дообучава върху малък набор от висококачествени демонстрации, при които хора-оценители ръчно пишат примери за желани отговори на различни заявки.
  2. Обучение на модела на възнаграждение (Reward Model): За множество заявки се генерират няколко отговора на модела. Хора-оценители наредждат тези отговори от най-добрия към най-лошия. Въз основа на тези данни за предпочитания се обучава модел на възнаграждение, който се учи да присвоява по-високи оценки на отговорите, предпочитани от хората.
  3. Оптимизация с помощта на RL: Изходният езиков модел се дообучава с помощта на алгоритъма за проксимална оптимизация на политиката (PPO), за да се максимизира оценката, давана от модела на възнаграждение. В процеса на оптимизация се въвежда и наказание за силно отклонение от изходния SFT-модел, за да се предотврати деградация на езиковите способности.

Изпитанията показаха, че дори сравнително малкият модел InstructGPT (1,3 млрд. параметъра) надминава по полезност огромния модел GPT-3 (175 млрд. параметъра). Моделите InstructGPT също започнаха значително по-рядко да генерират токсично, предубедено или недостоверно съдържание[5].

Развитието на тази линия доведе до създаването на диалогови модели, най-известният от които е ChatGPT (OpenAI, края на 2022 г.). ChatGPT представлява модел от серията GPT-3.5, специално дообучен за водене на диалог с използване на RLHF по сходна методология[6].

Приемане в индустрията

Методът RLHF беше възприет и от други водещи организации. DeepMind разработи диалогов агент Sparrow (2022), който беше обучен с помощта на RLHF с добавяне на набор от правила на естествен език (например „да не се дават опасни съвети")[7]. Компанията Anthropic също използва сходни принципи за обучение на своите модели. До 2023 г. RLHF се превърна практически в стандартен компонент при създаването на най-напредналите езикови модели[1].

Предимства на прилагането на RLHF

  • Съответствие с намеренията на потребителя: Моделите, преминали RLHF-тюнинг, следват значително по-добре инструкциите и дават по-релевантни и полезни отговори[5].
  • Намаляване на токсичността и вредното съдържание: Включването на човека в цикъла на обучение позволява явно наказване на нежелателни форми на отговор. В резултат RLHF-моделите генерират значително по-малко токсично и предубедено съдържание[5].
  • Подобряване на правдивостта и намаляване на „халюцинациите": Оценителите могат да понижават рейтинга на отговори с измислени факти, насърчавайки модела да бъде по-точен. Моделите InstructGPT и ChatGPT по-рядко „измислят" факти в сравнение с техните предшественици[5].
  • Ефективност на обучението: RLHF позволява подобряването на модела без пропорционално увеличаване на обучаващата извадка. Не са необходими огромни обеми от данни, а качествени оценки на предпочитания.

Ограничения и проблеми

Въпреки успехите, методът RLHF има редица ограничения и открити проблеми.

  • Качество и цена на събирането на човешки данни: Ефективността на RLHF пряко зависи от качеството на обратната връзка. Събирането на такъв dataset е трудоемък и скъпоструващ процес. Освен това, ако извадката от оценители или техните критерии са необективни, моделът може да унаследи тяхното изкривяване[2].
  • Риск от „научено съответствие" (Reward Hacking): Моделът, оптимизиран под определена функция на наградата, може да започне да се приспособява именно към тази функция, а не към истинската цел. Например, може да се научи да дава максимално дълги отговори, ако оценителите ценят дължината, или да избягва твърдения, ако бива наказван за неточности.
  • Липса на гаранции за истина: RLHF не въвежда в модела нови фактически знания, а само го учи на форма на отговор, която харесва на хората. Затова проблемът с халюцинациите не се решава напълно. Моделът може да се научи по-добре да скрива несигурността, но не винаги ще може да проверява факти[6].
  • Мащабиране на предпочитанията: Въпроси поражда и преносимостта на модела на възнаграждение към други задачи. Модел, обучен върху предпочитания за един набор от заявки, може да действа непредсказуемо, когато се сблъска с нови по стил или тематика задачи.

Заключение

RLHF се утвърди като важен метод за „изравняване" на големите езикови модели с човешките представи за добри отговори. Той позволи забележимо подобряване на качеството на взаимодействие с AI-асистентите, правейки отговорите им по-полезни и безопасни. RLHF се разглежда като ключов инструмент по пътя към създаването на модели, способни не просто да генерират правдоподобен текст, но и да отчитат човешките ценности, предпочитания и намерения в процеса на общуване[8].

Препратки

  • Статия на OpenAI за дообучаване на модели за следване на инструкции
  • Преглед на RLHF от IBM

Литература

  • Christiano, P. et al. (2017). Deep Reinforcement Learning from Human Preferences. arXiv:1706.03741.
  • Stiennon, N. et al. (2020). Learning to Summarize from Human Feedback. arXiv:2009.01325.
  • Nakano, R. et al. (2021). WebGPT: Browser-Assisted Question-Answering with Human Feedback. arXiv:2112.09332.
  • Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
  • Glaese, A. et al. (2022). Improving Alignment of Dialogue Agents via Targeted Human Judgements. arXiv:2209.14375.
  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
  • Liu, T. et al. (2023). A Survey of Reinforcement Learning from Human Feedback. arXiv:2312.14925.
  • Zhang, Y. et al. (2024). A Survey on Human Preference Learning for Large Language Models. arXiv:2406.11191.
  • Li, P. et al. (2024). Advancing Translation Preference Modeling with RLHF. arXiv:2402.11525.
  • McAleese, N. et al. (2024). LLM Critics Help Catch LLM Bugs. arXiv:2407.00215.

Бележки

  1. 1.0 1.1 «What Is Reinforcement Learning From Human Feedback (RLHF)?». IBM. [1]
  2. 2.0 2.1 «Reinforcement learning from human feedback». In Wikipedia. [2]
  3. Christiano, P. et al. «Deep reinforcement learning from human preferences». arXiv:1706.03741, 2017. [3]
  4. Stiennon, N. et al. «Learning to summarize from human feedback». arXiv:2009.01325, 2020. [4]
  5. 5.0 5.1 5.2 5.3 5.4 Ouyang, L. et al. «Training language models to follow instructions with human feedback». arXiv:2203.02155, 2022. [5]
  6. 6.0 6.1 «Introducing ChatGPT». OpenAI, 2022. [6]
  7. Glaese, A. et al. «Improving alignment of dialogue agents via targeted human judgements». arXiv:2209.14375, 2022. [7]
  8. «Aligning language models to follow instructions». OpenAI. [8]