Reinforcement learning from human feedback (RLHF) (TL)
Reinforcement Learning from Human Feedback (RLHF) — ito ay isang pamamaraan ng machine learning kung saan unang sinasamahan ng espesyal na «modelo ng gantimpala» (reward model) ang proseso ng pagsasanay batay sa feedback ng mga tao, at pagkatapos ay ginagamit ito sa proseso ng Reinforcement Learning (RL) upang i-optimize ang gawi ng isang matalinong ahente[1].
Ang RLHF ay nagbibigay-daan sa pormal na pagtukoy ng mga kumplikado o mahirap na layunin (halimbawa, «kapaki-pakinabang», «ligtas» o «nakakatawa» na sagot) sa pamamagitan ng mga pagtatasa ng tao. Sa halip na manu-manong tukuyin ang isang kumplikadong reward function, pinapayagan ng RLHF ang pagsasanay ng reward model nang direkta sa mga kagustuhan ng tao. Ang diskarteng ito ay naging susi sa «pagkakahanay» (alignment) ng malalaking language model (LLM), iyon ay ang pagdadala ng kanilang gawi sa pagkakatugma sa mga pagpapahalaga at intensyon ng tao[2].
Pag-unlad ng Pamamaraan at mga Unang Tagumpay
Ang ideya ng pagsasanay ng mga ahente gamit ang feedback ng tao ay lumitaw noong 2010s. Isa sa mga unang makabuluhang resulta ay ang gawa ni Paul Christiano at ng kanyang mga katrabaho mula sa OpenAI at DeepMind noong 2017. Ipinakita nila na ang mga kagustuhan ng tao ay maaaring palitan ang manu-manong itinakdang reward function sa mga kumplikadong gawain ng RL. Sa kanilang eksperimento, ang isang tao ay tumitingin sa mga fragment ng gawi ng ahente (halimbawa, sa laro ng Atari) at pumipili ng mas kanais-nais na opsyon. Batay sa mga pairwise na paghahambing na ito, isang reward model ang nagsanay, na nagbigay-daan sa matagumpay na paglutas ng ilang kumplikadong gawain, habang nagtatanggap ng feedback sa wala pang 1% ng mga aksyon ng ahente[3].
Sa mga sumunod na taon, ang pamamaraan ay nagsimulang gamitin para sa pagsasanay ng mga language model. Noong 2020, ang mga mananaliksik ng OpenAI ay unang naglapat ng RLHF para sa gawain ng pagbubuod ng teksto. Nagsanay sila ng reward model na hinuhulaan kung aling buod ang mas gugustuhin ng isang tao, at sa tulong ng RL ay nag-fine-tune ng modelo upang i-optimize ang pagtatasa na ito. Ang resulta ay nagpakita ng makabuluhang mas mataas na kalidad ng pagbubuod, na nalampasan pa ang mga modelong sinanay sa mga sangguniang halimbawa ng tao[4].
RLHF sa Malalaking Language Model
Ang malalaking language model ay nakakuha ng malaking benepisyo mula sa pagpapatupad ng RLHF upang mapabuti ang kanilang mga sagot mula sa pananaw ng pagiging kapaki-pakinabang, katumpakan, at pagsunod sa mga tagubilin.
InstructGPT at ChatGPT
Isa sa mga pangunahing hakbang ay ang pananaliksik ng OpenAI na nagpresenta ng mga modelo ng InstructGPT (2022) — mga bersyon ng GPT-3 na na-fine-tune sa pakikilahok ng tao[5]. Ang pamamaraan ay binubuo ng tatlong yugto:
- Supervised Fine-Tuning (SFT): Ang modelo ay na-fine-tune sa isang maliit na koleksyon ng mataas na kalidad na mga demonstrasyon, kung saan ang mga tagasuri na tao ay manu-manong nagsusulat ng mga halimbawa ng mga nais na sagot sa iba't ibang kahilingan.
- Pagsasanay ng Reward Model: Para sa maraming kahilingan, ilang sagot ng modelo ang nabubuong. Ang mga tagasuri na tao ay nagra-rank ng mga sagot na ito mula pinakamahusay hanggang pinakamasama. Batay sa datos ng mga kagustuhang ito, isang reward model ang sinasamahan ng pagsasanay, na natututo na magbigay ng mas mataas na marka sa mga sagot na mas gustong-gusto ng mga tao.
- Pag-optimize gamit ang RL: Ang orihinal na language model ay na-fine-tune gamit ang Proximal Policy Optimization (PPO) algorithm upang mapakinabangan ang marka na ibinibigay ng reward model. Sa proseso ng pag-optimize, ipinakilala rin ang parusa para sa malaking paglihis mula sa orihinal na SFT-modelo upang maiwasan ang pagkasira ng mga kakayahan sa wika.
Ipinakita ng mga pagsubok na kahit ang medyo maliit na modelo ng InstructGPT (1.3 bilyong parameter) ay nalampasan ang kapaki-pakinabang ang napakalaking modelo ng GPT-3 (175 bilyong parameter). Ang mga modelo ng InstructGPT ay makabuluhan ding nagpababa ng pagbuo ng nakakalason, may kinikilingan, o hindi mapagkakatiwalaang nilalaman[5].
Ang pag-unlad ng linyang ito ay humantong sa paglikha ng mga dialogong modelo, ang pinakakilala sa mga ito ay ang ChatGPT (OpenAI, huling bahagi ng 2022). Ang ChatGPT ay isang modelo ng serye ng GPT-3.5, espesyal na na-fine-tune para sa pagdadala ng diyalogo gamit ang RLHF ayon sa katulad na pamamaraan[6].
Pagtanggap sa Industriya
Ang pamamaraan ng RLHF ay tinanggap at ng iba pang mga nangungunang organisasyon. Nagbuo ang DeepMind ng dialogong ahente na Sparrow (2022), na sinanay gamit ang RLHF na may karagdagan ng isang hanay ng mga panuntunan sa natural na wika (halimbawa, «huwag magbigay ng mapanganib na payo»)[7]. Gumamit din ang kumpanya ng Anthropic ng mga katulad na prinsipyo para sa pagsasanay ng kanilang mga modelo. Sa 2023, ang RLHF ay naging halos standard na bahagi sa paglikha ng mga pinaka-advanced na language model[1].
Mga Kalamangan ng Paggamit ng RLHF
- Pagkakatugma sa intensyon ng gumagamit: Ang mga modelong sumailalim sa RLHF-tuning ay mas mahusay na sumusunod sa mga tagubilin at nagbibigay ng mas kaugnay at kapaki-pakinabang na mga sagot[5].
- Pagbabawas ng kahaluan at mapansamang nilalaman: Ang pagsasama ng tao sa siklo ng pagsasanay ay nagbibigay-daan sa malinaw na pagpaparusa ng mga hindi kanais-nais na anyo ng sagot. Bilang resulta, ang mga RLHF-modelo ay bumubuo ng mas hindi nakakalason at hindi kinikilingang nilalaman[5].
- Pagpapabuti ng katotohanan at pagbabawas ng «mga hallucination»: Maaaring ibaba ng mga tagasuri ang rating ng mga sagot na may mga gawa-gawang katotohanan, hinahikayat ang modelo na maging mas tumpak. Ang mga modelo ng InstructGPT at ChatGPT ay mas bihirang «mag-imbento» ng mga katotohanan kumpara sa kanilang mga nauna[5].
- Kahusayan ng pagsasanay: Pinapayagan ng RLHF ang pagpapabuti ng modelo nang walang proporsyonal na pagtaas ng training dataset. Hindi kailangan ng napakalaking dami ng datos, kundi mataas na kalidad na mga pagtatasa ng kagustuhan.
Mga Limitasyon at Problema
Sa kabila ng mga tagumpay, ang pamamaraan ng RLHF ay may ilang limitasyon at bukas na problema.
- Kalidad at gastos ng pagkolekta ng datos ng tao: Ang bisa ng RLHF ay direktang nakasalalay sa kalidad ng feedback. Ang pagkolekta ng naturang dataset ay isang maingat at mahal na proseso. Bukod dito, kung ang sample ng mga tagasuri o ang kanilang mga pamantayan ay may kinikilingan, maaaring manahin ng modelo ang kanilang pagkiling[2].
- Panganib ng «natutunang pagsunod» (Reward Hacking): Ang modelong na-optimize sa ilalim ng isang tiyak na reward function ay maaaring magsimulang mag-angkop nang eksakto sa function na iyon, at hindi sa tunay na layunin. Halimbawa, maaari itong matuto na magbigay ng pinakamahabang mga sagot kung pinahahalagahan ng mga tagasuri ang haba, o iwasan ang mga pahayag kung pinarurusahan sila para sa mga kamalian.
- Kawalan ng garantiya ng katotohanan: Hindi nagpapakilala ang RLHF ng bagong katotohanang kaalaman sa modelo, kundi tinuturuan lamang ito ng anyo ng sagot na nagugustuhan ng mga tao. Kaya naman, ang problema ng mga hallucination ay hindi ganap na nareresolba. Maaaring matuto ang modelo na mas mahusay na itago ang kawalan ng katiyakan, ngunit hindi palaging makapag-verify ng mga katotohanan[6].
- Pag-scale ng mga kagustuhan: Nagdudulot din ng mga tanong ang paglipat ng reward model sa ibang mga gawain. Ang modelong sinanay sa mga kagustuhan para sa isang hanay ng mga kahilingan ay maaaring kumilos nang hindi mahuhulaan kapag nakaharap sa mga bagong gawain sa estilo o paksa.
Konklusyon
Ang RLHF ay naitatag bilang isang mahalagang pamamaraan ng «pagkakahanay» ng malalaking language model sa mga konsepto ng tao tungkol sa magagandang sagot. Nagpahintulot ito na mapabuti ang kalidad ng pakikipag-ugnayan sa mga AI assistant, na ginagawang mas kapaki-pakinabang at ligtas ang kanilang mga sagot. Ang RLHF ay itinuturing bilang isang pangunahing kasangkapan sa landas patungo sa paglikha ng mga modelong hindi lamang makabubuo ng makatotohanang teksto, kundi isasaalang-alang din ang mga pagpapahalaga, kagustuhan, at intensyon ng tao sa proseso ng pakikipag-ugnayan[8].
Mga Sanggunian
- Artikulo ng OpenAI tungkol sa fine-tuning ng mga modelo para sa pagsunod sa mga tagubilin
- Pangkalahatang-ideya ng RLHF mula sa IBM
Panitikan
- Christiano, P. et al. (2017). Deep Reinforcement Learning from Human Preferences. arXiv:1706.03741.
- Stiennon, N. et al. (2020). Learning to Summarize from Human Feedback. arXiv:2009.01325.
- Nakano, R. et al. (2021). WebGPT: Browser-Assisted Question-Answering with Human Feedback. arXiv:2112.09332.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Glaese, A. et al. (2022). Improving Alignment of Dialogue Agents via Targeted Human Judgements. arXiv:2209.14375.
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
- Liu, T. et al. (2023). A Survey of Reinforcement Learning from Human Feedback. arXiv:2312.14925.
- Zhang, Y. et al. (2024). A Survey on Human Preference Learning for Large Language Models. arXiv:2406.11191.
- Li, P. et al. (2024). Advancing Translation Preference Modeling with RLHF. arXiv:2402.11525.
- McAleese, N. et al. (2024). LLM Critics Help Catch LLM Bugs. arXiv:2407.00215.
Mga Tala
- ↑ 1.0 1.1 «What Is Reinforcement Learning From Human Feedback (RLHF)?». IBM. [1]
- ↑ 2.0 2.1 «Reinforcement learning from human feedback». In Wikipedia. [2]
- ↑ Christiano, P. et al. «Deep reinforcement learning from human preferences». arXiv:1706.03741, 2017. [3]
- ↑ Stiennon, N. et al. «Learning to summarize from human feedback». arXiv:2009.01325, 2020. [4]
- ↑ 5.0 5.1 5.2 5.3 5.4 Ouyang, L. et al. «Training language models to follow instructions with human feedback». arXiv:2203.02155, 2022. [5]
- ↑ 6.0 6.1 «Introducing ChatGPT». OpenAI, 2022. [6]
- ↑ Glaese, A. et al. «Improving alignment of dialogue agents via targeted human judgements». arXiv:2209.14375, 2022. [7]
- ↑ «Aligning language models to follow instructions». OpenAI. [8]