Reinforcement learning from human feedback (RLHF) (HI)
मानव फ़ीडबैक से Reinforcement Learning (Reinforcement Learning from Human Feedback, RLHF) — यह Machine Learning की एक विधि है, जिसमें पहले मनुष्यों की प्रतिक्रिया के आधार पर एक विशेष «reward model» (reward model) को प्रशिक्षित किया जाता है, और फिर उसे Reinforcement Learning (RL) की प्रक्रिया में एक बुद्धिमान agent के व्यवहार को अनुकूलित करने के लिए उपयोग किया जाता है[1]।
RLHF जटिल या कठिन-परिभाषित लक्ष्यों (जैसे «उपयोगी», «सुरक्षित» या «मज़ेदार» उत्तर) को मनुष्यों के मूल्यांकन के माध्यम से औपचारिक रूप देने की अनुमति देता है। हाथ से जटिल reward function परिभाषित करने के बजाय, RLHF सीधे मानवीय प्राथमिकताओं पर reward model को प्रशिक्षित करने में सक्षम बनाता है। यह दृष्टिकोण बड़े भाषा मॉडलों (LLM) के «alignment» के लिए महत्वपूर्ण बन गया है, अर्थात उनके व्यवहार को मानवीय मूल्यों और उद्देश्यों के अनुरूप बनाने के लिए[2]।
विधि का विकास और प्रारंभिक उपलब्धियाँ
मनुष्यों की प्रतिक्रिया का उपयोग करके agents को प्रशिक्षित करने का विचार 2010 के दशक में उत्पन्न हुआ। पहले महत्वपूर्ण परिणामों में से एक 2017 में OpenAI और DeepMind के Paul Christiano और उनके सहयोगियों का कार्य था। उन्होंने दिखाया कि जटिल RL कार्यों में मानवीय प्राथमिकताएँ हाथ से निर्धारित reward function की जगह ले सकती हैं। उनके प्रयोग में एक व्यक्ति agent के व्यवहार के अंश देखता था (उदाहरण के लिए, Atari गेम में) और अधिक पसंदीदा विकल्प चुनता था। इन युग्मित तुलनाओं के आधार पर एक reward model प्रशिक्षित की गई, जिससे agent की 1% से भी कम क्रियाओं पर प्रतिक्रिया प्राप्त करते हुए कई जटिल कार्यों को सफलतापूर्वक हल किया जा सका[3]।
आने वाले वर्षों में यह विधि भाषा मॉडलों के प्रशिक्षण में भी लागू होने लगी। 2020 में OpenAI के शोधकर्ताओं ने पहली बार RLHF को पाठ सारांशीकरण के कार्य में लागू किया। उन्होंने एक ऐसा reward model प्रशिक्षित किया जो यह अनुमान लगाता था कि कोई व्यक्ति किस सारांश को प्राथमिकता देगा, और RL की सहायता से इस मूल्यांकन को अनुकूलित करने के लिए मॉडल को fine-tune किया। परिणाम ने सारांशीकरण की काफी उच्च गुणवत्ता दिखाई, जिसने मानव संदर्भ उदाहरणों पर प्रशिक्षित मॉडलों को भी पीछे छोड़ दिया[4]।
RLHF बड़े भाषा मॉडलों में
बड़े भाषा मॉडलों को उपयोगिता, सटीकता और निर्देशों के अनुपालन की दृष्टि से अपने उत्तरों को बेहतर बनाने के लिए RLHF के कार्यान्वयन से महत्वपूर्ण लाभ मिला है।
InstructGPT और ChatGPT
एक महत्वपूर्ण कदम OpenAI का वह शोध था जिसने InstructGPT (2022) मॉडल प्रस्तुत किए — GPT-3 के वे संस्करण जिन्हें मानव भागीदारी के साथ fine-tune किया गया[5]। इस पद्धति में तीन चरण शामिल थे:
- Supervised Fine-Tuning (SFT): मॉडल को उच्च-गुणवत्ता वाले प्रदर्शनों के एक छोटे dataset पर fine-tune किया जाता है, जहाँ मानव मूल्यांकनकर्ता विभिन्न प्रश्नों पर वांछित उत्तरों के उदाहरण स्वयं लिखते हैं।
- Reward Model का प्रशिक्षण (Reward Model): कई प्रश्नों के लिए मॉडल के कई उत्तर उत्पन्न किए जाते हैं। मानव मूल्यांकनकर्ता इन उत्तरों को सर्वश्रेष्ठ से निकृष्टतम तक क्रमबद्ध करते हैं। प्राथमिकता के इन आँकड़ों के आधार पर एक reward model प्रशिक्षित की जाती है, जो उन उत्तरों को उच्च अंक देना सीखती है जिन्हें मनुष्य प्राथमिकता देते हैं।
- RL के माध्यम से अनुकूलन: मूल भाषा मॉडल को Proximal Policy Optimization (PPO) एल्गोरिदम की सहायता से fine-tune किया जाता है ताकि reward model द्वारा दिए गए अंक को अधिकतम किया जा सके। अनुकूलन प्रक्रिया में मूल SFT-मॉडल से अत्यधिक विचलन पर दंड भी लगाया जाता है ताकि भाषाई क्षमताओं का ह्रास न हो।
परीक्षणों से पता चला कि अपेक्षाकृत छोटा InstructGPT मॉडल (1.3 अरब parameters) भी विशाल GPT-3 मॉडल (175 अरब parameters) को उपयोगिता में पीछे छोड़ देता है। InstructGPT मॉडलों ने विषाक्त, पक्षपाती या असत्य सामग्री उत्पन्न करना भी काफी कम कर दिया[5]।
इस श्रृंखला के विकास से संवाद मॉडलों का निर्माण हुआ, जिनमें सबसे प्रसिद्ध ChatGPT (OpenAI, 2022 के अंत) बनी। ChatGPT, GPT-3.5 श्रृंखला का वह मॉडल है जिसे समान पद्धति का उपयोग करते हुए RLHF के साथ संवाद के लिए विशेष रूप से fine-tune किया गया है[6]।
उद्योग में अपनाना
RLHF विधि को अन्य प्रमुख संगठनों ने भी अपनाया। DeepMind ने संवाद agent Sparrow (2022) विकसित किया, जिसे प्राकृतिक भाषा में नियमों के समूह (जैसे «खतरनाक सलाह न देना») के साथ RLHF का उपयोग करके प्रशिक्षित किया गया था[7]। Anthropic कंपनी ने भी अपने मॉडलों के प्रशिक्षण के लिए समान सिद्धांतों का उपयोग किया। 2023 तक RLHF सबसे उन्नत भाषा मॉडलों के निर्माण में लगभग मानक घटक बन गया[1]।
RLHF के उपयोग के लाभ
- उपयोगकर्ता के इरादे के अनुरूपता: RLHF-tuned मॉडल निर्देशों का काफी बेहतर पालन करते हैं और अधिक प्रासंगिक एवं उपयोगी उत्तर देते हैं[5]।
- विषाक्तता और हानिकारक सामग्री में कमी: प्रशिक्षण चक्र में मनुष्य को शामिल करने से उत्तर के अवांछनीय रूपों को स्पष्ट रूप से罚 दंडित किया जा सकता है। परिणामस्वरूप RLHF मॉडल बहुत कम विषाक्त और पक्षपाती सामग्री उत्पन्न करते हैं[5]।
- सत्यनिष्ठा में सुधार और «hallucinations» में कमी: मूल्यांकनकर्ता कल्पित तथ्यों वाले उत्तरों की रेटिंग कम कर सकते हैं, जिससे मॉडल अधिक सटीक होने के लिए प्रेरित होता है। InstructGPT और ChatGPT मॉडल अपने पूर्ववर्तियों की तुलना में कम तथ्य «गढ़ते» हैं[5]।
- प्रशिक्षण की दक्षता: RLHF प्रशिक्षण dataset के आनुपातिक विस्तार के बिना मॉडल को बेहतर बनाने की अनुमति देता है। विशाल डेटा मात्रा की नहीं, बल्कि प्राथमिकता के गुणवत्तापूर्ण मूल्यांकन की आवश्यकता होती है।
सीमाएँ और समस्याएँ
सफलताओं के बावजूद, RLHF विधि में कई सीमाएँ और खुली समस्याएँ हैं।
- मानव डेटा संग्रह की गुणवत्ता और लागत: RLHF की प्रभावशीलता सीधे प्रतिक्रिया की गुणवत्ता पर निर्भर करती है। ऐसा dataset एकत्र करना एक श्रमसाध्य और महँगी प्रक्रिया है। इसके अलावा, यदि मूल्यांकनकर्ताओं का चयन या उनके मानदंड निष्पक्ष नहीं हैं, तो मॉडल उनकी पक्षपाती प्रवृत्तियाँ अपना सकता है[2]।
- «Reward Hacking» का जोखिम: किसी विशेष reward function के लिए अनुकूलित मॉडल वास्तविक लक्ष्य के बजाय उसी function के अनुरूप ढलने लगता है। उदाहरण के लिए, यदि मूल्यांकनकर्ता लंबाई को महत्व देते हैं तो वह अधिकतम लंबे उत्तर देना सीख सकता है, या यदि अनिश्चित कथनों पर दंड मिलता है तो उनसे बचना सीख सकता है।
- सत्य की कोई गारंटी नहीं: RLHF मॉडल में नया तथ्यात्मक ज्ञान नहीं जोड़ता, बल्कि केवल उसे उत्तर के उस स्वरूप में प्रशिक्षित करता है जो मनुष्यों को पसंद आता है। इसलिए hallucination की समस्या पूरी तरह हल नहीं होती। मॉडल अनिश्चितता को बेहतर तरीके से छुपाना सीख सकता है, लेकिन तथ्यों की सदैव जाँच करने में सक्षम नहीं होगा[6]।
- प्राथमिकताओं का स्केलिंग: reward model का अन्य कार्यों में स्थानांतरण भी प्रश्न उठाता है। एक प्रश्न-समूह की प्राथमिकताओं पर प्रशिक्षित मॉडल शैली या विषय में नए कार्यों का सामना करने पर अप्रत्याशित रूप से व्यवहार कर सकता है।
निष्कर्ष
RLHF बड़े भाषा मॉडलों को मनुष्यों की अच्छे उत्तरों की अवधारणा के साथ «align» करने की एक महत्वपूर्ण विधि के रूप में स्थापित हो चुका है। इसने AI assistants के साथ संवाद की गुणवत्ता को उल्लेखनीय रूप से बेहतर बनाया है, उनके उत्तरों को अधिक उपयोगी और सुरक्षित बनाया है। RLHF को ऐसे मॉडल बनाने की दिशा में एक महत्वपूर्ण उपकरण माना जाता है जो न केवल विश्वसनीय पाठ उत्पन्न कर सकें, बल्कि संवाद की प्रक्रिया में मानवीय मूल्यों, प्राथमिकताओं और इरादों को भी ध्यान में रख सकें[8]।
संदर्भ
- निर्देशों का पालन करने के लिए मॉडलों को fine-tune करने पर OpenAI का लेख
- IBM द्वारा RLHF का अवलोकन
साहित्य
- Christiano, P. et al. (2017). Deep Reinforcement Learning from Human Preferences. arXiv:1706.03741.
- Stiennon, N. et al. (2020). Learning to Summarize from Human Feedback. arXiv:2009.01325.
- Nakano, R. et al. (2021). WebGPT: Browser-Assisted Question-Answering with Human Feedback. arXiv:2112.09332.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Glaese, A. et al. (2022). Improving Alignment of Dialogue Agents via Targeted Human Judgements. arXiv:2209.14375.
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
- Liu, T. et al. (2023). A Survey of Reinforcement Learning from Human Feedback. arXiv:2312.14925.
- Zhang, Y. et al. (2024). A Survey on Human Preference Learning for Large Language Models. arXiv:2406.11191.
- Li, P. et al. (2024). Advancing Translation Preference Modeling with RLHF. arXiv:2402.11525.
- McAleese, N. et al. (2024). LLM Critics Help Catch LLM Bugs. arXiv:2407.00215.
टिप्पणियाँ
- ↑ 1.0 1.1 «What Is Reinforcement Learning From Human Feedback (RLHF)?». IBM. [१]
- ↑ 2.0 2.1 «Reinforcement learning from human feedback». In Wikipedia. [२]
- ↑ Christiano, P. et al. «Deep reinforcement learning from human preferences». arXiv:1706.03741, 2017. [३]
- ↑ Stiennon, N. et al. «Learning to summarize from human feedback». arXiv:2009.01325, 2020. [४]
- ↑ 5.0 5.1 5.2 5.3 5.4 Ouyang, L. et al. «Training language models to follow instructions with human feedback». arXiv:2203.02155, 2022. [५]
- ↑ 6.0 6.1 «Introducing ChatGPT». OpenAI, 2022. [६]
- ↑ Glaese, A. et al. «Improving alignment of dialogue agents via targeted human judgements». arXiv:2209.14375, 2022. [७]
- ↑ «Aligning language models to follow instructions». OpenAI. [८]