---
title: "Reinforcement learning from human feedback (RLHF) (HI)"
source: "https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)"
wiki: "systems-analysis.info/int"
article: "Reinforcement_learning_from_human_feedback_(RLHF)_(HI)"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 6289
wiki_created_at: 2026-09-07T00:01:48Z
wiki_modified_at: 2026-09-07T00:01:48Z
downloaded_at: 2026-09-07T23:13:09Z
---

# Reinforcement learning from human feedback (RLHF) (HI)

**मानव फ़ीडबैक से Reinforcement Learning** (**Reinforcement Learning from Human Feedback**, **RLHF**) — यह Machine Learning की एक विधि है, जिसमें पहले मनुष्यों की प्रतिक्रिया के आधार पर एक विशेष «reward model» (*reward model*) को प्रशिक्षित किया जाता है, और फिर उसे Reinforcement Learning (RL) की प्रक्रिया में एक बुद्धिमान agent के व्यवहार को अनुकूलित करने के लिए उपयोग किया जाता है<sup>[\[1\]](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_note-ibm_rlhf-1)</sup>।

RLHF जटिल या कठिन-परिभाषित लक्ष्यों (जैसे «उपयोगी», «सुरक्षित» या «मज़ेदार» उत्तर) को मनुष्यों के मूल्यांकन के माध्यम से औपचारिक रूप देने की अनुमति देता है। हाथ से जटिल reward function परिभाषित करने के बजाय, RLHF सीधे मानवीय प्राथमिकताओं पर reward model को प्रशिक्षित करने में सक्षम बनाता है। यह दृष्टिकोण बड़े भाषा मॉडलों (LLM) के «alignment» के लिए महत्वपूर्ण बन गया है, अर्थात उनके व्यवहार को मानवीय मूल्यों और उद्देश्यों के अनुरूप बनाने के लिए<sup>[\[2\]](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_note-wiki_rlhf-2)</sup>।

## विधि का विकास और प्रारंभिक उपलब्धियाँ

मनुष्यों की प्रतिक्रिया का उपयोग करके agents को प्रशिक्षित करने का विचार 2010 के दशक में उत्पन्न हुआ। पहले महत्वपूर्ण परिणामों में से एक 2017 में OpenAI और DeepMind के Paul Christiano और उनके सहयोगियों का कार्य था। उन्होंने दिखाया कि जटिल RL कार्यों में मानवीय प्राथमिकताएँ हाथ से निर्धारित reward function की जगह ले सकती हैं। उनके प्रयोग में एक व्यक्ति agent के व्यवहार के अंश देखता था (उदाहरण के लिए, Atari गेम में) और अधिक पसंदीदा विकल्प चुनता था। इन युग्मित तुलनाओं के आधार पर एक reward model प्रशिक्षित की गई, जिससे agent की 1% से भी कम क्रियाओं पर प्रतिक्रिया प्राप्त करते हुए कई जटिल कार्यों को सफलतापूर्वक हल किया जा सका<sup>[\[3\]](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_note-christiano_2017-3)</sup>।

आने वाले वर्षों में यह विधि भाषा मॉडलों के प्रशिक्षण में भी लागू होने लगी। 2020 में OpenAI के शोधकर्ताओं ने पहली बार RLHF को पाठ सारांशीकरण के कार्य में लागू किया। उन्होंने एक ऐसा reward model प्रशिक्षित किया जो यह अनुमान लगाता था कि कोई व्यक्ति किस सारांश को प्राथमिकता देगा, और RL की सहायता से इस मूल्यांकन को अनुकूलित करने के लिए मॉडल को fine-tune किया। परिणाम ने सारांशीकरण की काफी उच्च गुणवत्ता दिखाई, जिसने मानव संदर्भ उदाहरणों पर प्रशिक्षित मॉडलों को भी पीछे छोड़ दिया<sup>[\[4\]](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_note-stiennon_2020-4)</sup>।

## RLHF बड़े भाषा मॉडलों में

बड़े भाषा मॉडलों को उपयोगिता, सटीकता और निर्देशों के अनुपालन की दृष्टि से अपने उत्तरों को बेहतर बनाने के लिए RLHF के कार्यान्वयन से महत्वपूर्ण लाभ मिला है।

### InstructGPT और ChatGPT

एक महत्वपूर्ण कदम OpenAI का वह शोध था जिसने **InstructGPT** (2022) मॉडल प्रस्तुत किए — GPT-3 के वे संस्करण जिन्हें मानव भागीदारी के साथ fine-tune किया गया<sup>[\[5\]](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_note-ouyang_2022-5)</sup>। इस पद्धति में तीन चरण शामिल थे:

1.  **Supervised Fine-Tuning (SFT)**: मॉडल को उच्च-गुणवत्ता वाले प्रदर्शनों के एक छोटे dataset पर fine-tune किया जाता है, जहाँ मानव मूल्यांकनकर्ता विभिन्न प्रश्नों पर वांछित उत्तरों के उदाहरण स्वयं लिखते हैं।
2.  **Reward Model का प्रशिक्षण (Reward Model)**: कई प्रश्नों के लिए मॉडल के कई उत्तर उत्पन्न किए जाते हैं। मानव मूल्यांकनकर्ता इन उत्तरों को सर्वश्रेष्ठ से निकृष्टतम तक क्रमबद्ध करते हैं। प्राथमिकता के इन आँकड़ों के आधार पर एक reward model प्रशिक्षित की जाती है, जो उन उत्तरों को उच्च अंक देना सीखती है जिन्हें मनुष्य प्राथमिकता देते हैं।
3.  **RL के माध्यम से अनुकूलन**: मूल भाषा मॉडल को Proximal Policy Optimization (PPO) एल्गोरिदम की सहायता से fine-tune किया जाता है ताकि reward model द्वारा दिए गए अंक को अधिकतम किया जा सके। अनुकूलन प्रक्रिया में मूल SFT-मॉडल से अत्यधिक विचलन पर दंड भी लगाया जाता है ताकि भाषाई क्षमताओं का ह्रास न हो।

परीक्षणों से पता चला कि अपेक्षाकृत छोटा InstructGPT मॉडल (1.3 अरब parameters) भी विशाल GPT-3 मॉडल (175 अरब parameters) को उपयोगिता में पीछे छोड़ देता है। InstructGPT मॉडलों ने विषाक्त, पक्षपाती या असत्य सामग्री उत्पन्न करना भी काफी कम कर दिया<sup>[\[5\]](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_note-ouyang_2022-5)</sup>।

इस श्रृंखला के विकास से संवाद मॉडलों का निर्माण हुआ, जिनमें सबसे प्रसिद्ध **ChatGPT** (OpenAI, 2022 के अंत) बनी। ChatGPT, GPT-3.5 श्रृंखला का वह मॉडल है जिसे समान पद्धति का उपयोग करते हुए RLHF के साथ संवाद के लिए विशेष रूप से fine-tune किया गया है<sup>[\[6\]](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_note-chatgpt_intro-6)</sup>।

### उद्योग में अपनाना

RLHF विधि को अन्य प्रमुख संगठनों ने भी अपनाया। DeepMind ने संवाद agent **Sparrow** (2022) विकसित किया, जिसे प्राकृतिक भाषा में नियमों के समूह (जैसे «खतरनाक सलाह न देना») के साथ RLHF का उपयोग करके प्रशिक्षित किया गया था<sup>[\[7\]](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_note-glaese_2022-7)</sup>। Anthropic कंपनी ने भी अपने मॉडलों के प्रशिक्षण के लिए समान सिद्धांतों का उपयोग किया। 2023 तक RLHF सबसे उन्नत भाषा मॉडलों के निर्माण में लगभग मानक घटक बन गया<sup>[\[1\]](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_note-ibm_rlhf-1)</sup>।

## RLHF के उपयोग के लाभ

- **उपयोगकर्ता के इरादे के अनुरूपता**: RLHF-tuned मॉडल निर्देशों का काफी बेहतर पालन करते हैं और अधिक प्रासंगिक एवं उपयोगी उत्तर देते हैं<sup>[\[5\]](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_note-ouyang_2022-5)</sup>।
- **विषाक्तता और हानिकारक सामग्री में कमी**: प्रशिक्षण चक्र में मनुष्य को शामिल करने से उत्तर के अवांछनीय रूपों को स्पष्ट रूप से罚 दंडित किया जा सकता है। परिणामस्वरूप RLHF मॉडल बहुत कम विषाक्त और पक्षपाती सामग्री उत्पन्न करते हैं<sup>[\[5\]](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_note-ouyang_2022-5)</sup>।
- **सत्यनिष्ठा में सुधार और «hallucinations» में कमी**: मूल्यांकनकर्ता कल्पित तथ्यों वाले उत्तरों की रेटिंग कम कर सकते हैं, जिससे मॉडल अधिक सटीक होने के लिए प्रेरित होता है। InstructGPT और ChatGPT मॉडल अपने पूर्ववर्तियों की तुलना में कम तथ्य «गढ़ते» हैं<sup>[\[5\]](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_note-ouyang_2022-5)</sup>।
- **प्रशिक्षण की दक्षता**: RLHF प्रशिक्षण dataset के आनुपातिक विस्तार के बिना मॉडल को बेहतर बनाने की अनुमति देता है। विशाल डेटा मात्रा की नहीं, बल्कि प्राथमिकता के गुणवत्तापूर्ण मूल्यांकन की आवश्यकता होती है।

## सीमाएँ और समस्याएँ

सफलताओं के बावजूद, RLHF विधि में कई सीमाएँ और खुली समस्याएँ हैं।

- **मानव डेटा संग्रह की गुणवत्ता और लागत**: RLHF की प्रभावशीलता सीधे प्रतिक्रिया की गुणवत्ता पर निर्भर करती है। ऐसा dataset एकत्र करना एक श्रमसाध्य और महँगी प्रक्रिया है। इसके अलावा, यदि मूल्यांकनकर्ताओं का चयन या उनके मानदंड निष्पक्ष नहीं हैं, तो मॉडल उनकी पक्षपाती प्रवृत्तियाँ अपना सकता है<sup>[\[2\]](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_note-wiki_rlhf-2)</sup>।
- **«Reward Hacking» का जोखिम**: किसी विशेष reward function के लिए अनुकूलित मॉडल वास्तविक लक्ष्य के बजाय उसी function के अनुरूप ढलने लगता है। उदाहरण के लिए, यदि मूल्यांकनकर्ता लंबाई को महत्व देते हैं तो वह अधिकतम लंबे उत्तर देना सीख सकता है, या यदि अनिश्चित कथनों पर दंड मिलता है तो उनसे बचना सीख सकता है।
- **सत्य की कोई गारंटी नहीं**: RLHF मॉडल में नया तथ्यात्मक ज्ञान नहीं जोड़ता, बल्कि केवल उसे उत्तर के उस स्वरूप में प्रशिक्षित करता है जो मनुष्यों को पसंद आता है। इसलिए hallucination की समस्या पूरी तरह हल नहीं होती। मॉडल अनिश्चितता को बेहतर तरीके से छुपाना सीख सकता है, लेकिन तथ्यों की सदैव जाँच करने में सक्षम नहीं होगा<sup>[\[6\]](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_note-chatgpt_intro-6)</sup>।
- **प्राथमिकताओं का स्केलिंग**: reward model का अन्य कार्यों में स्थानांतरण भी प्रश्न उठाता है। एक प्रश्न-समूह की प्राथमिकताओं पर प्रशिक्षित मॉडल शैली या विषय में नए कार्यों का सामना करने पर अप्रत्याशित रूप से व्यवहार कर सकता है।

## निष्कर्ष

RLHF बड़े भाषा मॉडलों को मनुष्यों की अच्छे उत्तरों की अवधारणा के साथ «align» करने की एक महत्वपूर्ण विधि के रूप में स्थापित हो चुका है। इसने AI assistants के साथ संवाद की गुणवत्ता को उल्लेखनीय रूप से बेहतर बनाया है, उनके उत्तरों को अधिक उपयोगी और सुरक्षित बनाया है। RLHF को ऐसे मॉडल बनाने की दिशा में एक महत्वपूर्ण उपकरण माना जाता है जो न केवल विश्वसनीय पाठ उत्पन्न कर सकें, बल्कि संवाद की प्रक्रिया में मानवीय मूल्यों, प्राथमिकताओं और इरादों को भी ध्यान में रख सकें<sup>[\[8\]](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_note-openai_aligning-8)</sup>।

## संदर्भ

- निर्देशों का पालन करने के लिए मॉडलों को fine-tune करने पर OpenAI का लेख
- IBM द्वारा RLHF का अवलोकन

## साहित्य

- Christiano, P. et al. (2017). *Deep Reinforcement Learning from Human Preferences*. arXiv:1706.03741.
- Stiennon, N. et al. (2020). *Learning to Summarize from Human Feedback*. arXiv:2009.01325.
- Nakano, R. et al. (2021). *WebGPT: Browser-Assisted Question-Answering with Human Feedback*. arXiv:2112.09332.
- Ouyang, L. et al. (2022). *Training Language Models to Follow Instructions with Human Feedback*. arXiv:2203.02155.
- Glaese, A. et al. (2022). *Improving Alignment of Dialogue Agents via Targeted Human Judgements*. arXiv:2209.14375.
- Bai, Y. et al. (2022). *Constitutional AI: Harmlessness from AI Feedback*. arXiv:2212.08073.
- Lee, H. et al. (2023). *RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback*. arXiv:2309.00267.
- Liu, T. et al. (2023). *A Survey of Reinforcement Learning from Human Feedback*. arXiv:2312.14925.
- Zhang, Y. et al. (2024). *A Survey on Human Preference Learning for Large Language Models*. arXiv:2406.11191.
- Li, P. et al. (2024). *Advancing Translation Preference Modeling with RLHF*. arXiv:2402.11525.
- McAleese, N. et al. (2024). *LLM Critics Help Catch LLM Bugs*. arXiv:2407.00215.

## टिप्पणियाँ

1.  <span id="cite_note-ibm_rlhf-1">↑ <sup>[1.0](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_ref-ibm_rlhf_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_ref-ibm_rlhf_1-1)</sup> «What Is Reinforcement Learning From Human Feedback (RLHF)?». *IBM*. <a href="https://www.ibm.com/think/topics/rlhf" class="external autonumber" rel="nofollow">[१]</a></span>
2.  <span id="cite_note-wiki_rlhf-2">↑ <sup>[2.0](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_ref-wiki_rlhf_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_ref-wiki_rlhf_2-1)</sup> «Reinforcement learning from human feedback». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Reinforcement_learning_from_human_feedback" class="external autonumber" rel="nofollow">[२]</a></span>
3.  <span id="cite_note-christiano_2017-3">[↑](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_ref-christiano_2017_3-0) Christiano, P. et al. «Deep reinforcement learning from human preferences». *arXiv:1706.03741*, 2017. <a href="https://arxiv.org/abs/1706.03741" class="external autonumber" rel="nofollow">[३]</a></span>
4.  <span id="cite_note-stiennon_2020-4">[↑](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_ref-stiennon_2020_4-0) Stiennon, N. et al. «Learning to summarize from human feedback». *arXiv:2009.01325*, 2020. <a href="https://arxiv.org/abs/2009.01325" class="external autonumber" rel="nofollow">[४]</a></span>
5.  <span id="cite_note-ouyang_2022-5">↑ <sup>[5.0](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_ref-ouyang_2022_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_ref-ouyang_2022_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_ref-ouyang_2022_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_ref-ouyang_2022_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_ref-ouyang_2022_5-4)</sup> Ouyang, L. et al. «Training language models to follow instructions with human feedback». *arXiv:2203.02155*, 2022. <a href="https://arxiv.org/abs/2203.02155" class="external autonumber" rel="nofollow">[५]</a></span>
6.  <span id="cite_note-chatgpt_intro-6">↑ <sup>[6.0](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_ref-chatgpt_intro_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_ref-chatgpt_intro_6-1)</sup> «Introducing ChatGPT». *OpenAI*, 2022. <a href="https://openai.com/index/chatgpt/" class="external autonumber" rel="nofollow">[६]</a></span>
7.  <span id="cite_note-glaese_2022-7">[↑](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_ref-glaese_2022_7-0) Glaese, A. et al. «Improving alignment of dialogue agents via targeted human judgements». *arXiv:2209.14375*, 2022. <a href="https://arxiv.org/abs/2209.14375" class="external autonumber" rel="nofollow">[७]</a></span>
8.  <span id="cite_note-openai_aligning-8">[↑](https://systems-analysis.info/int/Reinforcement_learning_from_human_feedback_(RLHF)_(HI)#cite_ref-openai_aligning_8-0) «Aligning language models to follow instructions». *OpenAI*. <a href="https://openai.com/index/instruction-following/" class="external autonumber" rel="nofollow">[८]</a></span>
