---
title: "Self-Refine Prompting (HI)"
source: "https://systems-analysis.info/int/Self-Refine_Prompting_(HI)"
wiki: "systems-analysis.info/int"
article: "Self-Refine_Prompting_(HI)"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Prompt engineering"
revision_id: 6614
wiki_created_at: 2026-09-07T00:07:42Z
wiki_modified_at: 2026-09-07T00:07:42Z
downloaded_at: 2026-09-07T23:14:50Z
---

# Self-Refine Prompting (HI)

**Self-Refine** (**स्व-परिष्करण** या **स्व-सुधार**) — यह prompt engineering के क्षेत्र में एक ऐसा दृष्टिकोण है जो बड़े भाषा मॉडलों (LLM) को अपनी स्वयं की प्रतिक्रिया के आधार पर उत्पन्न उत्तर को पुनरावृत्तिपूर्ण रूप से बेहतर बनाने की अनुमति देता है<sup>[\[1\]](https://systems-analysis.info/int/Self-Refine_Prompting_(HI)#cite_note-madaan2023-1)</sup>। यह विचार 2023 में अमान मदान के नेतृत्व में शोधकर्ताओं के एक समूह द्वारा प्रस्तावित किया गया था और इस अवलोकन पर आधारित है कि मनुष्य की तरह ही, भाषा मॉडल भी हमेशा पहली बार में सर्वोत्तम परिणाम नहीं देते।

इस विधि में एक ही LLM क्रमिक रूप से तीन भूमिकाएँ निभाती है:

1.  **जनरेटर (Generator)**: अनुरोध के लिए प्रारंभिक मसौदा उत्तर तैयार करती है।
2.  **आलोचक (Feedback)**: अपने ही उत्तर का मूल्यांकन करती है और रचनात्मक प्रतिक्रिया प्रदान करती है।
3.  **संपादक (Refiner)**: उत्तर का बेहतर संस्करण बनाने के लिए इस प्रतिक्रिया का उपयोग करती है।

"उत्पन्न करना → प्रतिक्रिया → सुधार" का यह पुनरावृत्तिपूर्ण चक्र कई बार दोहराया जा सकता है जब तक कि आवश्यक गुणवत्ता प्राप्त न हो जाए या रुकने की शर्त पूरी न हो जाए।

महत्वपूर्ण बात यह है कि Self-Refine को मॉडल के अतिरिक्त प्रशिक्षण, fine-tuning या बाहरी डेटा की आवश्यकता नहीं होती — पूरी प्रक्रिया केवल inference चरण पर prompt के माध्यम से नियंत्रित होती है<sup>[\[1\]](https://systems-analysis.info/int/Self-Refine_Prompting_(HI)#cite_note-madaan2023-1)</sup>।

## तंत्र कार्यान्वयन

Self-Refine विधि को विशेष रूप से निर्मित prompt की एक श्रृंखला के माध्यम से लागू किया जाता है जो मॉडल के व्यवहार को निर्देशित करती है।

1.  **प्रारंभिक उत्पादन**। मॉडल को मूल prompt प्राप्त होती है और वह एक मसौदा उत्तर उत्पन्न करती है।
2.  **प्रतिक्रिया निर्माण**। मॉडल को अपने पिछले उत्तर का विश्लेषण करने और उसमें कमियाँ पहचानने का निर्देश मिलता है। उदाहरण के लिए, वह यह नोट कर सकती है कि उत्तर पर्याप्त विस्तृत नहीं है या उसमें तार्किक त्रुटि है। परिणाम विशिष्ट टिप्पणियों और सुझावों के साथ पाठ्य प्रतिक्रिया होती है।
3.  **पुनरावृत्तिपूर्ण सुधार**। मॉडल को नई prompt के रूप में मूल अनुरोध, उसका प्रारंभिक उत्तर और उत्पन्न प्रतिक्रिया प्राप्त होती है। इसके आधार पर वह उत्तर का एक बेहतर संस्करण बनाती है।

"आलोचना → संशोधन" का यह दो-चरणीय चक्र कई बार निष्पादित किया जा सकता है। प्रत्येक नई पुनरावृत्ति के संदर्भ में पिछले उत्तरों के संस्करण और टिप्पणियाँ शामिल होती हैं, जो मॉडल को गलतियों को दोहराने से बचने में मदद करती हैं<sup>[\[2\]](https://systems-analysis.info/int/Self-Refine_Prompting_(HI)#cite_note-selfrefine_info-2)</sup>। मॉडल के व्यवहार को नियंत्रित करने के लिए अक्सर *few-shot prompting* तकनीकों का उपयोग किया जाता है, जहाँ prompt में वांछित प्रतिक्रिया प्रारूप और सुधारों के उदाहरण शामिल होते हैं।

## प्रभावशीलता और अनुप्रयोग

Self-Refine विधि ने कई ऐसे कार्यों में अपनी प्रभावशीलता प्रदर्शित की है जिनमें बार-बार परिष्करण की आवश्यकता होती है, जैसे:

- संवाद उत्तरों का उत्पादन।
- कहानी की रचनात्मक निरंतरता।
- चरण-दर-चरण तर्क के साथ गणितीय समस्याओं का समाधान।
- प्रोग्राम कोड का अनुकूलन।

मूल शोध में Self-Refine के माध्यम से प्राप्त उत्तर, एकल-चरण उत्पादन की तुलना में मनुष्यों और स्वचालित मेट्रिक्स के मूल्यांकन के अनुसार औसतन **~20%** अधिक बेहतर पाए गए<sup>[\[1\]](https://systems-analysis.info/int/Self-Refine_Prompting_(HI)#cite_note-madaan2023-1)</sup>। GPT-4 जैसे अत्यंत आधुनिक मॉडलों के लिए भी सुधार प्राप्त हुआ, जो यह संकेत देता है कि शक्तिशाली LLM को भी अक्सर अपनी गलतियों को सुधारने के लिए केवल एक अतिरिक्त चिंतन चरण की आवश्यकता होती है।

**RCI** (Recursive Criticism and Improvement) जैसे समान दृष्टिकोणों ने भी संवादात्मक कार्यों में, उदाहरण के लिए कंप्यूटर नियंत्रण और तार्किक समस्याओं के समाधान में, उच्च प्रभावशीलता दिखाई। RCI को Chain-of-Thought तकनीक के साथ संयोजित करने से एक तालमेलपूर्ण प्रभाव उत्पन्न हुआ जिसने एकीकृत स्व-जाँच चरण के कारण जटिल समस्याओं को हल करने की मॉडल की क्षमता में उल्लेखनीय सुधार किया<sup>[\[3\]](https://systems-analysis.info/int/Self-Refine_Prompting_(HI)#cite_note-kim2023_rci-3)</sup>।

## सीमाएँ और वर्तमान शोध

उत्साहजनक सफलताओं के बावजूद, शोध से पता चलता है कि स्व-पुनरावृत्तिपूर्ण सुधार में कुछ सीमाएँ हैं।

- **स्व-पूर्वाग्रह (self-bias)**: मॉडलों को अपने ही उत्तरों का निष्पक्ष मूल्यांकन करने में कठिनाई होती है। LLM अपने स्वयं के उत्पन्न पाठ को अनुकूल रूप से देखते हैं और उसका पर्याप्त आलोचनात्मक मूल्यांकन नहीं करते, जिससे कई पुनरावृत्तियों के बाद ठहराव या यहाँ तक कि गुणवत्ता में गिरावट आ सकती है<sup>[\[4\]](https://systems-analysis.info/int/Self-Refine_Prompting_(HI)#cite_note-huang2023-4)</sup>।
- **अत्यधिक आत्मविश्वास**: यह देखा गया है कि स्व-सुधार पुनरावृत्तियों की संख्या बढ़ने के साथ, मॉडल अपने उत्तरों में अत्यधिक आत्मविश्वास प्राप्त कर सकता है, भले ही वे अधिक सटीक न हुए हों। इससे *Expected Calibration Error (ECE)* — मॉडल के आत्मविश्वास और वास्तविक सटीकता के बीच असंगति — में वृद्धि होती है<sup>[\[5\]](https://systems-analysis.info/int/Self-Refine_Prompting_(HI)#cite_note-zhu2025_calibration-5)</sup>।
- **कम्प्यूटेशनल लागत**: इस विधि के लिए एक अंतिम उत्तर प्राप्त करने के लिए LLM से कई बार अनुरोध की आवश्यकता होती है, जो एकल-पास उत्पादन की तुलना में विलंब और लागत को काफी बढ़ा देती है।

वर्तमान शोध इन समस्याओं के समाधान की दिशा में केंद्रित है। एक दिशा है — प्रत्येक पुनरावृत्ति चरण पर आत्मविश्वास अंशांकन तंत्र का कार्यान्वयन। दूसरी दिशा है — अधिक वस्तुनिष्ठ स्व-मूल्यांकन के लिए बाहरी सूचना स्रोतों या उपकरणों (उदाहरण के लिए, कोड निष्पादन, डेटा खोज) को शामिल करना<sup>[\[6\]](https://systems-analysis.info/int/Self-Refine_Prompting_(HI)#cite_note-beyond_accuracy_study-6)</sup>।

## अन्य तकनीकों के साथ तुलना

- **Chain-of-Thought (CoT)**: CoT उत्तर तक पहुँचने के लिए रैखिक तर्क श्रृंखला उत्पन्न करने पर ध्यान केंद्रित करता है। Self-Refine, बदले में, पहले से उत्पन्न उत्तर (जिसमें CoT शामिल हो सकता है) के पुनरावृत्तिपूर्ण सुधार पर ध्यान केंद्रित करता है।
- **Tree of Thoughts (ToT)**: ToT वृक्ष के रूप में कई समानांतर तर्क पथों की खोज करता है, जबकि Self-Refine एक पथ को पुनरावृत्तिपूर्ण रूप से बेहतर बनाता है। ToT समाधान स्थान की खोज की तकनीक है, जबकि Self-Refine किसी विशिष्ट समाधान के अनुकूलन की तकनीक है।

## संदर्भ

- Self-Refine परियोजना की आधिकारिक वेबसाइट
- मूल वैज्ञानिक लेख "Self-Refine: Iterative Refinement with Self-Feedback"

## साहित्य

- Madaan, A. et al. (2023). *Self-Refine: Iterative Refinement with Self-Feedback*. arXiv:2303.17651.
- Kim, G. et al. (2023). *Language Models Can Solve Computer Tasks*. arXiv:2303.17491.
- Gou, Z. et al. (2023). *CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing*. arXiv:2305.11738.
- Huang, J. et al. (2023). *Large Language Models Cannot Self-Correct Reasoning Yet*. arXiv:2310.01798.
- Pan, L. et al. (2023). *Automatically Correcting Large Language Models: Surveying the Landscape of Diverse Self-Correction Strategies*. arXiv:2308.03188.
- Jiang, C. et al. (2024). *Importance Weighting Can Help Large Language Models Self-Improve*. arXiv:2408.09849.
- Liang, X. et al. (2024). *Internal Consistency and Self-Feedback in Large Language Models: A Survey*. arXiv:2407.14507.
- Zhu, D. et al. (2025). *Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models*. arXiv:2504.02902.
- Hao, Q. et al. (2025). *RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning*. arXiv:2505.14140.
- Cui, Y. et al. (2023). *Check Your Facts and Try Again: Improving Large Language Models by Reducing Hallucination*. arXiv:2302.12813.
- Wei, Z. et al. (2024). *ReSearch: Iterative Self-Reflection for Better LLM Calibration*. arXiv:2405.13022.

## टिप्पणियाँ

1.  <span id="cite_note-madaan2023-1">↑ <sup>[1.0](https://systems-analysis.info/int/Self-Refine_Prompting_(HI)#cite_ref-madaan2023_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Self-Refine_Prompting_(HI)#cite_ref-madaan2023_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Self-Refine_Prompting_(HI)#cite_ref-madaan2023_1-2)</sup> Madaan, Aman; et al. «Self-Refine: Iterative Refinement with Self-Feedback». *arXiv*. <a href="https://arxiv.org/abs/2303.17651" class="external autonumber" rel="nofollow">[१]</a></span>
2.  <span id="cite_note-selfrefine_info-2">[↑](https://systems-analysis.info/int/Self-Refine_Prompting_(HI)#cite_ref-selfrefine_info_2-0) «Self-Refine: Iterative Refinement with Self-Feedback». *Официальный сайт проекта*. <a href="https://selfrefine.info/" class="external autonumber" rel="nofollow">[२]</a></span>
3.  <span id="cite_note-kim2023_rci-3">[↑](https://systems-analysis.info/int/Self-Refine_Prompting_(HI)#cite_ref-kim2023_rci_3-0) Kim, Geunwoo; et al. «Language Models can Solve Computer Tasks». *arXiv*. <a href="https://arxiv.org/abs/2303.17491" class="external autonumber" rel="nofollow">[३]</a></span>
4.  <span id="cite_note-huang2023-4">[↑](https://systems-analysis.info/int/Self-Refine_Prompting_(HI)#cite_ref-huang2023_4-0) Huang, Jie; et al. «Large Language Models Cannot Self-Correct Reasoning Yet». *arXiv*. <a href="https://arxiv.org/abs/2310.08118" class="external autonumber" rel="nofollow">[४]</a></span>
5.  <span id="cite_note-zhu2025_calibration-5">[↑](https://systems-analysis.info/int/Self-Refine_Prompting_(HI)#cite_ref-zhu2025_calibration_5-0) Zhu, D., et al. (2025). «Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models». *arXiv*. <a href="https://arxiv.org/html/2504.02902v1" class="external autonumber" rel="nofollow">[५]</a></span>
6.  <span id="cite_note-beyond_accuracy_study-6">[↑](https://systems-analysis.info/int/Self-Refine_Prompting_(HI)#cite_ref-beyond_accuracy_study_6-0) «Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models». *arXiv*. <a href="https://arxiv.org/html/2504.02902v1" class="external autonumber" rel="nofollow">[६]</a></span>
