---
title: "Self-Refine Prompting (BN)"
source: "https://systems-analysis.info/int/Self-Refine_Prompting_(BN)"
wiki: "systems-analysis.info/int"
article: "Self-Refine_Prompting_(BN)"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Prompt engineering"
revision_id: 6606
wiki_created_at: 2026-09-07T00:07:32Z
wiki_modified_at: 2026-09-07T00:07:32Z
downloaded_at: 2026-09-07T23:14:48Z
---

# Self-Refine Prompting (BN)

**Self-Refine** (**স্ব-পরিমার্জন** বা **স্ব-সংশোধন**) — এটি prompt engineering-এর একটি পদ্ধতি, যা বৃহৎ ভাষা মডেলগুলিকে (LLM) নিজস্ব প্রতিক্রিয়ার ভিত্তিতে পুনরাবৃত্তিমূলকভাবে উৎপন্ন উত্তর উন্নত করতে সক্ষম করে<sup>[\[1\]](https://systems-analysis.info/int/Self-Refine_Prompting_(BN)#cite_note-madaan2023-1)</sup>। এই ধারণাটি ২০২৩ সালে আমান মাদাআনের নেতৃত্বে একদল গবেষক প্রস্তাব করেছিলেন এবং এটি এই পর্যবেক্ষণের উপর ভিত্তি করে গড়ে উঠেছে যে, মানুষের মতোই ভাষা মডেলগুলি সবসময় প্রথম প্রচেষ্টায় সর্বোত্তম ফলাফল তৈরি করে না।

এই পদ্ধতিতে একই LLM ক্রমানুসারে তিনটি ভূমিকা পালন করে:

1.  **জেনারেটর (Generator)**: অনুরোধের জন্য একটি প্রাথমিক খসড়া উত্তর তৈরি করে।
2.  **সমালোচক (Feedback)**: নিজের উত্তর মূল্যায়ন করে এবং গঠনমূলক প্রতিক্রিয়া প্রদান করে।
3.  **সম্পাদক (Refiner)**: উত্তরের উন্নত সংস্করণ তৈরি করতে এই প্রতিক্রিয়া ব্যবহার করে।

এই পুনরাবৃত্তিমূলক চক্র «উৎপাদন → প্রতিক্রিয়া → উন্নয়ন» প্রয়োজনীয় মান অর্জিত না হওয়া বা থামার শর্ত পূরণ না হওয়া পর্যন্ত একাধিকবার পুনরাবৃত্তি করা যায়।

গুরুত্বপূর্ণ বিষয় হলো, Self-Refine-এর জন্য মডেলের অতিরিক্ত প্রশিক্ষণ, fine-tuning বা বাহ্যিক ডেটার প্রয়োজন নেই — সম্পূর্ণ প্রক্রিয়াটি inference পর্যায়ে শুধুমাত্র prompt-এর মাধ্যমে পরিচালিত হয়<sup>[\[1\]](https://systems-analysis.info/int/Self-Refine_Prompting_(BN)#cite_note-madaan2023-1)</sup>।

## মেকানিজম বাস্তবায়ন

Self-Refine পদ্ধতি বিশেষভাবে নির্মিত prompt-এর একটি ক্রমানুসারের মাধ্যমে বাস্তবায়িত হয়, যা মডেলের আচরণ নির্দেশ করে।

1.  **প্রাথমিক উৎপাদন**। মডেলটি মূল prompt গ্রহণ করে এবং একটি খসড়া উত্তর তৈরি করে।
2.  **প্রতিক্রিয়া তৈরি**। মডেলটি তার আগের উত্তর বিশ্লেষণ করতে এবং এতে দুর্বলতাগুলি চিহ্নিত করতে নির্দেশনা পায়। উদাহরণস্বরূপ, এটি উল্লেখ করতে পারে যে উত্তরটি যথেষ্ট বিস্তারিত নয় বা এতে যৌক্তিক ত্রুটি রয়েছে। ফলাফল হলো সুনির্দিষ্ট মন্তব্য ও সুপারিশ সহ একটি পাঠ্য প্রতিক্রিয়া।
3.  **পুনরাবৃত্তিমূলক উন্নয়ন**। মডেলটি নতুন prompt হিসেবে মূল অনুরোধ, তার প্রাথমিক উত্তর এবং উৎপন্ন প্রতিক্রিয়া গ্রহণ করে। এর ভিত্তিতে এটি উত্তরের একটি উন্নত সংস্করণ তৈরি করে।

এই দ্বি-পদক্ষেপের «সমালোচনা → সম্পাদনা» চক্র একাধিকবার সম্পাদন করা যায়। প্রতিটি নতুন পুনরাবৃত্তির প্রসঙ্গে আগের উত্তরের সংস্করণ এবং মন্তব্যগুলি অন্তর্ভুক্ত করা হয়, যা মডেলকে ভুলের পুনরাবৃত্তি এড়াতে সাহায্য করে<sup>[\[2\]](https://systems-analysis.info/int/Self-Refine_Prompting_(BN)#cite_note-selfrefine_info-2)</sup>। মডেলের আচরণ নিয়ন্ত্রণ করতে প্রায়ই few-shot prompting কৌশল ব্যবহার করা হয়, যেখানে prompt-এ কাঙ্ক্ষিত প্রতিক্রিয়া বিন্যাস এবং সংশোধনের উদাহরণ অন্তর্ভুক্ত থাকে।

## কার্যকারিতা ও প্রয়োগ

Self-Refine পদ্ধতি এমন বেশ কিছু কাজে তার কার্যকারিতা প্রমাণ করেছে যেগুলোতে বারবার পরিমার্জনের প্রয়োজন হয়, যেমন:

- কথোপকথনের উত্তর তৈরি।
- সৃজনশীল গল্পের ধারাবাহিকতা।
- ধাপে ধাপে যুক্তির মাধ্যমে গণিতের সমস্যা সমাধান।
- প্রোগ্রাম কোড অপ্টিমাইজেশন।

মূল গবেষণায় Self-Refine ব্যবহার করে প্রাপ্ত উত্তরগুলি গড়ে **~২০%** বেশি পছন্দনীয় ছিল মানুষের মূল্যায়ন এবং স্বয়ংক্রিয় metric অনুসারে একক-পদক্ষেপের উৎপাদনের তুলনায়<sup>[\[1\]](https://systems-analysis.info/int/Self-Refine_Prompting_(BN)#cite_note-madaan2023-1)</sup>। GPT-4-এর মতো সবচেয়ে আধুনিক মডেলগুলির ক্ষেত্রেও উন্নতি অর্জিত হয়েছিল, যা ইঙ্গিত করে যে শক্তিশালী LLM-গুলিরও প্রায়ই নিজেদের ভুল সংশোধনের জন্য কেবল একটি অতিরিক্ত চিন্তার পদক্ষেপের প্রয়োজন।

অনুরূপ পদ্ধতি, যেমন **RCI** (Recursive Criticism and Improvement), ইন্টারেক্টিভ কাজেও উচ্চ কার্যকারিতা প্রদর্শন করেছে, উদাহরণস্বরূপ কম্পিউটার নিয়ন্ত্রণ এবং যৌক্তিক সমস্যা সমাধানে। RCI-কে Chain-of-Thought কৌশলের সাথে একত্রিত করা একটি সমন্বয়মূলক প্রভাব তৈরি করেছে, যা স্ব-যাচাইয়ের অন্তর্নির্মিত পদক্ষেপের মাধ্যমে জটিল সমস্যা সমাধানে মডেলের সক্ষমতা লক্ষণীয়ভাবে উন্নত করেছে<sup>[\[3\]](https://systems-analysis.info/int/Self-Refine_Prompting_(BN)#cite_note-kim2023_rci-3)</sup>।

## সীমাবদ্ধতা ও বর্তমান গবেষণা

আশাব্যঞ্জক সাফল্য সত্ত্বেও, গবেষণা দেখায় যে স্ব-পুনরাবৃত্তিমূলক উন্নয়নের বেশ কিছু সীমাবদ্ধতা রয়েছে।

- **স্ব-পক্ষপাত (self-bias)**: মডেলগুলির নিজেদের উত্তর নিরপেক্ষভাবে বিচার করতে অসুবিধা হয়। LLM-গুলি নিজের তৈরি পাঠ্যকে অনুকূলভাবে দেখার এবং এটিকে অপর্যাপ্তভাবে সমালোচনামূলকভাবে মূল্যায়ন করার প্রবণতা রাখে, যা কয়েকটি পুনরাবৃত্তির পরে স্থবিরতা বা এমনকি গুণমান হ্রাসের দিকে নিয়ে যেতে পারে<sup>[\[4\]](https://systems-analysis.info/int/Self-Refine_Prompting_(BN)#cite_note-huang2023-4)</sup>।
- **অতিরিক্ত আত্মবিশ্বাস**: লক্ষ্য করা গেছে যে স্ব-সংশোধনের পুনরাবৃত্তি সংখ্যা বাড়ার সাথে সাথে মডেলটি তার উত্তরে অতিরিক্ত আত্মবিশ্বাসী হয়ে পড়তে পারে, এমনকি যদি সেগুলি আরও সঠিক না হয়। এটি *Expected Calibration Error (ECE)* — মডেলের আত্মবিশ্বাস এবং প্রকৃত নির্ভুলতার মধ্যে বিচ্যুতি — সূচকের বৃদ্ধির দিকে নিয়ে যায়<sup>[\[5\]](https://systems-analysis.info/int/Self-Refine_Prompting_(BN)#cite_note-zhu2025_calibration-5)</sup>।
- **গণনামূলক ব্যয়**: পদ্ধতিটির জন্য একটি চূড়ান্ত উত্তর পেতে LLM-এ একাধিক অনুরোধ প্রয়োজন, যা একক-পাস উৎপাদনের তুলনায় বিলম্ব এবং ব্যয় উল্লেখযোগ্যভাবে বৃদ্ধি করে।

বর্তমান গবেষণা এই সমস্যাগুলি সমাধানের লক্ষ্যে পরিচালিত হচ্ছে। একটি দিক হলো প্রতিটি পুনরাবৃত্তির পদক্ষেপে আত্মবিশ্বাস ক্যালিব্রেশন প্রক্রিয়া প্রবর্তন করা। আরেকটি দিক হলো আরও বস্তুনিষ্ঠ স্ব-মূল্যায়নের জন্য বাহ্যিক তথ্য উৎস বা সরঞ্জাম (যেমন কোড নির্বাহ, ডেটা অনুসন্ধান) সংযুক্ত করা<sup>[\[6\]](https://systems-analysis.info/int/Self-Refine_Prompting_(BN)#cite_note-beyond_accuracy_study-6)</sup>।

## অন্যান্য কৌশলের সাথে তুলনা

- **Chain-of-Thought (CoT)**: CoT উত্তরে পৌঁছানোর জন্য একটি রৈখিক যুক্তিশৃঙ্খল তৈরির উপর মনোযোগ দেয়। Self-Refine, পক্ষান্তরে, ইতোমধ্যে উৎপন্ন উত্তরের (যাতে CoT অন্তর্ভুক্ত থাকতে পারে) পুনরাবৃত্তিমূলক উন্নয়নের উপর মনোযোগ দেয়।
- **Tree of Thoughts (ToT)**: ToT একটি বৃক্ষের আকারে একাধিক সমান্তরাল যুক্তির পথ অন্বেষণ করে, যেখানে Self-Refine একটি পথ পুনরাবৃত্তিমূলকভাবে উন্নত করে। ToT হলো সমাধান স্থান অন্বেষণের কৌশল, আর Self-Refine হলো একটি নির্দিষ্ট সমাধান অপ্টিমাইজেশনের কৌশল।

## তথ্যসূত্র

- Self-Refine প্রকল্পের অফিসিয়াল ওয়েবসাইট
- মূল বৈজ্ঞানিক নিবন্ধ "Self-Refine: Iterative Refinement with Self-Feedback"

## সাহিত্য

- Madaan, A. et al. (2023). *Self-Refine: Iterative Refinement with Self-Feedback*. arXiv:2303.17651.
- Kim, G. et al. (2023). *Language Models Can Solve Computer Tasks*. arXiv:2303.17491.
- Gou, Z. et al. (2023). *CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing*. arXiv:2305.11738.
- Huang, J. et al. (2023). *Large Language Models Cannot Self-Correct Reasoning Yet*. arXiv:2310.01798.
- Pan, L. et al. (2023). *Automatically Correcting Large Language Models: Surveying the Landscape of Diverse Self-Correction Strategies*. arXiv:2308.03188.
- Jiang, C. et al. (2024). *Importance Weighting Can Help Large Language Models Self-Improve*. arXiv:2408.09849.
- Liang, X. et al. (2024). *Internal Consistency and Self-Feedback in Large Language Models: A Survey*. arXiv:2407.14507.
- Zhu, D. et al. (2025). *Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models*. arXiv:2504.02902.
- Hao, Q. et al. (2025). *RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning*. arXiv:2505.14140.
- Cui, Y. et al. (2023). *Check Your Facts and Try Again: Improving Large Language Models by Reducing Hallucination*. arXiv:2302.12813.
- Wei, Z. et al. (2024). *ReSearch: Iterative Self-Reflection for Better LLM Calibration*. arXiv:2405.13022.

## টীকা

1.  <span id="cite_note-madaan2023-1">↑ <sup>[1.0](https://systems-analysis.info/int/Self-Refine_Prompting_(BN)#cite_ref-madaan2023_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Self-Refine_Prompting_(BN)#cite_ref-madaan2023_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Self-Refine_Prompting_(BN)#cite_ref-madaan2023_1-2)</sup> Madaan, Aman; et al. «Self-Refine: Iterative Refinement with Self-Feedback». *arXiv*. <a href="https://arxiv.org/abs/2303.17651" class="external autonumber" rel="nofollow">[১]</a></span>
2.  <span id="cite_note-selfrefine_info-2">[↑](https://systems-analysis.info/int/Self-Refine_Prompting_(BN)#cite_ref-selfrefine_info_2-0) «Self-Refine: Iterative Refinement with Self-Feedback». *Официальный сайт проекта*. <a href="https://selfrefine.info/" class="external autonumber" rel="nofollow">[২]</a></span>
3.  <span id="cite_note-kim2023_rci-3">[↑](https://systems-analysis.info/int/Self-Refine_Prompting_(BN)#cite_ref-kim2023_rci_3-0) Kim, Geunwoo; et al. «Language Models can Solve Computer Tasks». *arXiv*. <a href="https://arxiv.org/abs/2303.17491" class="external autonumber" rel="nofollow">[৩]</a></span>
4.  <span id="cite_note-huang2023-4">[↑](https://systems-analysis.info/int/Self-Refine_Prompting_(BN)#cite_ref-huang2023_4-0) Huang, Jie; et al. «Large Language Models Cannot Self-Correct Reasoning Yet». *arXiv*. <a href="https://arxiv.org/abs/2310.08118" class="external autonumber" rel="nofollow">[৪]</a></span>
5.  <span id="cite_note-zhu2025_calibration-5">[↑](https://systems-analysis.info/int/Self-Refine_Prompting_(BN)#cite_ref-zhu2025_calibration_5-0) Zhu, D., et al. (2025). «Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models». *arXiv*. <a href="https://arxiv.org/html/2504.02902v1" class="external autonumber" rel="nofollow">[৫]</a></span>
6.  <span id="cite_note-beyond_accuracy_study-6">[↑](https://systems-analysis.info/int/Self-Refine_Prompting_(BN)#cite_ref-beyond_accuracy_study_6-0) «Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models». *arXiv*. <a href="https://arxiv.org/html/2504.02902v1" class="external autonumber" rel="nofollow">[৬]</a></span>
