Self-Refine Prompting (BN)
Self-Refine (স্ব-পরিমার্জন বা স্ব-সংশোধন) — এটি prompt engineering-এর একটি পদ্ধতি, যা বৃহৎ ভাষা মডেলগুলিকে (LLM) নিজস্ব প্রতিক্রিয়ার ভিত্তিতে পুনরাবৃত্তিমূলকভাবে উৎপন্ন উত্তর উন্নত করতে সক্ষম করে[1]। এই ধারণাটি ২০২৩ সালে আমান মাদাআনের নেতৃত্বে একদল গবেষক প্রস্তাব করেছিলেন এবং এটি এই পর্যবেক্ষণের উপর ভিত্তি করে গড়ে উঠেছে যে, মানুষের মতোই ভাষা মডেলগুলি সবসময় প্রথম প্রচেষ্টায় সর্বোত্তম ফলাফল তৈরি করে না।
এই পদ্ধতিতে একই LLM ক্রমানুসারে তিনটি ভূমিকা পালন করে:
- জেনারেটর (Generator): অনুরোধের জন্য একটি প্রাথমিক খসড়া উত্তর তৈরি করে।
- সমালোচক (Feedback): নিজের উত্তর মূল্যায়ন করে এবং গঠনমূলক প্রতিক্রিয়া প্রদান করে।
- সম্পাদক (Refiner): উত্তরের উন্নত সংস্করণ তৈরি করতে এই প্রতিক্রিয়া ব্যবহার করে।
এই পুনরাবৃত্তিমূলক চক্র «উৎপাদন → প্রতিক্রিয়া → উন্নয়ন» প্রয়োজনীয় মান অর্জিত না হওয়া বা থামার শর্ত পূরণ না হওয়া পর্যন্ত একাধিকবার পুনরাবৃত্তি করা যায়।
গুরুত্বপূর্ণ বিষয় হলো, Self-Refine-এর জন্য মডেলের অতিরিক্ত প্রশিক্ষণ, fine-tuning বা বাহ্যিক ডেটার প্রয়োজন নেই — সম্পূর্ণ প্রক্রিয়াটি inference পর্যায়ে শুধুমাত্র prompt-এর মাধ্যমে পরিচালিত হয়[1]।
মেকানিজম বাস্তবায়ন
Self-Refine পদ্ধতি বিশেষভাবে নির্মিত prompt-এর একটি ক্রমানুসারের মাধ্যমে বাস্তবায়িত হয়, যা মডেলের আচরণ নির্দেশ করে।
- প্রাথমিক উৎপাদন। মডেলটি মূল prompt গ্রহণ করে এবং একটি খসড়া উত্তর তৈরি করে।
- প্রতিক্রিয়া তৈরি। মডেলটি তার আগের উত্তর বিশ্লেষণ করতে এবং এতে দুর্বলতাগুলি চিহ্নিত করতে নির্দেশনা পায়। উদাহরণস্বরূপ, এটি উল্লেখ করতে পারে যে উত্তরটি যথেষ্ট বিস্তারিত নয় বা এতে যৌক্তিক ত্রুটি রয়েছে। ফলাফল হলো সুনির্দিষ্ট মন্তব্য ও সুপারিশ সহ একটি পাঠ্য প্রতিক্রিয়া।
- পুনরাবৃত্তিমূলক উন্নয়ন। মডেলটি নতুন prompt হিসেবে মূল অনুরোধ, তার প্রাথমিক উত্তর এবং উৎপন্ন প্রতিক্রিয়া গ্রহণ করে। এর ভিত্তিতে এটি উত্তরের একটি উন্নত সংস্করণ তৈরি করে।
এই দ্বি-পদক্ষেপের «সমালোচনা → সম্পাদনা» চক্র একাধিকবার সম্পাদন করা যায়। প্রতিটি নতুন পুনরাবৃত্তির প্রসঙ্গে আগের উত্তরের সংস্করণ এবং মন্তব্যগুলি অন্তর্ভুক্ত করা হয়, যা মডেলকে ভুলের পুনরাবৃত্তি এড়াতে সাহায্য করে[2]। মডেলের আচরণ নিয়ন্ত্রণ করতে প্রায়ই few-shot prompting কৌশল ব্যবহার করা হয়, যেখানে prompt-এ কাঙ্ক্ষিত প্রতিক্রিয়া বিন্যাস এবং সংশোধনের উদাহরণ অন্তর্ভুক্ত থাকে।
কার্যকারিতা ও প্রয়োগ
Self-Refine পদ্ধতি এমন বেশ কিছু কাজে তার কার্যকারিতা প্রমাণ করেছে যেগুলোতে বারবার পরিমার্জনের প্রয়োজন হয়, যেমন:
- কথোপকথনের উত্তর তৈরি।
- সৃজনশীল গল্পের ধারাবাহিকতা।
- ধাপে ধাপে যুক্তির মাধ্যমে গণিতের সমস্যা সমাধান।
- প্রোগ্রাম কোড অপ্টিমাইজেশন।
মূল গবেষণায় Self-Refine ব্যবহার করে প্রাপ্ত উত্তরগুলি গড়ে ~২০% বেশি পছন্দনীয় ছিল মানুষের মূল্যায়ন এবং স্বয়ংক্রিয় metric অনুসারে একক-পদক্ষেপের উৎপাদনের তুলনায়[1]। GPT-4-এর মতো সবচেয়ে আধুনিক মডেলগুলির ক্ষেত্রেও উন্নতি অর্জিত হয়েছিল, যা ইঙ্গিত করে যে শক্তিশালী LLM-গুলিরও প্রায়ই নিজেদের ভুল সংশোধনের জন্য কেবল একটি অতিরিক্ত চিন্তার পদক্ষেপের প্রয়োজন।
অনুরূপ পদ্ধতি, যেমন RCI (Recursive Criticism and Improvement), ইন্টারেক্টিভ কাজেও উচ্চ কার্যকারিতা প্রদর্শন করেছে, উদাহরণস্বরূপ কম্পিউটার নিয়ন্ত্রণ এবং যৌক্তিক সমস্যা সমাধানে। RCI-কে Chain-of-Thought কৌশলের সাথে একত্রিত করা একটি সমন্বয়মূলক প্রভাব তৈরি করেছে, যা স্ব-যাচাইয়ের অন্তর্নির্মিত পদক্ষেপের মাধ্যমে জটিল সমস্যা সমাধানে মডেলের সক্ষমতা লক্ষণীয়ভাবে উন্নত করেছে[3]।
সীমাবদ্ধতা ও বর্তমান গবেষণা
আশাব্যঞ্জক সাফল্য সত্ত্বেও, গবেষণা দেখায় যে স্ব-পুনরাবৃত্তিমূলক উন্নয়নের বেশ কিছু সীমাবদ্ধতা রয়েছে।
- স্ব-পক্ষপাত (self-bias): মডেলগুলির নিজেদের উত্তর নিরপেক্ষভাবে বিচার করতে অসুবিধা হয়। LLM-গুলি নিজের তৈরি পাঠ্যকে অনুকূলভাবে দেখার এবং এটিকে অপর্যাপ্তভাবে সমালোচনামূলকভাবে মূল্যায়ন করার প্রবণতা রাখে, যা কয়েকটি পুনরাবৃত্তির পরে স্থবিরতা বা এমনকি গুণমান হ্রাসের দিকে নিয়ে যেতে পারে[4]।
- অতিরিক্ত আত্মবিশ্বাস: লক্ষ্য করা গেছে যে স্ব-সংশোধনের পুনরাবৃত্তি সংখ্যা বাড়ার সাথে সাথে মডেলটি তার উত্তরে অতিরিক্ত আত্মবিশ্বাসী হয়ে পড়তে পারে, এমনকি যদি সেগুলি আরও সঠিক না হয়। এটি Expected Calibration Error (ECE) — মডেলের আত্মবিশ্বাস এবং প্রকৃত নির্ভুলতার মধ্যে বিচ্যুতি — সূচকের বৃদ্ধির দিকে নিয়ে যায়[5]।
- গণনামূলক ব্যয়: পদ্ধতিটির জন্য একটি চূড়ান্ত উত্তর পেতে LLM-এ একাধিক অনুরোধ প্রয়োজন, যা একক-পাস উৎপাদনের তুলনায় বিলম্ব এবং ব্যয় উল্লেখযোগ্যভাবে বৃদ্ধি করে।
বর্তমান গবেষণা এই সমস্যাগুলি সমাধানের লক্ষ্যে পরিচালিত হচ্ছে। একটি দিক হলো প্রতিটি পুনরাবৃত্তির পদক্ষেপে আত্মবিশ্বাস ক্যালিব্রেশন প্রক্রিয়া প্রবর্তন করা। আরেকটি দিক হলো আরও বস্তুনিষ্ঠ স্ব-মূল্যায়নের জন্য বাহ্যিক তথ্য উৎস বা সরঞ্জাম (যেমন কোড নির্বাহ, ডেটা অনুসন্ধান) সংযুক্ত করা[6]।
অন্যান্য কৌশলের সাথে তুলনা
- Chain-of-Thought (CoT): CoT উত্তরে পৌঁছানোর জন্য একটি রৈখিক যুক্তিশৃঙ্খল তৈরির উপর মনোযোগ দেয়। Self-Refine, পক্ষান্তরে, ইতোমধ্যে উৎপন্ন উত্তরের (যাতে CoT অন্তর্ভুক্ত থাকতে পারে) পুনরাবৃত্তিমূলক উন্নয়নের উপর মনোযোগ দেয়।
- Tree of Thoughts (ToT): ToT একটি বৃক্ষের আকারে একাধিক সমান্তরাল যুক্তির পথ অন্বেষণ করে, যেখানে Self-Refine একটি পথ পুনরাবৃত্তিমূলকভাবে উন্নত করে। ToT হলো সমাধান স্থান অন্বেষণের কৌশল, আর Self-Refine হলো একটি নির্দিষ্ট সমাধান অপ্টিমাইজেশনের কৌশল।
তথ্যসূত্র
- Self-Refine প্রকল্পের অফিসিয়াল ওয়েবসাইট
- মূল বৈজ্ঞানিক নিবন্ধ "Self-Refine: Iterative Refinement with Self-Feedback"
সাহিত্য
- Madaan, A. et al. (2023). Self-Refine: Iterative Refinement with Self-Feedback. arXiv:2303.17651.
- Kim, G. et al. (2023). Language Models Can Solve Computer Tasks. arXiv:2303.17491.
- Gou, Z. et al. (2023). CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing. arXiv:2305.11738.
- Huang, J. et al. (2023). Large Language Models Cannot Self-Correct Reasoning Yet. arXiv:2310.01798.
- Pan, L. et al. (2023). Automatically Correcting Large Language Models: Surveying the Landscape of Diverse Self-Correction Strategies. arXiv:2308.03188.
- Jiang, C. et al. (2024). Importance Weighting Can Help Large Language Models Self-Improve. arXiv:2408.09849.
- Liang, X. et al. (2024). Internal Consistency and Self-Feedback in Large Language Models: A Survey. arXiv:2407.14507.
- Zhu, D. et al. (2025). Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models. arXiv:2504.02902.
- Hao, Q. et al. (2025). RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning. arXiv:2505.14140.
- Cui, Y. et al. (2023). Check Your Facts and Try Again: Improving Large Language Models by Reducing Hallucination. arXiv:2302.12813.
- Wei, Z. et al. (2024). ReSearch: Iterative Self-Reflection for Better LLM Calibration. arXiv:2405.13022.
টীকা
- ↑ 1.0 1.1 1.2 Madaan, Aman; et al. «Self-Refine: Iterative Refinement with Self-Feedback». arXiv. [১]
- ↑ «Self-Refine: Iterative Refinement with Self-Feedback». Официальный сайт проекта. [২]
- ↑ Kim, Geunwoo; et al. «Language Models can Solve Computer Tasks». arXiv. [৩]
- ↑ Huang, Jie; et al. «Large Language Models Cannot Self-Correct Reasoning Yet». arXiv. [৪]
- ↑ Zhu, D., et al. (2025). «Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models». arXiv. [৫]
- ↑ «Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models». arXiv. [৬]