Chain-of-Verification (BN)
Chain-of-Verification (CoVe) — এটি একটি পদ্ধতি, যা বৃহৎ ভাষা মডেলগুলিতে (LLM) হ্যালুসিনেশন (তথ্যগতভাবে ভুল কিন্তু বিশ্বাসযোগ্য উত্তর তৈরি) কমানোর জন্য প্রস্তাবিত হয়েছে[1]। এই পদ্ধতিটি Meta AI-এর গবেষকদের একটি দল শেহজাদ ধুলিয়াওয়ালা (Shehzaad Dhuliawala)-এর নেতৃত্বে তৈরি করেছেন এবং «Chain-of-Verification Reduces Hallucination in Large Language Models» (২০২৩) গবেষণাপত্রে উপস্থাপন করেছেন। এটি LLM-এর স্ব-যাচাই এবং স্ব-সংশোধন (self-verification) পদ্ধতির শ্রেণিভুক্ত[2]। CoVe-এর মূল ধারণা হলো বাহ্যিক উৎস ব্যবহার না করে মডেলটি নিজেই ধাপে ধাপে তার তৈরি উত্তর যাচাই করে[2]। এটি সিস্টেমকে উত্তর উপস্থাপন করার আগে আত্মবিশ্লেষণ এবং নিজের ভুল সংশোধনে আরও বেশি «বিচারবুদ্ধিসম্পন্ন» প্রচেষ্টা ব্যয় করতে অনুপ্রাণিত করে[2]।
পটভূমি: ভাষা মডেলে হ্যালুসিনেশন
বৃহৎ ভাষা মডেলগুলি (LLM) প্রায়ই «হ্যালুসিনেশন» ঘটনার শিকার হয় — এমন উত্তর তৈরি করে যা বিশ্বাসযোগ্য দেখায় কিন্তু তথ্যগতভাবে ভুল[3]। এই সমস্যাটি NLP ক্ষেত্রে ব্যাপকভাবে অমীমাংসিত বলে স্বীকৃত: এমনকি আধুনিক মডেলগুলিও উচ্চ আত্মবিশ্বাসের সাথে মিথ্যা তথ্য প্রদান করে ব্যবহারকারীদের বিভ্রান্ত করতে পারে[1]। উদাহরণস্বরূপ, একটি মডেল বিশ্বাসযোগ্যভাবে একটি অস্তিত্বহীন তথ্য «উদ্ভাবন» করতে পারে বা কোনো বিখ্যাত ব্যক্তির জীবনীগত তথ্য গুলিয়ে ফেলতে পারে। যেহেতু বিস্তারিত যাচাই ছাড়া এই ধরনের তথ্যগত ভুলগুলি চিহ্নিত করা কঠিন, তাই গবেষকরা LLM-এর উত্তরে হ্যালুসিনেশন কমানোর পদ্ধতি সক্রিয়ভাবে তৈরি করছেন।
CoVe পদ্ধতির ধাপসমূহ
Chain-of-Verification পদ্ধতিটি চারটি ধারাবাহিক ধাপের মাধ্যমে বাস্তবায়িত হয়[2][2]:
- মূল উত্তর তৈরি। মডেলটি বিশেষ নির্দেশনা ছাড়াই মূল প্রশ্নের উপর প্রাথমিক উত্তর তৈরি করে (উত্তরের মূল অনুকল্প)[3]। এই খসড়া উত্তরটি শুরুর বিন্দু হিসেবে কাজ করে এবং এতে হ্যালুসিনেশন থাকতে পারে, যা পরবর্তী ধাপে চিহ্নিত করতে হবে।
- যাচাইমূলক প্রশ্ন পরিকল্পনা। মূল প্রশ্ন এবং তৈরি উত্তর সামনে রেখে, মডেলটি একটি স্পষ্টীকরণমূলক প্রশ্নের তালিকা তৈরি করে যা মূল উত্তরের দাবিগুলির তথ্যগত সঠিকতা যাচাই করে[3]। এই verification questions উত্তরের মূল তথ্যগুলিকে লক্ষ্য করে এবং সম্ভাব্য ভুল বা অসংগতি চিহ্নিত করতে সাহায্য করে।
- যাচাই সম্পাদন (ভেরিফিকেশন)। এরপর মডেলটি ধারাবাহিকভাবে এবং স্বাধীনভাবে প্রতিটি যাচাইমূলক প্রশ্নের উত্তর দেয়, পক্ষপাত এড়াতে প্রাথমিক উত্তরের উপর নির্ভর না করার চেষ্টা করে[3]। প্রাপ্ত উত্তরগুলি মূল উত্তরের সাথে তুলনা করা হয় বিরোধ বা ভুল চিহ্নিত করতে: এইভাবে মূল উত্তরের সেই অংশগুলি চিহ্নিত হয় যা তথ্য দ্বারা সমর্থিত নয়।
- চূড়ান্ত উত্তর গঠন। অবশেষে, পাওয়া অসংগতিগুলির ভিত্তিতে মডেলটি একটি সংশোধিত চূড়ান্ত উত্তর তৈরি করে[3]। এই উত্তরে যাচাইয়ের ফলাফল বিবেচনা করে সংশোধনগুলি অন্তর্ভুক্ত করা হয়, যা এর তথ্যগত নির্ভুলতা বাড়ায় এবং হ্যালুসিনেশনের সম্ভাবনা কমায়।
এই প্রতিটি ধাপ একই LLM-এ ভিন্ন নির্দেশনা সহ অতিরিক্ত প্রশ্নের মাধ্যমে সম্পাদিত হয়[2]। অর্থাৎ, মডেলটি পর্যায়ক্রমে উত্তরদাতা, তারপর যাচাইকারী (প্রশ্ন তৈরি করে এবং উত্তর দেয়) এবং চূড়ান্ত আউটপুটের সম্পাদকের ভূমিকা পালন করে।
যাচাইয়ের বাস্তবায়নের বৈকল্পিক
পদ্ধতির লেখকরা যাচাই ধাপ বাস্তবায়নের বেশ কয়েকটি পদ্ধতি পরীক্ষা করেছেন, যা যাচাইমূলক প্রশ্ন জিজ্ঞাসা ও উত্তর পাওয়ার পদ্ধতিতে ভিন্ন[2]:
- সম্মিলিত পদ্ধতি (Joint)। মডেলটি একটি মাত্র প্রশ্নের মধ্যে যাচাইমূলক প্রশ্ন এবং সেগুলির উত্তর উভয়ই তৈরি করে। এই বিকল্পটি কম পছন্দনীয়, কারণ মডেলটি তাৎক্ষণিকভাবে উত্তর দেওয়ার সময় তথ্য হ্যালুসিনেট করতে পারে এবং পক্ষপাতের কারণে মূল উত্তরের ভুলগুলি পুনরাবৃত্তি করতে পারে[3]।
- দ্বি-ধাপ পদ্ধতি (2-Step)। যাচাইমূলক প্রশ্নগুলি প্রথমে একটি পৃথক প্রশ্নের মাধ্যমে তৈরি করা হয়, তারপর পরবর্তী প্রশ্নে মডেলটি গঠিত প্রশ্নের তালিকার উত্তর দেয়[3]। ধাপগুলি আলাদা করা প্রশ্ন তৈরির সময় মূল উত্তরের প্রভাব এড়াতে সাহায্য করে।
- পৃথক যাচাই (Factored)। মডেলটি প্রতিটি যাচাইমূলক প্রশ্নের উত্তর আলাদাভাবে দেয়, একাধিক ধারাবাহিক প্রশ্ন ব্যবহার করে (প্রতি প্রশ্নে একটি)[3]। এই পদ্ধতিটি মূল উত্তরের অংশগুলির সরাসরি নকল এড়ায়: যাচাইমূলক প্রশ্নের উত্তরগুলি স্বায়ত্তশাসিতভাবে তৈরি হয়, যা মূল হ্যালুসিনেশনের পুনরাবৃত্তির ঝুঁকি কমায়। এর অসুবিধা হলো বর্ধিত গণনামূলক ব্যয়, কারণ প্রশ্নের সংখ্যার সমানুপাতিকভাবে প্রশ্নের সংখ্যা বাড়ে।
- পুনর্বিবেচনাসহ পৃথক যাচাই (Factored + Revise)। সমস্ত যাচাইমূলক প্রশ্নের উত্তর পাওয়ার পরে মডেলটি একটি অতিরিক্ত তুলনা ও সংশোধন ধাপ সম্পাদন করে। একটি পৃথক প্রশ্নের মাধ্যমে এটি প্রাপ্ত তথ্যগুলিকে মূল উত্তরের সাথে তুলনা করে এবং স্পষ্টভাবে অসংগতিগুলি চিহ্নিত করে, তারপর সংশোধনসহ চূড়ান্ত উত্তর তৈরি করে[3]। এই অতিরিক্ত ধাপটি সিস্টেমকে বিচ্যুতিগুলি আরও মনোযোগ দিয়ে বিশ্লেষণ করতে এবং সংশোধিত তথ্যগুলি চূড়ান্ত আউটপুটে একীভূত করতে বাধ্য করে।
পরীক্ষামূলক ফলাফল
Chain-of-Verification পদ্ধতিটি তথ্যগত নির্ভুলতার প্রতি সংবেদনশীল বেশ কয়েকটি কাজে পরীক্ষিত হয়েছিল[1]। এর মধ্যে ছিল: জ্ঞানভান্ডারের উপর তথ্য তালিকাভুক্তি প্রশ্ন (Wikidata এবং Wikipedia বিভাগগুলির তালিকা), পাঠের বিভিন্ন অংশ থেকে একাধিক উত্তর সহ প্রশ্ন (MultiSpanQA), এবং বিস্তারিত পাঠ্য (যেমন জীবনী) তৈরির কাজ[1]।
ফলাফলগুলি স্ব-যাচাই ছাড়া মূল মডেলগুলির তুলনায় CoVe ব্যবহার করলে সমস্ত ধরনের কাজে হ্যালুসিনেশনের উল্লেখযোগ্য হ্রাস দেখিয়েছে[1]। factored + revise বৈকল্পিকটি বিশেষভাবে কার্যকর হয়েছে — চূড়ান্ত তথ্য যাচাইসহ পৃথক যাচাই। এই পদ্ধতিটি সেরা নির্ভুলতার সূচক দিয়েছে: উদাহরণস্বরূপ, জীবনীমূলক পাঠ্য তৈরির কাজে LLaMA-65B মডেলে (৬৫ বিলিয়ন প্যারামিটারের LLM) CoVe প্রয়োগ এর তথ্যগত মেট্রিক FactScore ~৬৩.৭ থেকে ~৭১.৪ পয়েন্টে বৃদ্ধি করেছে[2]। FactScore-এর এই বৃদ্ধি নির্দেশ করে যে চূড়ান্ত উত্তরগুলিতে আরও বেশি যাচাইকৃত তথ্য এবং কম কাল্পনিক তথ্য রয়েছে।
তদুপরি, যাচাই শৃঙ্খল সংযুক্ত LLM এমনকি কিছু আরও শক্তিশালী বা বিশেষভাবে সজ্জিত সিস্টেমকেও ছাড়িয়ে যেতে সক্ষম হয়েছিল। উদাহরণস্বরূপ, CoVe সহ LLAMA-65B, ChatGPT (OpenAI-এর মডেল) এর চেয়ে বেশি FactScore দেখিয়েছে এবং Perplexity.ai — উত্তরের তথ্যগত সমর্থনের জন্য ইন্টারনেট অনুসন্ধানে সজ্জিত মডেল — কে ছাড়িয়ে গেছে[2]। এটি উল্লেখযোগ্য, কারণ Perplexity তথ্য অনুসন্ধানের জন্য বাহ্যিক উৎস ব্যবহার করে, যেখানে CoVe কেবল মডেলের নিজস্ব যুক্তি এবং স্ব-যাচাই ক্ষমতার উপর নির্ভর করে মানের উন্নতি অর্জন করে[2]। তবে, সবচেয়ে বিরল তথ্যের ক্ষেত্রে (যেখানে নির্দিষ্ট জ্ঞান প্রয়োজন) Perplexity-র মতো retrieval সিস্টেম এখনও সুবিধা ধরে রাখে, তবে বেশিরভাগ প্রশ্নে CoVe আরও নির্ভুল উত্তর দিয়েছে[2]।
সীমাবদ্ধতা এবং সম্ভাবনা
এটি উল্লেখ করা উচিত যে Chain-of-Verification হ্যালুসিনেশনের অনুপাত উল্লেখযোগ্যভাবে কমালেও এই পদ্ধতিটি সেগুলি সম্পূর্ণভাবে দূর করতে সক্ষম নয়। মডেলটি এখনও ভুল করতে পারে যদি যাচাইমূলক প্রশ্নগুলি কোনো ভুল বিস্তারিত তথ্য না ধরে বা যদি LLM নিজেই সঠিক তথ্য না জানে। উপরন্তু, CoVe গণনামূলক বোঝা বাড়ায়: একটি ব্যবহারকারীর প্রশ্নের জন্য মডেলে বেশ কয়েকটি ধারাবাহিক অনুরোধ সম্পাদন করতে হয় (উত্তর তৈরি, প্রশ্ন তৈরি, সেগুলির উত্তর, চূড়ান্ত সংকলন), যেখানে একটি সাধারণ মডেল এক ধাপে উত্তর দেয়[2]। তবুও, লেখকরা দেখান যে মোট ব্যয়ের দিক থেকে CoVe হ্যালুসিনেশন চিহ্নিত করার অন্যান্য বহু-ধাপ পদ্ধতির সাথে তুলনীয় এবং একটি ব্যবহারিক সমাধান হিসেবে রয়ে যায়[2]।
তাদের গবেষণায় Meta AI-এর গবেষকরা পদ্ধতির উন্নতির সম্ভাব্য দিকনির্দেশনা উল্লেখ করেছেন। একটি স্পষ্ট পথ হলো CoVe-কে বাহ্যিক সরঞ্জামের ব্যবহারের সাথে একত্রিত করা, উদাহরণস্বরূপ যাচাই ধাপে ইন্টারনেট অনুসন্ধান বা জ্ঞানভান্ডার মডিউল সংযুক্ত করা[2]। এটি বাইরে থেকে নির্ভরযোগ্য তথ্য পেতে এবং মূল উত্তরের তথ্যগুলি আরও নির্ভরযোগ্যভাবে নিশ্চিত বা খণ্ডন করতে সহায়তা করবে। এইভাবে, Chain-of-Verification আরও দায়িত্বশীল এবং নির্ভুল AI সিস্টেমের দিকে একটি পদক্ষেপ হিসেবে কাজ করে: এটি প্রদর্শন করে যে মডেলকে নিজের উত্তর সমালোচনামূলকভাবে পুনর্বিবেচনা করতে বাধ্য করলে তার মানকে উল্লেখযোগ্যভাবে উন্নত করা যায় এবং তৈরি পাঠ্যে কাল্পনিক তথ্যের প্রসার কমানো যায়[2]।
তথ্যসূত্র
- arXiv-এ মূল গবেষণাপত্র «Chain-of-Verification Reduces Hallucination in Large Language Models»
- ACL Anthology-তে «Chain-of-Verification Reduces Hallucination in Large Language Models» গবেষণাপত্র
- Chain of Verification (CoVe) — Understanding & Implementation — Medium-এ নিবন্ধ
সাহিত্য
- Dhuliawala, S. et al. (2023). Chain-of-Verification Reduces Hallucination in Large Language Models. arXiv:2309.11495.
- Manakul, P. et al. (2023). SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models. arXiv:2303.08896.
- Yang, B. et al. (2025). Hallucination Detection in Large Language Models with Metamorphic Relations. arXiv:2502.15844.
- Liang, X. et al. (2024). Internal Consistency and Self-Feedback in Large Language Models: A Survey. arXiv:2407.14507.
- Lightman, H. et al. (2023). Let's Verify Step by Step. arXiv:2305.20050.
- Ling, Z. et al. (2023). Deductive Verification of Chain-of-Thought Reasoning. arXiv:2306.03872.
- Lyu, Q. et al. (2023). Faithful Chain-of-Thought Reasoning. arXiv:2301.13379.
- Madaan, A. et al. (2023). Self-Refine: Iterative Refinement with Self-Feedback. arXiv:2303.17651.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Wang, X. et al. (2022). Self-Consistency Improves Chain of Thought Reasoning in Language Models. arXiv:2203.11171.
- Yao, S. et al. (2023). Tree of Thoughts: Deliberate Problem Solving with Large Language Models. arXiv:2305.10601.
টীকা
- ↑ 1.0 1.1 1.2 1.3 1.4 Dhuliawala, Shehzaad et al. «Chain-of-Verification Reduces Hallucination in Large Language Models». arXiv. [১]
- ↑ 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 Dhuliawala, Shehzaad et al. «Chain-of-Verification Reduces Hallucination in Large Language Models». ACL Anthology. [২]
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 3.6 3.7 3.8 chowdhury, sourajit roy. «Chain of Verification (CoVe) — Understanding & Implementation». Medium. [৩]