---
title: "Multi-Agent Debate (BN)"
source: "https://systems-analysis.info/int/Multi-Agent_Debate_(BN)"
wiki: "systems-analysis.info/int"
article: "Multi-Agent_Debate_(BN)"
language: "bn"
categories:
  - "Category:AI Agents"
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 4628
wiki_created_at: 2026-09-06T23:37:41Z
wiki_modified_at: 2026-09-06T23:37:41Z
downloaded_at: 2026-09-07T23:03:37Z
---

# Multi-Agent Debate (BN)

**বহু-এজেন্ট বিতর্ক** (ইং. multi-agent debate) – **বৃহৎ ভাষা মডেল** (**LLM**)-এর ক্ষেত্রে একটি পদ্ধতি, যেখানে একাধিক পারস্পরিক-সক্রিয় **এজেন্ট** (ভাষা মডেলের দৃষ্টান্ত) একটি নির্দিষ্ট সমস্যার সমাধান নিয়ে যৌথভাবে আলোচনা করে, যুক্তি ও উত্তরের প্রচেষ্টা বিনিময় করে। এই প্রক্রিয়ার লক্ষ্য হলো প্রদত্ত প্রশ্নের সবচেয়ে সঠিক ও যুক্তিসংগত উত্তর সম্মিলিতভাবে তৈরি করা। পদ্ধতিটি **«মনের সমাজ»** ধারণার উপর ভিত্তি করে, যেখানে বিভিন্ন মডেল একে অপরের সিদ্ধান্ত যাচাই ও পরিপূরণ করে<sup>[\[1\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-composable-llm-debate-1)</sup>। গবেষণায় দেখা গেছে যে বহু-এজেন্ট আলোচনা একটি পদ্ধতিতে উত্তর তৈরির তুলনায় উত্তরের **নির্ভুলতা ও নির্ভরযোগ্যতা উল্লেখযোগ্যভাবে বাড়াতে** সক্ষম: এজেন্টদের বিতর্কের পর প্রাপ্ত চূড়ান্ত উত্তর সাধারণত আরো তথ্যগতভাবে সঠিক এবং যুক্তিতর্ক-প্রয়োজনীয় সমস্যায় আরো ভালো ফলাফল দেয়<sup>[\[1\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-composable-llm-debate-1)</sup>। বিশেষত, এই কৌশল ব্যবহারে **হ্যালুসিনেশন** (অস্তিত্বহীন «তথ্য») হ্রাস পায় এবং জটিল পরীক্ষামূলক সমস্যায় সাফল্য বৃদ্ধি পায়<sup>[\[1\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-composable-llm-debate-1)</sup>।

বিতর্কের জন্য একাধিক AI ব্যবহারের ধারণা কৃত্রিম বুদ্ধিমত্তার নিরাপত্তা-সংক্রান্ত গবেষণায় ফিরে যায়। ২০১৮ সালে OpenAI-এর একদল গবেষক (জি. আরভিং, পি. ক্রিস্টিয়ানো, ডি. আমোদেই) **AI safety via debate** ধারণাটি প্রস্তাব করেন – প্রতিযোগিতামূলক বিতর্কের মাধ্যমে এজেন্টদের প্রশিক্ষণ, যেখানে দুটি মডেল-প্রতিপক্ষ পালাক্রমে সংক্ষিপ্ত যুক্তি উপস্থাপন করে এবং একজন মানব-বিচারক নির্ধারণ করেন কে আরো সত্যিকার ও দরকারী তথ্য উপস্থাপন করেছে<sup>[\[2\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-arxiv-ai-safety-2)</sup>। ধারণা করা হয়েছিল যে সর্বোত্তম কৌশলে এই ধরনের বিতর্ক AI-কে অত্যন্ত জটিল প্রশ্নের উত্তর দিতে সক্ষম করবে, বিচারকের কাছ থেকে কেবল যুক্তির বিশ্বাসযোগ্যতা মূল্যায়নের দাবি রেখে<sup>[\[2\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-arxiv-ai-safety-2)</sup>। পরবর্তী বছরগুলোতে, শক্তিশালী LLM-এর আবির্ভাবের সাথে সাথে মডেলগুলোর মধ্যে বিতর্কের নীতি সরাসরি মডেলের উত্তরের মান উন্নয়নে ব্যবহৃত হতে শুরু করে – ইতোমধ্যে মানুষের বাধ্যতামূলক অংশগ্রহণ ছাড়াই, বরং স্বয়ংক্রিয় সর্বোত্তম সমাধান নির্বাচনের মাধ্যমে। আধুনিক বহু-এজেন্ট LLM-সিস্টেম একে অপরের ভুল সংশোধন করতে এবং যৌথভাবে আরো যুক্তিসংগত ফলাফলে পৌঁছাতে কপি বা বিভিন্ন মডেলের মধ্যে সংলাপ ব্যবহার করে।

## বহু-এজেন্ট আলোচনার পদ্ধতি

বহু-এজেন্ট বিতর্কের দৃশ্যকল্পে একাধিক এজেন্ট-মডেল একই সমস্যায় সমান্তরালভাবে কাজ করে। সাধারণত শুরুতে প্রতিটি এজেন্টকে মূল প্রশ্ন বা সমস্যা প্রদান করা হয়, তারপর প্রতিটি এজেন্ট **স্বাধীনভাবে নিজের উত্তর তৈরি করে**। এরপর এজেন্টদের মধ্যে যোগাযোগের একটি সিরিজ অনুসরণ করে: প্রতিটি রাউন্ডে সমস্ত অংশগ্রহণকারী তাদের বর্তমান সমাধান বিনিময় করে, এবং প্রতিটি এজেন্ট অন্যদের উত্তর অতিরিক্ত প্রসঙ্গ হিসেবে পায়, যার ভিত্তিতে সে পরবর্তী রাউন্ডে **নিজের উত্তর পরিমার্জন বা উন্নত করে**<sup>[\[3\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-arxiv-communication-3)</sup>। এই চক্র কয়েকটি পুনরাবৃত্তি অব্যাহত থাকে (সাধারণত একটি নির্দিষ্ট সংখ্যক রাউন্ড বা স্পষ্ট সম্মতি না পাওয়া পর্যন্ত), তারপর প্রক্রিয়াটি থামে এবং **চূড়ান্ত উত্তর** প্রদান করা হয়। বিতর্ক মানবিক আলোচনার অনুকরণ করে, মডেলগুলোকে একে অপরের উত্তর সমালোচনা করতে এবং সমাধানের মান উন্নয়নে তাদের যুক্তি দক্ষতা সমন্বিত করতে দেয়<sup>[\[3\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-arxiv-communication-3)</sup>। উদাহরণস্বরূপ, **Yilun Du** এবং সহকর্মীরা (MIT এবং Google Brain) পরীক্ষায় একটি ভাষা মডেলের ৩টি দৃষ্টান্ত ব্যবহার করেছিলেন যারা ২টি রাউন্ডে সমস্যাটি নিয়ে আলোচনা করেছিল (সময় ও গণনার খরচের কারণে রাউন্ডের সংখ্যা সীমিত রাখা হয়েছিল); দেখা গেছে যে এমন সীমিত সংলাপেও চূড়ান্ত উত্তরগুলো উল্লেখযোগ্যভাবে ভালো হয়েছে, এবং এজেন্ট বা রাউন্ডের সংখ্যা বাড়ালে নির্ভুলতা ক্রমাগত বাড়তে থাকে (যদিও ক্রমহ্রাসমান প্রতিফলের সাথে)<sup>[\[1\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-composable-llm-debate-1)</sup>।

বহু-এজেন্ট বিতর্কের পদ্ধতিটি সম্পূর্ণরূপে inference পর্যায়ে বিশেষ prompt ব্যবহার করে ইতোমধ্যে প্রশিক্ষিত মডেলগুলোর মধ্যে সংলাপ পরিচালনার জন্য বাস্তবায়িত হয়। এর মানে হলো **পদ্ধতিটি LLM-গুলোর fine-tuning প্রয়োজন করে না** এবং «ব্ল্যাক বক্স»-এ এমনকি প্রয়োগ করা যায় – মডেলের টেক্সট তৈরিতে অ্যাক্সেস থাকা এবং পূর্বনির্ধারিত টেমপ্লেট অনুসারে তাদের যোগাযোগ সমন্বয় করা যথেষ্ট<sup>[\[1\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-composable-llm-debate-1)[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>।

কয়েকটি রাউন্ডের পর চূড়ান্ত উত্তর নির্ধারণে বিভিন্ন পদ্ধতি ব্যবহার করা হয়। সবচেয়ে সহজ প্রক্রিয়াগুলোর একটি হলো **ভোটদান**: এজেন্টরা শেষে স্বাধীনভাবে তাদের চূড়ান্ত সমাধান প্রস্তাব করতে পারে, তারপর সংখ্যাগরিষ্ঠদের দ্বারা সমর্থিত বিকল্প বেছে নেওয়া হয় (অথবা, উদাহরণস্বরূপ, সবচেয়ে বেশিবার উল্লিখিত উত্তর)<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>। আরেকটি পদ্ধতি হলো **ঐকমত্য** দাবি করা, অর্থাৎ সমস্ত মডেল একই উত্তরে না পৌঁছানো পর্যন্ত আলোচনা অব্যাহত রাখা<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>। অবশেষে, একটি পৃথক **বিচারক-এজেন্ট** নিযুক্ত করা যেতে পারে: হয় উত্তর মূল্যায়নে প্রশিক্ষিত একটি পৃথক নিউরাল নেটওয়ার্ক, অথবা সালিশির কার্যক্রম দেওয়া এজেন্টদের একজন। বিচারক আলোচনার গতিপথ পর্যবেক্ষণ করে এবং কার যুক্তি সবচেয়ে বিশ্বাসযোগ্য বা সঠিক ছিল তা বেছে নেয়<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>। সিদ্ধান্ত গ্রহণের প্রক্রিয়া সিস্টেমের বৈশিষ্ট্যগুলোকে প্রভাবিত করে: যেমন, ভোটদান বা ঐকমত্য বাস্তবায়নে সহজ, কিন্তু গোষ্ঠীগত ত্রুটি নির্ধারণ করতে পারে, আর বিচারক-মূল্যায়নকারী (বিশেষত সঠিক উত্তর সনাক্তে প্রশিক্ষিত) তাত্ত্বিকভাবে এজেন্টদের মধ্যে দ্বন্দ্ব থাকলেও সঠিক সমাধান বের করতে সক্ষম। তবে বিচারক পদ্ধতিরও সমস্যা রয়েছে – উদাহরণস্বরূপ, যদি বিচারকের ভূমিকায় অংশগ্রহণকারীদের মতো একই মডেল থাকে, তবে সে অনিচ্ছাকৃতভাবে কোনো একটি এজেন্টের পরিচিত যুক্তি শৈলীর **পক্ষপাত** করতে পারে<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>।

## এজেন্ট ও যোগাযোগ কনফিগারেশনের বৈচিত্র্য

LLM সহ বহু-এজেন্ট সিস্টেম এজেন্টদের গঠন ও মিথস্ক্রিয়া পদ্ধতিতে ভিন্ন হতে পারে। **একজাতীয় কনফিগারেশন** ধরে নেয় যে সমস্ত এজেন্ট একই মডেলের কপি (বা একই স্তরের মডেল), আর **ভিন্নজাতীয়** কনফিগারেশনে বিভিন্ন ধরনের বা আকারের মডেল থাকে। একজাতীয় ক্ষেত্রে সমস্ত অংশগ্রহণকারী তুলনামূলক সক্ষমতা রাখে, এবং তাদের মতবিরোধ কেবল উত্তর তৈরির stochastic প্রকৃতি বা বিভিন্ন প্রারম্ভিক শর্ত (যেমন, prompt-এর পার্থক্য) থেকে উদ্ভূত হবে। ভিন্নজাতীয় পদ্ধতিতে শক্তিশালী ও দুর্বল মডেলগুলো একসাথে ব্যবহার করা যায়, যা সম্ভাব্যভাবে কিছু এজেন্টকে অন্যদের দুর্বলতা পূরণ করতে দেয়। যেমন, গবেষণায় দেখা যায় যে **বিভিন্ন LLM-এর মিথস্ক্রিয়া এমন পরিস্থিতির দিকে নিয়ে যায় যেখানে দুর্বল মডেলগুলো শক্তিশালী মডেলগুলো থেকে feedback পেয়ে তাদের সমাধান উন্নত করে**<sup>[\[3\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-arxiv-communication-3)</sup>। একটি উজ্জ্বল উদাহরণ হলো গণিতের টেক্সট সমস্যা সমাধানে **ChatGPT (GPT-4)** এবং **Google Bard** ভাষা মডেলের মধ্যে যৌথ বিতর্ক: এই প্রতিটি মডেল আলাদাভাবে ভুল উত্তর দিয়েছিল, কিন্তু আলোচনার প্রক্রিয়ায় **তারা একে অপরের ভুলগুলো নির্দেশ করতে এবং প্রতিটির শক্তিশালী দিক ব্যবহার করে সঠিক সমাধানে সম্মত হতে সক্ষম হয়েছিল**<sup>[\[1\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-composable-llm-debate-1)</sup>। একই সময়ে ভিন্নজাতীয়তা ঝুঁকিও বহন করে: সক্ষমতায় উল্লেখযোগ্য ভারসাম্যহীনতা একটি মডেলের আধিপত্য ঘটাতে পারে, এবং যদি বেশিরভাগ এজেন্টের একটি সাধারণ ভ্রান্তি বা ভুল bias থাকে, তাহলে বিতর্ক দ্রুত একটি একক কিন্তু ভুল উত্তরে **অভিসরণ করতে পারে** – এই ঘটনাটি **«প্রতিধ্বনি কক্ষ»** প্রভাব নামে পরিচিত হয়েছে<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>। তাত্ত্বিক বিশ্লেষণ (Estornell & Liu, NeurIPS 2024) দেখিয়েছে যে খুব মিলে-যাওয়া মডেলগুলোর সাথে বিতর্ক স্থির গতিশীলতায় শেষ হতে পারে, যেখানে সমস্ত অংশগ্রহণকারী সংখ্যাগরিষ্ঠের মত পুনরাবৃত্তি করে, এমনকি যদি তা তাদের ডেটার একটি সাধারণ ত্রুটির উপর ভিত্তি করে হয়<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>। তাই ভিন্নজাতীয় সিস্টেমে এজেন্টদের সতর্কভাবে নির্বাচন গুরুত্বপূর্ণ – যেমন, তুলনামূলক জ্ঞান স্তরের মডেলগুলো নির্বাচন করা হয় যাতে কেউ আধিপত্য না করে বা অন্যদের বিভ্রান্ত না করে<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>।

আরেকটি দিক হলো এজেন্টদের মধ্যে **যোগাযোগের কাঠামো**। মূল বাস্তবায়নে **পূর্ণ-সংযুক্ত টপোলজি** ব্যবহার করা হয়: প্রতিটি রাউন্ডে প্রতিটি এজেন্ট অন্য সবার উত্তর পায়। এই «সবার-সাথে-সবার» বিনিময় উপলব্ধ তথ্য সর্বাধিক করে, কিন্তু উল্লেখযোগ্য খরচ তৈরি করে – প্রসঙ্গের পরিমাণ এজেন্টের সংখ্যার সমানুপাতিকভাবে বৃদ্ধি পায়, যা গণনাকে ভারী করে। বিকল্প হলো **বিরল টপোলজি**, যা প্রতিটি এজেন্ট সরাসরি কার সাথে ডেটা বিনিময় করে তা সীমিত করে। উদাহরণস্বরূপ, এজেন্টগুলোকে একটি গ্রাফ-নেটওয়ার্কের (রিং, ট্রি ইত্যাদি) আকারে সাজানো যায়, যেখানে প্রতিটি কেবল তার প্রতিবেশীদের উত্তর পায়। Google-এর গবেষণা (Li et al., 2024) দেখিয়েছে যে **এজেন্ট নেটওয়ার্কের সংযোগ সীমিত করা সম্পূর্ণ সংযুক্ত আলোচনার তুলনায় মান উন্নত না করেই বা কখনো কখনো উন্নত করে তৈরির খরচ উল্লেখযোগ্যভাবে কমাতে পারে**<sup>[\[3\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-arxiv-communication-3)</sup>। GPT-3.5 এবং Mistral মডেলের পরীক্ষায় «প্রতিবেশী» আলোচনার বিরল স্কিম সমস্যায় (গণিত সহ) একই বা উচ্চতর নির্ভুলতা দিয়েছিল, একই সাথে প্রতিটি ধাপে প্রসঙ্গ token-এর গড় সংখ্যা একটি অর্ডার অফ ম্যাগনিচিউড কমিয়েছিল<sup>[\[3\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-arxiv-communication-3)</sup>। এই ফলাফল নির্দেশ করে যে **অতিরিক্ত বার্তা বিনিময় সবসময় প্রয়োজনীয় নয়** – এজেন্টদের মধ্যে মূল মিথস্ক্রিয়াগুলো সঠিকভাবে সংগঠিত করাই যথেষ্ট যাতে তারা কম খরচে সঠিক সমাধানে পৌঁছাতে পারে।

টপোলজির পাশাপাশি, বিভিন্ন **বিতর্ক পরিচালনার বিন্যাস** সম্ভব। উদাহরণস্বরূপ, কিছু এজেন্টকে বিভিন্ন **ভূমিকা** দেওয়া যেতে পারে: কেউ «ধারণা প্রণেতা» হিসেবে কাজ করে, অন্যরা «সমালোচক» বা সমাধান «যাচাইকারী» হিসেবে<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>। এই ভূমিকা-ভিত্তিক পদ্ধতি শ্রম বিভাজন অনুকরণ করার চেষ্টা করে, যেখানে প্রতিটি এজেন্ট একটি নির্দিষ্ট কাজে বিশেষজ্ঞ (যেমন, একজন অনুকল্প প্রস্তাব করে, দ্বিতীয়জন তথ্য যাচাই করে, তৃতীয়জন যৌক্তিক সামঞ্জস্য মূল্যায়ন করে)। আরেকটি বিকল্প হলো **পালাক্রমিক আলোচনা** (round-robin): এজেন্টরা একসাথে নয়, কঠোরভাবে পালাক্রমে কথা বলে, একটি নির্দিষ্ট ক্রমে বক্তা ও প্রতিক্রিয়াকারীর ভূমিকা পরিবর্তন করে<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>। এটি আনুষ্ঠানিক বিতর্কের মতো যেখানে অংশগ্রহণকারীদের নিয়ম অনুযায়ী কথা বলার সুযোগ দেওয়া হয়, যা সমস্ত এজেন্টের সমান অংশগ্রহণ নিশ্চিত করতে পারে। আরেকটি পদ্ধতি হলো **মতবিরোধের গতিশীল নিয়ন্ত্রণ**: সিস্টেম প্রতিটি রাউন্ডে এজেন্টের উত্তরের মধ্যে মতবিরোধের মাত্রা বিশেষভাবে বাড়াতে বা কমাতে পারে<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>। উদাহরণস্বরূপ, প্রাথমিক পর্যায়ে উত্তরগুলো যতটা সম্ভব ভিন্ন হওয়া (বিভিন্ন অনুকল্প কভার করতে) এবং চূড়ান্তের দিকে এগিয়ে যাওয়ার সাথে একত্রিত হওয়াকে উৎসাহিত করা যায়। এই ধরনের প্রক্রিয়া Chang (2024) এর কাজে অকাল সম্মতি প্রতিরোধের জন্য প্রস্তাব করা হয়েছে: এটি এজেন্টদের মধ্যে **মধ্যম স্তরের দ্বন্দ্ব** বজায় রাখে, নতুন যুক্তির উদ্ভব এবং আরো গভীর আলোচনাকে উদ্দীপিত করে<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>।

## পদ্ধতির সুবিধা ও কার্যকারিতা

বহু-এজেন্ট বিতর্ক জটিল সমস্যায় ভাষা মডেলের **ফলাফল উন্নত করার** ক্ষমতার কারণে মনোযোগ আকর্ষণ করেছে। ২০২৩-২০২৪ সালের একাধিক স্বাধীন গবেষণা নিশ্চিত করেছে যে **পারস্পরিক-সক্রিয় LLM-এর একটি গোষ্ঠী একই সমস্যায় কাজ করে একটি একক মডেলের উত্তরের মান ছাড়িয়ে যেতে পারে**। বিশেষত, জটিল যুক্তি প্রয়োজন এমন ক্ষেত্রে উন্নতি দেখানো হয়েছে: গাণিতিক গণনা থেকে শুরু করে প্রোগ্রামিং এবং টেক্সট সারসংক্ষেপ পর্যন্ত। যেমন, Yin এবং সহলেখকরা (2023), Chan এবং সহলেখকরা (2023), Chen এবং সহলেখকরা (2024) এবং অন্যরা উল্লেখ করেন যে বহু-এজেন্ট সিস্টেম গাণিতিক সমস্যা, কোড তৈরি এবং এমনকি নথির সারসংক্ষেপ রচনায় আত্মবিশ্বাসের সাথে একক LLM-কে ছাড়িয়ে যায়<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>। কারণ হলো **দৃষ্টিভঙ্গির বৈচিত্র্য**: প্রতিটি এজেন্ট এমন বিবরণ বা ত্রুটি লক্ষ্য করতে পারে যা অন্যরা মিস করেছে এবং সহকর্মীদের feedback দিতে পারে। পারস্পরিক সমালোচনা এবং বিভিন্ন অনুকল্পের বিনিময় সমস্যার আরো ব্যাপক বিবেচনার দিকে নিয়ে যায়<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>, যার ফলে চূড়ান্ত উত্তর আরো সঠিক ও নির্ভরযোগ্য হয়।

উদাহরণস্বরূপ, Yilun Du-এর নেতৃত্বে MIT এবং Google Brain-এর গবেষকরা ICML 2024-এ «Improving factuality and reasoning in language models through multiagent debate» শিরোনামে একটি গবেষণাপত্র উপস্থাপন করেছেন, যেখানে মডেলের তিনটি দৃষ্টান্তের মধ্যে বিতর্ক যোগ করলে সমাধানের মানের **উল্লেখযোগ্য উন্নতি** প্রদর্শিত হয়<sup>[\[1\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-composable-llm-debate-1)</sup>। তাদের ফলাফল অনুসারে, বহু-এজেন্ট আলোচনার পদ্ধতি একই মডেলের সাধারণ একক ব্যবহারের তুলনায় কিছু সমস্যায় উচ্চতর কার্যক্ষমতা অর্জন করেছে: **গাণিতিক ও কৌশলগত সমস্যার সমাধানের নির্ভুলতা বৃদ্ধি পেয়েছে**, এবং **তথ্যগত ত্রুটির সংখ্যা হ্রাস পেয়েছে**<sup>[\[1\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-composable-llm-debate-1)</sup>। বিশেষত, বহু-এজেন্ট পদ্ধতি গাণিতিক যুক্তি, তথ্য যাচাই এবং কৌশলগত পরিকল্পনা প্রয়োজন এমন সমস্যায় পরীক্ষায় মডেলের ফলাফল উন্নত করেছে<sup>[\[1\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-composable-llm-debate-1)</sup>। লেখকরা উল্লেখ করেন যে «এই ধরনের বহু-রাউন্ড আলোচনার পর তৈরি চূড়ান্ত উত্তর তথ্যগতভাবে আরো সঠিক এবং যুক্তি-সমস্যা সমাধানে আরো সফল»<sup>[\[1\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-composable-llm-debate-1)</sup>। নিচে বিভিন্ন সমস্যায় একক ব্যবহার এবং বহু-এজেন্ট বিতর্ক ব্যবহারে মডেলের নির্ভুলতার তুলনামূলক চিত্র দেওয়া হয়েছে।

একক ব্যবহারে (নীল রঙ) এবং বহু-এজেন্ট বিতর্ক মোডে (লাল রঙ) বিভিন্ন সমস্যায় নির্ভুলতার তুলনা। বহু-এজেন্ট পদ্ধতি (multi-agent debate) তথ্যভিত্তিক প্রশ্ন (জীবনী), জ্ঞান পরীক্ষা MMLU, দাবার চালের সঠিকতা যাচাই, গাণিতিক প্রকাশনা সমাধান, স্কুল স্তরের টেক্সট গণিত সমস্যা (GSM8K) এবং সর্বোত্তম দাবার চাল খোঁজা সহ বিভিন্ন ক্ষেত্রে উচ্চতর নির্ভুলতা প্রদর্শন করে<sup>[\[1\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-composable-llm-debate-1)</sup>। গ্রাফের ডেটা অনুযায়ী, বিতর্ক বিশেষত জটিল কৌশলগত সমস্যায় (যেমন, দাবায় সর্বোত্তম চাল খোঁজা) মডেলের ক্ষমতা বাড়ায় এবং গাণিতিক গণনা ও তথ্য-প্রশ্নে ত্রুটির হার উল্লেখযোগ্যভাবে কমায়।

বহু-এজেন্ট পদ্ধতির আরেকটি সুবিধা হলো মডেলের **একক স্ব-নিয়ন্ত্রণের সীমাবদ্ধতা অতিক্রম করা**। একক LLM প্রায়ই self-reflection (আত্ম-প্রতিফলন) কৌশল প্রয়োগ করে, যেখানে মডেল নিজেই তার প্রাথমিক উত্তর মূল্যায়ন ও সংশোধন করে। তবে দেখা গেছে যে এই পদ্ধতি «degeneration-of-thought» – চিন্তার অবক্ষয় সমস্যার প্রবণ: যদি মডেল প্রাথমিক উত্তরে বিশ্বাস স্থাপন করে, তবে স্ব-যাচাইয়ে সে মৌলিকভাবে নতুন ধারণা তৈরি করে না, এমনকি যদি মূল সমাধান ভুলও হয়<sup>[\[5\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-aclanthology-divergent-5)</sup>। অন্য কথায়, **মডেল তার প্রথম তৈরি সমাধানে আটকে থাকতে এবং বিকল্প প্রত্যাখ্যান করতে প্রবণ**<sup>[\[5\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-aclanthology-divergent-5)</sup>। বহু-এজেন্ট বিতর্ক এই প্রভাব দূর করতে সাহায্য করে: একাধিক সমকক্ষ এজেন্ট প্রাথমিকভাবে বিভিন্ন অনুকল্প প্রস্তাব করতে এবং পরে একে অপরের যুক্তি ক্রমাগত প্রশ্নবিদ্ধ করতে পারে, যা অপ্রচলিত চিন্তা খোঁজতে উদ্দীপিত করে। Tian Liang এবং সহকর্মীরা (EMNLP 2024) তাদের বহু-এজেন্ট স্কিমকে **MAD (Multi-Agent Debate)** নাম দিয়েছেন এবং দেখিয়েছেন যে এটি সত্যিই মডেলের **ভিন্নমুখী (বৈচিত্র্যময়) চিন্তাকে উৎসাহিত করে** এবং গভীর সমস্যা সমাধান প্রয়োজন এমন সমস্যায় ফলাফল উন্নত করে<sup>[\[5\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-aclanthology-divergent-5)</sup>। তাদের বাস্তবায়নে একাধিক এজেন্ট «চোখের বদলে চোখ» নীতিতে তর্ক করে (প্রতিটি পালাক্রমে অন্যের যুক্তির বিরোধিতা করে), এবং প্রক্রিয়াটির উপর একটি সহায়ক বিচারক থাকে যে আলোচনা পরিচালনা করে এবং চূড়ান্ত সমাধান বেছে নেয়<sup>[\[5\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-aclanthology-divergent-5)</sup>। Liang এবং সহলেখকদের পরীক্ষাগুলো জটিল পরীক্ষামূলক সেটে এই পদ্ধতির কার্যকারিতা প্রদর্শন করেছে – commonsense অনুবাদ (লুকানো সাধারণ জ্ঞান বিবেচনায় বাক্য অনুবাদ) এবং প্রতি-স্বজ্ঞাত গণিত (প্রথম দর্শনে অযৌক্তিক শর্ত সহ গাণিতিক ধাঁধা) সমস্যায় বহু-এজেন্ট আলোচনা আদর্শ পদ্ধতির চেয়ে আরো সঠিক উত্তর দিয়েছে<sup>[\[5\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-aclanthology-divergent-5)</sup>। বিশ্লেষণেও দেখা গেছে যে সর্বোত্তম ফলাফলের জন্য বিতর্ক **অভিযোজিতভাবে বন্ধ করা উচিত**, অতিরিক্ত দীর্ঘ না করে, এবং এজেন্টদের মধ্যে কেবল **মধ্যম মাত্রার দ্বন্দ্ব** বজায় রাখা উচিত – অতিরিক্ত আক্রমণাত্মক বা বিপরীতভাবে অতিরিক্ত সম্মতিপূর্ণ আচরণ ফলাফল খারাপ করে<sup>[\[5\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-aclanthology-divergent-5)</sup>।

বহু-এজেন্ট পদ্ধতি কেবল সাধারণ প্রশ্ন-উত্তর সমস্যার জন্য নয়। এটি অন্যান্য ক্ষেত্রে, যেমন মডেলের আরো **নিরাপদ ও সামঞ্জস্যপূর্ণ আচরণের** জন্য প্রয়োগ পায়। পৃথক গবেষণাগুলো **মডারেশন ও নিয়ম প্রণয়ন** সমস্যায় এজেন্টদের বিতর্ক ব্যবহার করে: একাধিক LLM আলোচনা করতে পারে একটি প্রদত্ত উত্তর নৈতিক মান অনুযায়ী গ্রহণযোগ্য কিনা, এর ফলে reinforcement learning-এ একে অপরকে feedback দেওয়া। উল্লেখ করা হয় যে বিতর্ক আরো সূক্ষ্ম ও যুক্তিসংগত মূল্যায়ন সংকেত তৈরি করতে পারে যা নিরাপত্তা ও উপযোগিতার জন্য মডেল সামঞ্জস্যে সাহায্য করে<sup>[\[3\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-arxiv-communication-3)</sup>। **মাল্টিমোডাল সমস্যায়** প্রসারিত করার প্রচেষ্টাও করা হয়েছে – যেমন, যখন কিছু এজেন্ট একটি ছবি বর্ণনা করে এবং অন্যরা বর্ণনাটি চিত্রের সাথে মিলছে কিনা যাচাই করে। Google (2024)-এর কাজে এই সম্প্রসারণের সাফল্য দেখানো হয়েছে: মাল্টিমোডাল পদ্ধতি순수 টেক্সট সমস্যা এবং মাল্টিমোডাল ছবি বোঝাপড়া উভয়ের ফলাফল উন্নত করেছে, «মনের সমাজ»-এর বহুমুখিতা প্রদর্শন করে<sup>[\[3\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-arxiv-communication-3)</sup>। আকর্ষণীয়ভাবে, বিতর্কের কাঠামোর মধ্যে মিথস্ক্রিয়া দুর্বল মডেলগুলোর স্তর উন্নত করতে পারে, যেমন আগে উল্লিখিত হয়েছে। উদাহরণস্বরূপ, যখন বিভিন্ন শক্তিশালী LLM সাধারণ আলোচনায় অংশগ্রহণ করে, **«দুর্বল মডেলগুলো ধীরে ধীরে শক্তিশালী মডেলগুলো থেকে সফল কৌশল গ্রহণ করে শক্তিশালী হয়»**<sup>[\[3\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-arxiv-communication-3)</sup>। সুতরাং, বহু-এজেন্ট সিস্টেম কেবল প্রদত্ত সমস্যা সমাধান করে না, বরং একে অপরের কাছ থেকে মডেলের সম্মিলিত শিক্ষার একটি প্রক্রিয়া হিসেবেও কাজ করে।

## সীমাবদ্ধতা ও খোলা সমস্যা

উল্লেখযোগ্য সুবিধা থাকা সত্ত্বেও, বহু-এজেন্ট বিতর্ক বেশ কিছু **জটিলতা ও সীমাবদ্ধতার** মুখোমুখি হয়। প্রধানতম হলো এই পদ্ধতির **উচ্চ সম্পদ-নিবিড়তা**। আলোচনা সংগঠিত করতে বড় মডেলগুলোতে টেক্সট তৈরি বারবার আহ্বান করতে হয়: যদি n এজেন্ট T রাউন্ডে অংশগ্রহণ করে, তাহলে LLM-এ মোট আহ্বানের সংখ্যা একটি একক উত্তরের তুলনায় n × T গুণ বৃদ্ধি পায়। তদুপরি, প্রতিটি রাউন্ডে মডেলকে প্রসঙ্গ হিসেবে কেবল মূল প্রশ্ন নয়, বরং পূর্ববর্তী রাউন্ডের সমস্ত মন্তব্য (সমস্ত এজেন্টের উত্তর) প্রক্রিয়া করতে হয়। এইভাবে, এজেন্ট ও রাউন্ডের সংখ্যা বৃদ্ধির সাথে **প্রসঙ্গমূলক ইনপুটের পরিমাণ তাৎপর্যপূর্ণভাবে বৃদ্ধি পায়**, যার ফলে **context explosion** – প্রসঙ্গ উইন্ডো ভেঙে পড়া এবং প্রক্রিয়াকরণ খরচ বৃদ্ধির প্রভাব দেখা দেয়<sup>[\[3\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-arxiv-communication-3)</sup>। পরীক্ষায় দেখা যায় যে এমনকি ২-৩টি আলোচনা রাউন্ড যোগ করা মডেলকে পড়তে হবে এমন প্রসঙ্গ token-এর মোট সংখ্যা উল্লেখযোগ্যভাবে বাড়িয়ে দেয়, এবং ফলস্বরূপ, উত্তরের সময়ও বাড়ে। তাত্ত্বিকভাবে পুনরাবৃত্তির সংখ্যা বাড়ালে সমাধানের মান উন্নত হয়, কিন্তু ব্যবহারিকভাবে অনেক কাজ কয়েকটি রাউন্ডের পর **ক্রমহ্রাসমান প্রতিফল** উল্লেখ করে: প্রায়ই সর্বোচ্চ প্রভাব দ্বিতীয়-তৃতীয় রাউন্ডে অর্জিত হয়, তারপর আরো আলোচনা একই যুক্তির পুনরাবৃত্তি বা প্রসঙ্গ অতিরিক্ত পরিপূর্ণতার কারণে নির্ভুলতা হ্রাসের দিকে নিয়ে যেতে পারে<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>। উদাহরণস্বরূপ, Xi এবং সহলেখকরা (2023) কেবল ২য় বিতর্ক রাউন্ড পর্যন্ত নির্ভুলতা বৃদ্ধি দেখিয়েছেন এবং তারপর হ্রাস দেখিয়েছেন, একইভাবে Liu এবং Li ও সহকর্মীরা (2024) প্রায় ৪টি রাউন্ডে মানের শীর্ষ রিপোর্ট করেছেন, তারপর অতিরিক্ত চক্র কেবল বাধার সৃষ্টি করে<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>। সুতরাং, **বিতর্কের সর্বোত্তম সময়কাল নির্ধারণ** একটি সহজ কাজ নয়: অতি স্বল্প আলোচনা সম্মিলিত বুদ্ধিমত্তার সম্পূর্ণ সম্ভাবনা প্রকাশ নাও করতে পারে, আর অতি দীর্ঘ আলোচনা তথ্যগত শোরগোল ও প্রসঙ্গ অতিভার সৃষ্টি করতে পারে।

আরেকটি সমস্যা হলো **ভুল উত্তরে গোষ্ঠীগত সম্মতির ঝুঁকি**। যদি সমস্ত এজেন্টের একই অভিজ্ঞতা থাকে এবং তারা ভুলভাবে কোনো তথ্যে নিশ্চিত থাকে, তাহলে তারা একে অপরের ভ্রান্তি আরো শক্তিশালী করতে পারে। **প্রতিধ্বনি কক্ষ** প্রভাব ঘটে: বিতর্কের সময় মডেলগুলো ঐকমত্যে পৌঁছায়, কিন্তু সত্য খোঁজার কারণে নয়, বরং প্রাথমিক সাধারণ bias নিশ্চিত করার ফলে। তাত্ত্বিক ফলাফল (Estornell & Liu, 2024) নির্দেশ করে যে একই মডেলগুলোর সাথে বিতর্ক **স্থবিরতায় পতিত হতে পারে**, নতুন ধারণার উদ্ভব ছাড়াই সংখ্যাগরিষ্ঠের মত পুনরাবৃত্তি করতে পারে<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>। বিশেষত বিপজ্জনক যখন এই সংখ্যাগরিষ্ঠ একটি সাধারণ ত্রুটি ভাগ করে নেয়, যা, উদাহরণস্বরূপ, প্রশিক্ষণ ডেটায় অন্তর্নিহিত – তখন সমগ্র আলোচনার ফলাফল ভুল হবে<sup>[\[6\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-proceedings-neurips-6)[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>। এই সমস্যা কাটিয়ে উঠতে বিশেষ **হস্তক্ষেপ পদ্ধতি** (diversity-pruning) প্রস্তাব করা হয়: প্রতিটি রাউন্ডে অ্যালগরিদমিকভাবে অতিরিক্ত মিলে-যাওয়া উত্তরগুলো বাদ দেওয়া হয়, সর্বোচ্চ তথ্য entropy সহ বিভিন্ন বিকল্প তৈরি করতে এজেন্টদের উদ্দীপিত করা হয়<sup>[\[6\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-proceedings-neurips-6)</sup>। এটি সম্ভাবনা কমায় যে সমস্ত উত্তর একই ত্রুটির বৈচিত্র্য হবে। আরেকটি কৌশল হলো **ভ্রান্তি সনাক্তকরণ ও খণ্ডন** (misconception refutation): সিস্টেম স্বয়ংক্রিয়ভাবে এজেন্টদের সাধারণ অনুমান সনাক্ত করার চেষ্টা করে এবং লক্ষ্যভিত্তিকভাবে সেগুলোকে চ্যালেঞ্জ করে যেগুলো মিথ্যা হতে পারে<sup>[\[6\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-proceedings-neurips-6)</sup>। Estornell & Liu-এর কাজে তিনটি অনুরূপ হস্তক্ষেপের একটি সেট প্রস্তাব করা হয়েছে – উল্লিখিতগুলোর পাশাপাশি, quality-pruning (প্রতিটি ধাপে সবচেয়ে প্রাসঙ্গিক ও উচ্চমানের যুক্তি নির্বাচন) – এবং দেখানো হয়েছে যে তাদের সংমিশ্রণ বিতর্কের কার্যকারিতা উল্লেখযোগ্যভাবে বাড়ায় এবং প্রতিধ্বনি কক্ষ প্রবণতা প্রতিরোধ করে<sup>[\[6\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-proceedings-neurips-6)[\[6\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-proceedings-neurips-6)</sup>।

অবশেষে, উল্লেখ করা উচিত যে বহু-এজেন্ট আলোচনার **স্থিতিশীলতা ও পূর্বাভাসযোগ্যতা** এখনো আদর্শ থেকে অনেক দূরে। কিছু পরীক্ষায় বিতর্ক অস্থিতিশীল ফলাফলের দিকে নিয়ে গেছে – একই আলোচনার বিভিন্ন রানআপ ভিন্ন উত্তরে অভিসরণ করতে পারে, অথবা সামগ্রিক উত্তর বিতর্ক ছাড়া একক মডেলের চেয়ে খারাপ হতে পারে<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>। Wang এবং সহলেখকরা (2024) এবং Smit এবং সহলেখকরা (2023) স্বাধীনভাবে এমন ঘটনা উল্লেখ করেছেন যেখানে এজেন্ট যোগ করা **কার্যক্ষমতা খারাপ করেছে**, যা উপকারী সমালোচনা ও ধ্বংসাত্মক তর্কের মধ্যে সূক্ষ্ম পার্থক্য নির্দেশ করে<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>। কোন পরিস্থিতিতে বহু-এজেন্ট পদ্ধতি নিশ্চিতভাবে উপকারী তা নির্ধারণ করা গবেষণার বিষয়ে রয়ে গেছে। খোলা প্রশ্নগুলো হলো: **কীভাবে স্বয়ংক্রিয়ভাবে সিদ্ধান্ত নেওয়া যায় কখন বিতর্ক থামাতে এবং উত্তর নির্ধারণ করতে হবে**, সুবিধা না হারিয়ে এবং অন্তহীন তর্কে না গিয়ে, এবং বিভিন্ন ধরনের সমস্যার জন্য সবচেয়ে নির্ভরযোগ্যভাবে **কীভাবে সম্মিলিতভাবে সিদ্ধান্ত নেওয়া যায়** – ভোটদান, ঐকমত্য বা বাহ্যিক বিচারকের মাধ্যমে<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>। বহু-এজেন্ট সিস্টেমের **নিরাপত্তা ও নিয়ন্ত্রণযোগ্যতার** সমস্যাও তীব্রভাবে উঠে আসে: নিশ্চিত করতে হবে যে এজেন্টরা যৌথভাবে অবাঞ্ছিত বা বিষাক্ত বিষয়বস্তু তৈরি করবে না এবং একে অপরের ক্ষতিকর প্রবণতা বাড়াবে না। এই প্রশ্নগুলো, বিশেষত **নিরাপত্তা ও মাপযোগ্যতার** বিষয়গুলো, প্রাসঙ্গিক ও জটিল হিসেবে স্বীকৃত<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>। সমসাময়িক পর্যালোচনাগুলো উল্লেখ করে যে আলোচনার **নির্ভরযোগ্য সমাপ্তি নিয়ম** তৈরি, এজেন্ট ও রাউন্ডের সংখ্যা বৃদ্ধির সাথে পদ্ধতির **মাপযোগ্যতা** মূল্যায়ন এবং সম্মিলিতভাবে প্রাপ্ত উত্তরের **নির্ভরযোগ্যতা ও সত্যতা** নিশ্চিত করার পদ্ধতি বাস্তবায়নে নিবেদিত আরো গবেষণার প্রয়োজন<sup>[\[4\]](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_note-litreview-problem-solving-4)</sup>। এই সমস্যাগুলোর সমাধান বহু-এজেন্ট বিতর্ককে আরো শক্তিশালী ও বহুমুখী হাতিয়ারে পরিণত করবে আরো **বুদ্ধিমান ও নিরাপদ** কৃত্রিম বুদ্ধিমত্তা সিস্টেম তৈরির জন্য।

## তথ্যসূত্র

- Improving Factuality and Reasoning in Language Models with Multiagent Debate — প্রকল্পের পৃষ্ঠা
- AI safety via debate — OpenAI-এর মূল নিবন্ধ
- Improving Multi-Agent Debate with Sparse Communication Topology — যোগাযোগ অপ্টিমাইজেশন সংক্রান্ত নিবন্ধ
- Literature Review Of Multi-Agent Debate For Problem-Solving — সাহিত্য পর্যালোচনা
- Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate — MAD সংক্রান্ত নিবন্ধ
- Improving Multi-Agent Debate with Contrastive Deliberation and Diversity-Promoting Interventions — NeurIPS 2024 নিবন্ধ

## গ্রন্থপঞ্জি

- Irving, G. et al. (2018). *AI Safety via Debate*. arXiv:1805.00899.
- Du, Y. et al. (2023). *Improving Factuality and Reasoning in Language Models through Multiagent Debate*. arXiv:2305.14325.
- Liang, T. et al. (2023). *Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate*. arXiv:2305.19118.
- Li, Y. et al. (2024). *Improving Multi-Agent Debate with Sparse Communication Topology*. arXiv:2406.11776.
- Guo, T. et al. (2024). *Large Language Model based Multi-Agents: A Survey of Progress and Challenges*. arXiv:2402.01680.
- Li, J. et al. (2024). *More Agents Is All You Need*. arXiv:2402.05120.
- Estornell, A.; Liu, Y. (2024). *Multi-LLM Debate: Framework, Principals, and Interventions*. NeurIPS 2024.
- Eo, S. et al. (2025). *Debate Only When Necessary: Adaptive Multiagent Collaboration for Efficient LLM Reasoning*. arXiv:2504.05047.
- Tillmann, A. (2025). *Literature Review Of Multi-Agent Debate For Problem-Solving*. arXiv:2506.00066.
- Cui, Y. et al. (2025). *Efficient Leave-One-Out Approximation in LLM Multi-Agent Debate Based on Introspection*. arXiv:2505.22192.
- La Malfa, E. et al. (2025). *Large Language Models Miss the Multi-Agent Mark*. arXiv:2505.21298.

## টীকা

1.  <span id="cite_note-composable-llm-debate-1">↑ <sup>[1.00](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-composable-llm-debate_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-composable-llm-debate_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-composable-llm-debate_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-composable-llm-debate_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-composable-llm-debate_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-composable-llm-debate_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-composable-llm-debate_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-composable-llm-debate_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-composable-llm-debate_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-composable-llm-debate_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-composable-llm-debate_1-10)</sup> «Improving Factuality and Reasoning in Language Models with Multiagent Debate». *composable-models.github.io*. <a href="https://composable-models.github.io/llm_debate/" class="external autonumber" rel="nofollow">[১]</a></span>
2.  <span id="cite_note-arxiv-ai-safety-2">↑ <sup>[2.0](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-arxiv-ai-safety_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-arxiv-ai-safety_2-1)</sup> Irving, Geoffrey et al. «AI safety via debate». *arXiv*. <a href="https://arxiv.org/abs/1805.00899" class="external autonumber" rel="nofollow">[২]</a></span>
3.  <span id="cite_note-arxiv-communication-3">↑ <sup>[3.0](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-arxiv-communication_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-arxiv-communication_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-arxiv-communication_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-arxiv-communication_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-arxiv-communication_3-4)</sup> <sup>[3.5](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-arxiv-communication_3-5)</sup> <sup>[3.6](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-arxiv-communication_3-6)</sup> <sup>[3.7](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-arxiv-communication_3-7)</sup> <sup>[3.8](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-arxiv-communication_3-8)</sup> Liu, Xiang Lisa et al. «Improving Multi-Agent Debate with Sparse Communication Topology». *arXiv*. <a href="https://arxiv.org/html/2406.11776v1" class="external autonumber" rel="nofollow">[৩]</a></span>
4.  <span id="cite_note-litreview-problem-solving-4">↑ <sup>[4.00](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-0)</sup> <sup>[4.01](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-1)</sup> <sup>[4.02](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-2)</sup> <sup>[4.03](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-3)</sup> <sup>[4.04](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-4)</sup> <sup>[4.05](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-5)</sup> <sup>[4.06](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-6)</sup> <sup>[4.07](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-7)</sup> <sup>[4.08](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-8)</sup> <sup>[4.09](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-9)</sup> <sup>[4.10](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-10)</sup> <sup>[4.11](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-11)</sup> <sup>[4.12](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-12)</sup> <sup>[4.13](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-13)</sup> <sup>[4.14](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-14)</sup> <sup>[4.15](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-15)</sup> <sup>[4.16](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-16)</sup> <sup>[4.17](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-17)</sup> <sup>[4.18](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-18)</sup> <sup>[4.19](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-19)</sup> <sup>[4.20](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-20)</sup> <sup>[4.21](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-21)</sup> <sup>[4.22](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-litreview-problem-solving_4-22)</sup> «Literature Review Of Multi-Agent Debate For Problem-Solving». *arXiv*. <a href="https://arxiv.org/html/2506.00066v1" class="external autonumber" rel="nofollow">[৪]</a></span>
5.  <span id="cite_note-aclanthology-divergent-5">↑ <sup>[5.0](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-aclanthology-divergent_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-aclanthology-divergent_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-aclanthology-divergent_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-aclanthology-divergent_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-aclanthology-divergent_5-4)</sup> <sup>[5.5](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-aclanthology-divergent_5-5)</sup> Liang, Tian et al. «Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate». *ACL Anthology*. <a href="https://aclanthology.org/2024.emnlp-main.992/" class="external autonumber" rel="nofollow">[৫]</a></span>
6.  <span id="cite_note-proceedings-neurips-6">↑ <sup>[6.0](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-proceedings-neurips_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-proceedings-neurips_6-1)</sup> <sup>[6.2](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-proceedings-neurips_6-2)</sup> <sup>[6.3](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-proceedings-neurips_6-3)</sup> <sup>[6.4](https://systems-analysis.info/int/Multi-Agent_Debate_(BN)#cite_ref-proceedings-neurips_6-4)</sup> «Improving Multi-Agent Debate with Contrastive Deliberation and Diversity-Promoting Interventions». *NeurIPS 2024*. <a href="https://proceedings.neurips.cc/paper_files/paper/2024/file/32e07a110c6c6acf1afbf2bf82b614ad-Paper-Conference.pdf" class="external autonumber" rel="nofollow">[৬]</a></span>
