---
title: "PromptRobust (benchmark) (BN)"
source: "https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)"
wiki: "systems-analysis.info/int"
article: "PromptRobust_(benchmark)_(BN)"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 5932
wiki_created_at: 2026-09-06T23:56:02Z
wiki_modified_at: 2026-09-06T23:56:02Z
downloaded_at: 2026-09-07T23:11:05Z
---

# PromptRobust (benchmark) (BN)

**PromptRobust** (এছাড়াও **PromptBench** নামে পরিচিত) — এটি বৃহৎ ভাষা মডেলগুলির (LLM) **অ্যাডভার্সারিয়াল প্রম্পট পরিবর্তনের** প্রতি সহনশীলতা মূল্যায়নের জন্য একটি ব্যাপক **benchmark** — অর্থাৎ কার্যের বিবরণের ছোট বিকৃতি যা তার অর্থ পরিবর্তন করে না<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)</sup>। benchmark টি ২০২৩ সালে Microsoft Research Asia-র গবেষকদের একটি দল (Kaijie Zhu এবং অন্যান্য) দ্বারা তৈরি করা হয়েছিল<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। PromptRobust-এর উদ্ভব এই পর্যবেক্ষণ থেকে যে আধুনিক বৃহৎ ভাষা মডেলগুলি (BYM) বিবরণের বিবরণীর বিস্তারিত বিষয়ে সংবেদনশীল: এমনকি তুচ্ছ পরিবর্তনও (যেমন টাইপো বা পুনরায় বাক্যগঠন) মডেলগুলির উত্তরকে লক্ষণীয়ভাবে প্রভাবিত করতে পারে<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)</sup>। benchmark টি এই দুর্বলতাকে পরিমাণগতভাবে পরিমাপ করতে এবং BYM-এর সাথে মিথস্ক্রিয়ার আরও নির্ভরযোগ্য পদ্ধতির বিকাশে সহায়তা করার জন্য তৈরি করা হয়েছে।

## মূল্যায়ন পদ্ধতি

PromptBench গবেষণার কাঠামোতে **৪৭৮৮টি পরিবর্তিত প্রম্পটের** একটি কর্পাস তৈরি করা হয়েছিল যা কার্যগুলির মূল অর্থ বজায় রাখে<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-abs-3)</sup>। এই অ্যাডভার্সারিয়াল প্রম্পটগুলি পরিবর্তনের চারটি জটিলতার স্তরে তৈরি করা হয়েছিল<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>:

- **অক্ষর স্তর**: টাইপো প্রবেশ করানো, অক্ষর প্রতিস্থাপন বা স্থানান্তর (এলোমেলো ইনপুট ত্রুটি অনুকরণ করে)।
- **শব্দ স্তর**: কিছু শব্দকে প্রতিশব্দ দিয়ে প্রতিস্থাপন, "শব্দ-গোলমাল" বা অন্যান্য তুচ্ছ শব্দভান্ডার পরিবর্তন প্রবেশ করানো।
- **বাক্য স্তর**: বাক্যের কাঠামো পুনরায় বাক্যগঠন, সামগ্রিক বিষয় পরিবর্তন না করে বাক্যাংশের অংশ যোগ করা বা স্থানান্তর করা।
- **অর্থগত স্তর**: এর কার্য বজায় রেখে প্রশ্নটি গভীরভাবে পুনরায় প্রণয়ন করা (যেমন, একই প্রশ্নের বিকল্প বিবরণী)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>।

এই ধরনের "আক্রমণগুলির" লক্ষ্য হল — তুচ্ছ বিচ্যুতিগুলি (যেমন, এলোমেলো টাইপো বা প্রতিশব্দ বিবরণী ব্যবহার) মডেলের কার্য সঠিকভাবে সম্পাদন করার ক্ষমতাকে কীভাবে প্রভাবিত করে তা পরীক্ষা করা, যখন কার্যটি নিজেই পরিবর্তিত হয়নি<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। প্রতিটি তৈরি অ্যাডভার্সারিয়াল প্রম্পট স্ট্যান্ডার্ড NLP কার্যগুলির একটি সিরিজে প্রয়োগ করা হয়েছিল, যার মধ্যে রয়েছে **অনুভূতি বিশ্লেষণ**, **ব্যাকরণগত সঠিকতা সনাক্তকরণ**, **ডুপ্লিকেট বাক্য অনুসন্ধান**, **যৌক্তিক অনুমান** (NLI), **পঠন বোধগম্যতা**, **মেশিন অনুবাদ** এবং **গণিত সমস্যা সমাধান**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। পরীক্ষাগুলির জন্য ১৩টি dataset-এ ৮টি বিভিন্ন ধরনের কার্য নির্বাচন করা হয়েছিল — ক্লাসিক GLUE সেট থেকে (যেমন অনুভূতির জন্য SST-2, NLI-র জন্য MNLI) বিশেষায়িত গণিত এবং বহুভাষিক পরীক্ষা পর্যন্ত<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>।

গুরুত্বপূর্ণ বিষয় হল, বিভিন্ন **প্রম্পট ফরম্যাটের** সহনশীলতা পরীক্ষা করা হয়েছিল<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>:

- উদাহরণ ছাড়া সরাসরি প্রশ্ন (**zero-shot**, শুধুমাত্র নির্দেশ)।
- কয়েকটি উদাহরণ সহ প্রশ্ন (**few-shot**, যখন প্রম্পটে সমাধানের নমুনা দেওয়া হয়)।
- ভূমিকা প্রম্পট (**in-context roles**, যেমন, "আপনি একটি অনুভূতি বিশ্লেষণ সিস্টেম, নির্ধারণ করুন...")।
- কার্য বর্ণনাকারী প্রম্পট (**task-oriented**, কার্যের সরাসরি বর্ণনা)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>।

বিভিন্ন বড় ভাষা মডেলও পরীক্ষা করা হয়েছিল — তুলনামূলকভাবে ছোট Flan-T5-large এবং UL2 মডেল থেকে উন্নত ChatGPT এবং GPT-4 পর্যন্ত, সেইসাথে LLaMA 2 পরিবারের ওপেন মডেল এবং সেগুলি থেকে উদ্ভূত Vicuna<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। আক্রমণ তৈরির জন্য অ্যাডভার্সারিয়াল NLP ক্ষেত্রের বিদ্যমান পদ্ধতিগুলি (যেমন TextBugger, DeepWordBug, TextFooler ইত্যাদি) ব্যবহার করা হয়েছিল, যা ইনপুট ডেটার পরিবর্তে প্রম্পট পরিবর্তনের জন্য অভিযোজিত করা হয়েছিল<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। প্রাপ্ত "বিকৃত" প্রম্পটগুলির সঠিকতা স্বয়ংক্রিয় এবং ম্যানুয়াল পদ্ধতি দ্বারা যাচাই করা হয়েছিল; প্রতিবেদন অনুযায়ী, কমপক্ষে ৮৫% অ্যাডভার্সারিয়াল বৈচিত্র সঠিক অর্থগত অর্থ বজায় রাখে এবং মানুষের কাছে বোধগম্য<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। সুতরাং, আক্রমণগুলির প্রভাব বিশেষভাবে পুনরায় বাক্যগঠিত কার্য উপলব্ধিতে মডেলের ব্যর্থতা প্রতিফলিত করে, কার্যের অর্থ নিজেই হারানো নয়।

## ফলাফল এবং উপসংহার

পরীক্ষাগুলি দেখিয়েছে যে আধুনিক BYM গুলি **প্রশ্নের বিবরণীতে ছোট পরিবর্তনের প্রতি অপর্যাপ্তভাবে সহনশীল**<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-abs-3)</sup>। সমস্ত পরীক্ষিত মডেলের জন্য তৈরি আক্রমণগুলির প্রভাবে উত্তরের গুণমানে উল্লেখযোগ্য হ্রাস পরিলক্ষিত হয়েছে<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-abs-3)</sup>। বিশেষত, এমনকি সহজ ক্ষেত্রেও — যেমন একটি গণিত সমস্যার পাঠ্যে টাইপো বা একটি মূল শব্দকে তার প্রতিশব্দ দিয়ে প্রতিস্থাপন — মডেলটি ভুল ফলাফল দিয়েছে, যদিও বিকৃতি ছাড়া এটি সঠিকভাবে সম্পন্ন করেছিল<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। লেখকদের সাধারণ উপসংহার: "আধুনিক বৃহৎ ভাষা মডেলগুলি অ্যাডভার্সারিয়াল প্রম্পটের প্রতি **robust** (সহনশীল) নয়"<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-abs-3)</sup>, অর্থাৎ phrasing-এ তুচ্ছ বিচ্যুতিগুলি পদ্ধতিগতভাবে তাদের বিভ্রান্ত করতে পারে।

বিভিন্ন ধরনের আক্রমণ বিশ্লেষণ করে দেখা গেছে যে BYM-এর কাজে সবচেয়ে বিধ্বংসী প্রভাব ফেলে **শব্দ স্তরের** পরিবর্তনগুলি<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)</sup>। শব্দগুলিকে প্রতিশব্দ দিয়ে প্রতিস্থাপন বা তুচ্ছ শব্দ-গঠনমূলক বিকৃতি একই কার্যগুলিতে মূল ফলাফলের তুলনায় গড়ে ≈৩৩% **সবচেয়ে বড় গুণমান হ্রাসের** কারণ হয়েছিল<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)</sup>। **অক্ষর স্তরের** আক্রমণগুলি (টাইপো, এলোমেলো অক্ষর) গড়ে ~২০% নির্ভুলতা হ্রাস ঘটিয়েছে<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)</sup>। প্রম্পটে গুণগত পরিবর্তন বা সম্পূর্ণ বাক্য যোগ করা, বিপরীতভাবে, অনেক দুর্বল প্রভাব ফেলেছে, প্রায় মডেলকে বিচলিত করেনি<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। **অর্থগত পুনরায় বাক্যগঠন** (অনুরোধের গভীর ভিন্নভাবে পুনর্বর্ণনা) সাধারণ টাইপোর মতো ক্ষতিকর প্রমাণিত হয়েছে<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। এই তথ্যগুলি জোর দেয় যে BYM গুলি সূক্ষ্ম শব্দগত পরিবর্তন এবং মূল শব্দে ত্রুটির প্রতি বিশেষভাবে দুর্বল<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। উল্লেখযোগ্যভাবে, ব্যাকরণগত বিকৃতিগুলি (টাইপো) তাত্ত্বিকভাবে স্ট্যান্ডার্ড বানান পরীক্ষার সরঞ্জাম দ্বারা ফিল্টার করা যেতে পারে, যেখানে শব্দ এবং অর্থ স্তরের পরিবর্তনগুলি মডেলের কাছ থেকে উন্নত অর্থগত বোঝাপড়া দাবি করে যা বর্তমান মডেলগুলিতে প্রায়শই অভাব থাকে<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>।

বিভিন্ন মডেলের কার্যক্ষমতা বিশ্লেষণ তাদের robustness-এ উল্লেখযোগ্য বিচ্ছুরণ দেখিয়েছে<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। **GPT-4** এবং **UL2** অ্যাডভার্সারিয়াল প্রম্পটের প্রতি সর্বোত্তম সহনশীলতা প্রদর্শন করেছে<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। Flan-T5-large মডেল এবং কথোপকথন মডেল ChatGPT-ও কিছুটা কম ব্যর্থতার শিকার হয়েছে<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। LLaMA 2 পরিবারের মডেলগুলি মধ্যবর্তী অবস্থানে রয়েছে, যেখানে **Vicuna** (13B) সব ধরনের আক্রমণে সবচেয়ে দুর্বল হিসেবে বিশিষ্ট হয়েছে<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। আকর্ষণীয়ভাবে, **মডেলের আকার robustness-এর নির্ধারক কারণ হয়নি**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>: তুলনামূলকভাবে ছোট T5-large উত্তরের স্থিতিশীলতায় অনেক বড় ChatGPT মডেলের কাছাকাছি ছিল<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। লেখকরা অনুমান করেন যে **মডেলের প্রশিক্ষণ এবং fine-tuning পদ্ধতি** মূল ভূমিকা পালন করে, শুধু আকার নয়<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। সুতরাং, UL2 এবং T5-large বড় ডেটা কর্পাসে বিস্তারিত প্রি-ট্রেনিং পেয়েছিল, এবং ChatGPT মানব প্রতিক্রিয়া থেকে Reinforcement Learning দিয়ে (RLHF) প্রশিক্ষিত হয়েছিল, যা তাদের সহনশীলতাকে শক্তিশালী করতে পারে<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। বিপরীতভাবে, Vicuna তুলনামূলকভাবে সীমিত dataset-এ (একটি ওপেন রেপ্লিকা হিসেবে) প্রশিক্ষিত হয়েছিল, যা সম্ভবত বিবরণী পরিবর্তনের প্রতি তার উচ্চ সংবেদনশীলতার কারণ<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। এই ফলাফলগুলি নির্দেশ করে যে fine-tuning পদ্ধতির উন্নতি শুধু আকার বাড়ানোর চেয়ে মডেলের নির্ভরযোগ্যতা বেশি বাড়াতে পারে।

### প্রম্পট ফরম্যাটের প্রভাব

অনুরোধ উপস্থাপনের ফর্মও উত্তরের নির্ভরযোগ্যতাকে প্রভাবিত করে<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। এটি প্রতিষ্ঠিত হয়েছে যে **উদাহরণ সহ প্রম্পট (few-shot) উদাহরণ ছাড়া একক-পদক্ষেপ নির্দেশাবলীর (zero-shot) তুলনায় মডেলের সহনশীলতা উল্লেখযোগ্যভাবে বাড়ায়**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। প্রম্পটে বেশ কয়েকটি প্রদর্শনী কার্যের উদাহরণ থাকা মডেলকে শব্দ-গোলমাল পরিবর্তন থাকলেও কার্যটি আরও সঠিকভাবে ব্যাখ্যা করতে সাহায্য করে। ভূমিকা প্রম্পট এবং বর্ণনামূলক (task-oriented) প্রম্পট সামগ্রিকভাবে সহনশীলতার একটি তুলনামূলক স্তর দেখিয়েছে, যদিও তাদের কার্যকারিতা কার্য থেকে কার্যে পরিবর্তিত হয়েছে<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। উদাহরণস্বরূপ, অনুভূতি বিশ্লেষণ এবং ডুপ্লিকেট বাক্য ডেটায় ভূমিকা ফরম্যাট কিছুটা বেশি নির্ভরযোগ্য ছিল, যেখানে পঠন বোধগম্যতা এবং অনুবাদের কার্যগুলিতে স্পষ্ট কার্য নির্দেশাবলী ভালোভাবে কাজ করেছে<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। এই পর্যবেক্ষণগুলি প্রম্পট ডিজাইনে নির্দেশিকা হিসেবে কাজ করতে পারে: বিস্তারিত উদাহরণ এবং ভূমিকার প্রসঙ্গ যোগ করা অ-মানক বিবরণীতে মডেলের ত্রুটির সম্ভাবনা কমায়।

### মডেলগুলির মধ্যে আক্রমণের স্থানান্তরযোগ্যতা

মডেলগুলির মধ্যে আক্রমণের স্থানান্তরযোগ্যতা (ট্রান্সফার) সীমিত প্রমাণিত হয়েছে<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। একটি মডেলের বিরুদ্ধে বিশেষভাবে নির্বাচিত অ্যাডভার্সারিয়াল প্রম্পটগুলি সর্বদা অন্য মডেলের বিরুদ্ধে সমানভাবে কার্যকর নয়<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। সুতরাং, এটি উল্লেখ করা হয়েছিল যে ChatGPT-এর দুর্বলতার জন্য তৈরি "ফাঁদ" প্রম্পটগুলি GPT-4-এ অনেক কম প্রভাব ফেলে<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। পরেরটি সম্ভবত ভালোভাবে পরিচালনা করেছিল কারণ আক্রমণগুলি সরাসরি তার আর্কিটেকচারে স্থানান্তরিত হয়নি — যা একটি মডেলকে বিভ্রান্ত করে তা ভিন্ন প্রশিক্ষণ সহ আরও উন্নত মডেলে কাজ নাও করতে পারে<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। তবুও, কিছু ধরনের সহজ বিকৃতি (যেমন, টাইপো) একসাথে বেশ কয়েকটি মডেলে নেতিবাচক প্রভাব ফেলেছিল, যা তাদের ভাষিক ভিত্তিতে একই ধরনের দুর্বল স্থানগুলির ইঙ্গিত দেয়।

### ব্যবহারিক সুপারিশ

PromptBench কাজের সময় BYM ব্যবহারকারী এবং ডেভেলপারদের জন্য ব্যবহারিক সুপারিশগুলিও চিহ্নিত করা হয়েছিল<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)</sup>। সহজ উপসংহার: বিবরণীর স্থিতিশীলতা গুরুত্বপূর্ণ<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)</sup>। **প্রশ্নে টাইপো এবং অযত্নশীল বিবরণী এড়ানো প্রয়োজন**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)</sup>। লেখকরা দেখিয়েছেন যে এমনকি ছোট ত্রুটি সংশোধন করা (বানান, এলোমেলো বড় হাতের অক্ষর, অতিরিক্ত স্থান) মডেলের উত্তরের নির্ভরযোগ্যতা উল্লেখযোগ্যভাবে বাড়াতে পারে<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)</sup>। এছাড়াও, **নির্দেশের শব্দ নির্বাচন তার সহনশীলতাকে প্রভাবিত করে**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)</sup>। সহনশীল বনাম দুর্বল প্রম্পটে পদ বারংবারতা বিশ্লেষণে দেখা গেছে যে কিছু শব্দ "নির্ভরযোগ্য" প্রম্পটে বেশি দেখা যায়, অন্যগুলি — যেখানে মডেল বিভ্রান্ত হয়েছে<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)</sup>। উদাহরণস্বরূপ, "acting", "provided", "detection" ইত্যাদি শব্দযুক্ত প্রম্পটগুলি কম ঘন ঘন ব্যর্থতার কারণ হয়েছিল, যেখানে "respond", "following" বা "examine" এর মতো শব্দগুলি আরও সমস্যাযুক্ত ক্ষেত্রে দেখা গেছে<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)</sup>। এটি নির্দেশ করে যে প্রশ্নগুলির নির্দিষ্ট শৈলী এবং শব্দভান্ডার মডেলের দুর্বলতাগুলি প্রশমিত বা বিপরীতভাবে উস্কে দিতে পারে। সাধারণভাবে বলা হয় প্রশ্নটি **যতটা সম্ভব স্পষ্ট, অস্পষ্টতামুক্ত এবং মডেলের জন্য পরিচিত পদে** প্রণয়ন করতে, বিশেষত গুরুত্বপূর্ণ অ্যাপ্লিকেশনের জন্য<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)</sup>।

গবেষকদের দ্বারা উল্লেখিত একটি আকর্ষণীয় পার্শ্ব প্রতিক্রিয়া হল প্রশ্নে অর্থহীন বা অপ্রাসঙ্গিক পাঠ্যের অংশ যোগ করার প্রভাব<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)</sup>। দেখা গেছে যে প্রম্পটের শেষে বা মাঝখানে **এলোমেলো অক্ষর সিকোয়েন্স** (যেমন, "LKF0FZxMZ4") সন্নিবেশ করা মডেলের মনোযোগকে বিভ্রান্ত করতে পারে এবং **তার উত্তরের নির্ভুলতা হ্রাস করতে পারে**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)</sup>। অন্যদিকে, একটি নিরপেক্ষ কিন্তু ব্যাকরণিকভাবে সঠিক বাক্যাংশ যোগ করা (যেমন "and true is true") কিছু ক্ষেত্রে বিপরীতভাবে **উত্তর উন্নত করেছে**, যেন মডেলকে প্রশ্নের গুরুত্বপূর্ণ অংশগুলিতে মনোনিবেশ করাচ্ছে<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)</sup>। এই ঘটনা জোর দেয় যে BYM গুলি ইনপুটের আপাতদৃষ্টিতে তুচ্ছ বিবরণে কতটা অপ্রত্যাশিতভাবে প্রতিক্রিয়া করে। এটি মডেলগুলির অভ্যন্তরীণ কাঠামোর জটিলতার প্রমাণও: প্রসঙ্গের ক্ষুদ্রতম পরিবর্তন হয় তাদের কাজ ব্যাহত করতে পারে বা উন্নত করতে পারে, এটি নির্ভর করে কীভাবে মডেলের মনোযোগ পুনর্বণ্টিত হয় তার উপর।

## গুরুত্ব এবং আরও বিকাশ

PromptRobust/PromptBench BYM-এর নির্ভরযোগ্যতা বোঝার ক্ষেত্রে উল্লেখযোগ্য অবদান রেখেছে<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)</sup>। প্রস্তাবিত benchmark এবং সংগৃহীত ডেটা সম্প্রদায়ের জন্য উন্মুক্ত: কোড এবং অ্যাডভার্সারিয়াল প্রম্পটের সেটগুলি রিপোজিটরিতে পাওয়া যায়<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। এটি অন্যান্য গবেষকদের প্রশ্নের বৈচিত্র্যের প্রতি সহনশীলতার জন্য নতুন মডেল পরীক্ষা করতে এবং ফলাফল তুলনা করতে দেয়<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-arxiv-main-1)</sup>। পরবর্তী পদক্ষেপ হল এই ধরনের আক্রমণ থেকে মডেলগুলিকে রক্ষা করার পদ্ধতির বিকাশ — উদাহরণস্বরূপ, সম্ভাব্য টাইপো এবং পুনরায় বাক্যগঠন বিবেচনা করে উন্নত প্রশিক্ষণ অ্যালগরিদম, বা ইনপুট বক্তৃতার অন্তর্নির্মিত নরমালাইজেশন সিস্টেম<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)</sup>। PromptBench ইতিমধ্যে বাস্তব অসঠিক ইনপুট ডেটার প্রতি ভাষা মডেলগুলির **robustness** বৃদ্ধির এই ধরনের গবেষণার ভিত্তি হিসেবে বিবেচনা করা হচ্ছে<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)</sup>।

পরিশেষে, Zhu এবং সহকর্মীদের কাজ ব্যবহারিক অ্যাপ্লিকেশনে BYM বাস্তবায়নের সময় প্রম্পটের সহনশীলতার বিবেচনার গুরুত্ব প্রদর্শন করে: মডেলগুলিকে কেবল "পরিষ্কার" ডেটায় উচ্চ নির্ভুলতা দেখালেই হবে না, বরং ইনপুটে তুচ্ছ বিচ্যুতিতেও সঠিকতা বজায় রাখতে হবে, তা ব্যবহারকারীর এলোমেলো ত্রুটি হোক বা উদ্দেশ্যমূলক আক্রমণাত্মক প্রভাব হোক<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-towardsai-2)[\[4\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_note-cmu-realer-4)</sup>।

## সূত্র

- PromptBench মূল প্রবন্ধ (arXiv)
- GitHub-এ PromptBench রিপোজিটরি
- প্রবন্ধ "Prompt Robustness: How to Measure and How to Enhance" (Towards AI)

## সাহিত্য

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## টীকা

1.  <span id="cite_note-arxiv-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-main_1-35)</sup> «PromptBench: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[১]</a></span>
2.  <span id="cite_note-towardsai-2">↑ <sup>[2.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-11)</sup> <sup>[2.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-12)</sup> <sup>[2.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-13)</sup> <sup>[2.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-14)</sup> <sup>[2.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-15)</sup> <sup>[2.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-16)</sup> <sup>[2.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-17)</sup> <sup>[2.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-18)</sup> <sup>[2.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-towardsai_2-19)</sup> «Prompt Robustness: How to Measure and How to Enhance». *Towards AI*. <a href="https://towardsai.net/p/l/prompt-robustness-how-to-measure-and-how-to-enhance" class="external autonumber" rel="nofollow">[২]</a></span>
3.  <span id="cite_note-arxiv-abs-3">↑ <sup>[3.0](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-abs_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-abs_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-abs_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-arxiv-abs_3-3)</sup> «PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[৩]</a></span>
4.  <span id="cite_note-cmu-realer-4">[↑](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BN)#cite_ref-cmu-realer_4-0) «Realer Toxicity Prompts (RTP-2.0): Multilingual and Adversarial Prompts for Evaluating Neural Toxic Degeneration in Large Language Models». *Language Technologies Institute - School of Computer Science - Carnegie Mellon University*. <a href="https://www.lti.cs.cmu.edu/research/research-articles/realer-toxicity-prompts.html" class="external autonumber" rel="nofollow">[৪]</a></span>
