PromptRobust (benchmark) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

PromptRobust (همچنین با نام PromptBench شناخته می‌شود) — یک benchmark جامع برای ارزیابی پایداری مدل‌های زبانی بزرگ (LLM) در برابر تغییرات adversarial در prompt است — تحریف‌های جزئی در فرمول‌بندی دستور که معنای آن را تغییر نمی‌دهند[1][2]. این benchmark در سال ۲۰۲۳ توسط گروهی از پژوهشگران (Kaijie Zhu و همکاران) از Microsoft Research Asia توسعه یافت[1]. پیدایش PromptRobust ناشی از این مشاهده است که مدل‌های زبانی بزرگ مدرن به جزئیات فرمول‌بندی حساس هستند: حتی تغییرات جزئی (مانند غلط‌های تایپی یا بازنویسی) می‌توانند به طور محسوسی بر پاسخ‌های مدل‌ها تأثیر بگذارند[2]. این benchmark برای اندازه‌گیری کمّی این آسیب‌پذیری و کمک به توسعه روش‌های قابل اعتمادتر تعامل با مدل‌های زبانی بزرگ طراحی شده است.

روش‌شناسی ارزیابی

در چارچوب پژوهش PromptBench، مجموعه‌ای از ۴۷۸۸ prompt تغییریافته ایجاد شد که معنای اصلی دستورها را حفظ می‌کنند[3]. این prompt‌های adversarial در چهار سطح دشواری تغییر تولید شدند[1]:

  • سطح کاراکتر: وارد کردن غلط‌های تایپی، جایگزینی یا جابه‌جایی کاراکترها (شبیه‌سازی خطاهای تصادفی ورودی).
  • سطح کلمه: جایگزینی برخی کلمات با مترادف، وارد کردن کلمات «پر سر و صدا» یا سایر تغییرات واژگانی جزئی.
  • سطح جمله: بازنویسی ساختار جملات، افزودن یا جابه‌جایی بخش‌هایی از عبارت بدون تغییر موضوع کلی.
  • سطح معنایی: بازفرمول‌بندی عمیق‌تر درخواست با حفظ وظیفه آن (مثلاً فرمول‌بندی‌های جایگزین برای همان سؤال)[1].

هدف از این «حملات» آزمایش این است که انحرافات جزئی (مثلاً غلط‌های تایپی تصادفی یا استفاده از فرمول‌بندی‌های مترادف) چگونه بر توانایی مدل در اجرای صحیح وظیفه تأثیر می‌گذارند، در حالی که خود وظیفه تغییر نکرده است[1]. هر prompt adversarial تولیدشده بر روی تعدادی از وظایف استاندارد NLP اعمال شد، از جمله تحلیل احساسات، تشخیص صحت دستوری، یافتن جملات تکراری، استنتاج منطقی (NLI)، درک مطلب، ترجمه ماشینی و حل مسائل ریاضی[1]. برای آزمایش‌ها، ۸ نوع مختلف وظیفه بر روی ۱۳ dataset انتخاب شد — از مجموعه‌های کلاسیک GLUE (مانند SST-2 برای تحلیل احساسات، MNLI برای NLI) تا آزمون‌های تخصصی ریاضی و چندزبانه[1].

مهم است که پایداری فرمت‌های مختلف prompt نیز آزمایش شد[1]:

  • درخواست‌های مستقیم بدون مثال (zero-shot، فقط دستورالعمل).
  • درخواست‌های با چند مثال (few-shot، هنگامی که نمونه‌های حل در prompt آورده شده‌اند).
  • prompt‌های نقش‌محور (in-context roles، مثلاً «شما یک سیستم تحلیل احساسات هستید، تعیین کنید...»).
  • prompt‌هایی که وظیفه را توصیف می‌کنند (task-oriented، توصیف مستقیم دستور)[1].

همچنین مدل‌های زبانی بزرگ مقیاس مختلف از Flan-T5-large و مدل UL2 نسبتاً کوچک‌تر تا ChatGPT و GPT-4 پیشرفته، و نیز مدل‌های متن‌باز خانواده LLaMA 2 و مشتق آن‌ها Vicuna آزمایش شدند[1]. برای تولید حملات از روش‌های موجود در حوزه adversarial NLP (مانند TextBugger، DeepWordBug، TextFooler و غیره) استفاده شد که برای تغییر prompt‌ها به جای داده‌های ورودی تطبیق یافته بودند[1]. صحت prompt‌های «تحریف‌شده» با روش‌های خودکار و دستی بررسی شد؛ طبق گزارش، حداقل ۸۵٪ از تغییرات adversarial معناشناسی صحیح را حفظ می‌کنند و برای انسان قابل فهم هستند[1]. بدین ترتیب، تأثیر حملات دقیقاً منعکس‌کننده اختلال در درک مدل از دستور بازنویسی‌شده است، نه از دست دادن خود معنای وظیفه.

نتایج و نتیجه‌گیری‌ها

آزمایش‌ها نشان داد که مدل‌های زبانی بزرگ مدرن به اندازه کافی در برابر تغییرات جزئی در فرمول‌بندی درخواست پایدار نیستند[3]. برای همه مدل‌های آزمایش‌شده، کاهش قابل توجهی در کیفیت پاسخ‌ها تحت تأثیر حملات تولیدشده مشاهده شد[3]. به ویژه، حتی موارد ساده — مانند غلط تایپی در متن یک مسئله ریاضی یا جایگزینی یک کلمه کلیدی با مترادف آن — باعث می‌شد مدل پاسخ نادرستی بدهد، در حالی که بدون تحریف به درستی عمل می‌کرد[1]. نتیجه‌گیری کلی نویسندگان: «مدل‌های زبانی بزرگ مدرن پایدار (robust) نیستند در برابر prompt‌های adversarial»[3]، یعنی انحرافات جزئی در فرمول‌بندی می‌توانند به صورت سیستماتیک آن‌ها را به اشتباه بیندازند.

در تحلیل انواع مختلف حملات مشخص شد که تغییرات در سطح کلمه مخرب‌ترین تأثیر را بر عملکرد مدل‌های زبانی بزرگ دارند[2]. جایگزینی کلمات با مترادف یا تحریف جزئی واژه‌سازی منجر به بیشترین افت کیفیت شد — به طور میانگین حدود ۳۳٪ نسبت به نتیجه اصلی در همان وظایف[2]. حملات در سطح کاراکتر (غلط‌های تایپی، کاراکترهای تصادفی) به طور میانگین ~۲۰٪ کاهش دقت ایجاد کردند[2]. تغییر کیفی یا افزودن جملات کامل به prompt، برعکس، تأثیر بسیار ضعیف‌تری داشت و تقریباً مدل را گیج نمی‌کرد[1]. بازنویسی‌های معنایی (بازگویی عمیق درخواست به شیوه دیگر) از نظر مخرب بودن با غلط‌های تایپی ساده قابل مقایسه بودند[1]. این واقعیت‌ها تأکید می‌کنند که مدل‌های زبانی بزرگ به ویژه در برابر تغییرات واژگانی ظریف و خطاها در کلمات کلیدی آسیب‌پذیر هستند[1]. قابل توجه است که تحریف‌های دستوری (غلط‌های تایپی) را می‌توان با ابزارهای استاندارد بررسی املا فیلتر کرد، در حالی که تغییرات در سطح کلمه و معنا از مدل نیاز به درک معنایی پیشرفته دارند که مدل‌های فعلی اغلب فاقد آن هستند[1].

تحلیل عملکرد مدل‌های مختلف پراکندگی قابل توجهی در پایداری آن‌ها نشان داد[1]. GPT-4 و UL2 بهترین پایداری را در برابر prompt‌های adversarial نشان دادند[1]. مدل Flan-T5-large و مدل گفتگویی ChatGPT نیز کمی کمتر در معرض اختلال بودند[1]. مدل‌های خانواده LLaMA 2 جایگاه میانی را اشغال کردند، در حالی که Vicuna (13B) به عنوان آسیب‌پذیرترین مدل در برابر همه انواع حملات متمایز شد[1]. جالب است که اندازه مدل عامل تعیین‌کننده پایداری نبود[1]: T5-large نسبتاً کوچک از نظر ثبات پاسخ تقریباً کمتر از ChatGPT بسیار بزرگ‌تر عقب نماند[1]. نویسندگان فرض می‌کنند که روش‌های آموزش و fine-tuning مدل‌ها نقش کلیدی دارند، نه فقط مقیاس[1]. به این ترتیب، UL2 و T5-large پیش‌آموزش گسترده‌ای روی corpus‌های داده بزرگ داشتند، و ChatGPT با تقویت از بازخورد انسانی (RLHF) آموزش دیده بود، که می‌توانست پایداری آن‌ها را تقویت کند[1]. در مقابل، Vicuna روی مجموعه داده نسبتاً محدودی آموزش دیده بود (به عنوان یک replica متن‌باز)، که احتمالاً حساسیت بالای آن به تغییر فرمول‌بندی را توضیح می‌دهد[1]. این نتایج نشان می‌دهند که بهبود روش‌های fine-tuning می‌تواند قابلیت اطمینان مدل‌ها را بیشتر از صرفاً افزایش اندازه آن‌ها ارتقا دهد.

تأثیر فرمت prompt

شکل ارائه درخواست نیز بر قابلیت اطمینان پاسخ تأثیر می‌گذارد[1]. مشخص شد که prompt‌های با مثال (few-shot) پایداری مدل را به طور قابل توجهی افزایش می‌دهند در مقایسه با دستورالعمل‌های تک‌مرحله‌ای بدون مثال (zero-shot)[1]. وجود چند مثال نمایشی از وظیفه در prompt به مدل کمک می‌کند تا دستور را حتی در حضور تغییرات پر سر و صدا دقیق‌تر تفسیر کند. prompt‌های نقش‌محور و توصیفی (task-oriented) در کل سطح پایداری قابل مقایسه‌ای نشان دادند، هرچند اثربخشی آن‌ها از وظیفه به وظیفه متفاوت بود[1]. برای مثال، در داده‌های تحلیل احساسات و جملات تکراری فرمت نقش‌محور کمی قابل اعتمادتر بود، در حالی که در وظایف درک مطلب و ترجمه دستورالعمل‌های صریح وظیفه بهتر عمل کردند[1]. این مشاهدات می‌توانند راهنمایی برای طراحی prompt باشند: افزودن مثال‌های گسترده و زمینه نقش احتمال خطای مدل بر روی فرمول‌بندی‌های غیرمعمول را کاهش می‌دهد.

انتقال‌پذیری حملات بین مدل‌ها

انتقال‌پذیری (transfer) حملات بین مدل‌ها محدود بود[1]. prompt‌های adversarial که به طور خاص علیه یک مدل طراحی شده بودند، همیشه به همان اندازه علیه مدل دیگری مؤثر نبودند[1]. به این ترتیب، مشاهده شد که prompt‌های «تله» تولیدشده برای آسیب‌پذیری‌های ChatGPT تأثیر بسیار کمتری روی GPT-4 دارند[1]. دومی بهتر عمل کرد، احتمالاً به این دلیل که حملات مستقیماً به معماری آن منتقل نشدند — آنچه یک مدل را گیج می‌کند ممکن است روی مدل پیشرفته‌تری با آموزش متفاوت کارگر نباشد[1]. با این حال، برخی از انواع ساده تحریف (مثلاً غلط‌های تایپی) تأثیر منفی بر چند مدل همزمان داشتند، که نشان‌دهنده نقاط ضعف مشترک در پایه زبانی آن‌هاست.

توصیه‌های عملی

در جریان کار PromptBench، توصیه‌های عملی برای کاربران و توسعه‌دهندگان مدل‌های زبانی بزرگ نیز شناسایی شدند[2]. نتیجه‌گیری ساده: ثبات فرمول‌بندی اهمیت دارد[2]. باید از غلط‌های تایپی و فرمول‌بندی‌های سهل‌انگارانه در درخواست پرهیز کرد[2]. نویسندگان نشان می‌دهند که تصحیح حتی خطاهای کوچک (املا، حروف تصادفی، فاصله‌های اضافی) می‌تواند به طور قابل توجهی قابلیت اطمینان پاسخ مدل را افزایش دهد[2]. علاوه بر این، انتخاب کلمات در دستورالعمل بر پایداری آن تأثیر می‌گذارد[2]. تحلیل فراوانی اصطلاحات در prompt‌های پایدار در مقابل آسیب‌پذیر نشان داد که برخی کلمات بیشتر در prompt‌های «قابل اعتماد» ظاهر می‌شوند و برخی دیگر در مواردی که مدل دچار خطا شده است[2]. برای مثال، prompt‌هایی که حاوی کلمات «acting»، «provided»، «detection» و مانند آن بودند کمتر منجر به اختلال می‌شدند، در حالی که کلماتی مانند «respond»، «following» یا «examine» در موارد مشکل‌دارتر دیده می‌شدند[2]. این نشان می‌دهد که سبک و واژگان خاصی از درخواست‌ها می‌توانند آسیب‌پذیری‌های مدل را کاهش دهند یا برعکس، برانگیزند. به طور کلی توصیه می‌شود درخواست را تا حد امکان واضح، بدون ابهام و با اصطلاحات آشنا برای مدل فرمول‌بندی کرد، به ویژه برای کاربردهای حیاتی[2].

یک اثر جانبی جالب که محققان اشاره کردند — تأثیر افزودن قطعات متنی بی‌معنی یا نامرتبط به درخواست است[2]. مشخص شد که درج یک دنباله تصادفی از کاراکترها (مثلاً «LKF0FZxMZ4») در انتها یا وسط prompt می‌تواند توجه مدل را پرت کند و دقت پاسخ آن را کاهش دهد[2]. از سوی دیگر، افزودن یک عبارت خنثی اما دستوری درست (مثلاً «and true is true» — «و حق همان حق است») در برخی موارد برعکس پاسخ را بهبود می‌داد، گویی مدل را بر بخش‌های معنادار سؤال متمرکز می‌کرد[2]. این پدیده تأکید می‌کند که مدل‌های زبانی بزرگ چقدر به صورت غیرقابل پیش‌بینی به جزئیات به ظاهر بی‌اهمیت ورودی واکنش نشان می‌دهند. همچنین نشانه‌ای از پیچیدگی ساختار داخلی مدل‌هاست: کوچکترین تغییرات زمینه می‌توانند عملکرد آن‌ها را یا مختل کنند یا بهبود دهند، بسته به اینکه توجه مدل چگونه توزیع مجدد می‌شود.

اهمیت و توسعه بیشتر

PromptRobust/PromptBench سهم قابل توجهی در درک قابلیت اطمینان مدل‌های زبانی بزرگ داشته است[2]. benchmark پیشنهادشده و داده‌های جمع‌آوری‌شده برای جامعه باز هستند: کد و مجموعه‌های prompt‌های adversarial در مخزن در دسترس هستند[1]. این امکان را به سایر محققان می‌دهد تا مدل‌های جدید را از نظر پایداری در برابر تنوع درخواست‌ها آزمایش کنند و نتایج را مقایسه کنند[1]. گام بعدی توسعه روش‌های محافظت از مدل‌ها در برابر چنین حملاتی است — برای مثال، الگوریتم‌های آموزش بهبودیافته که غلط‌های تایپی و بازنویسی‌های احتمالی را در نظر می‌گیرند، یا سیستم‌های نرمال‌سازی داخلی گفتار ورودی[2]. PromptBench هم‌اکنون به عنوان پایه‌ای برای چنین پژوهش‌هایی در جهت افزایش robustness (پایداری) مدل‌های زبانی در برابر داده‌های ورودی نادقیق واقعی در نظر گرفته می‌شود[2].

در نهایت، کار Zhu و همکاران اهمیت توجه به پایداری در برابر prompt‌ها را هنگام استقرار مدل‌های زبانی بزرگ در کاربردهای عملی نشان می‌دهد: مدل‌ها باید نه تنها دقت بالایی روی داده‌های «تمیز» نشان دهند، بلکه صحت را در صورت انحرافات جزئی در ورودی نیز حفظ کنند، چه خطاهای تصادفی کاربر باشند و چه تأثیرات حمله‌ای عمدی[2][4].

پیوندها

  • مقاله اصلی PromptBench (arXiv)
  • مخزن PromptBench در GitHub
  • مقاله «Prompt Robustness: How to Measure and How to Enhance» (Towards AI)

منابع

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

یادداشت‌ها

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 «PromptBench: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». arXiv. [۱]
  2. 2.00 2.01 2.02 2.03 2.04 2.05 2.06 2.07 2.08 2.09 2.10 2.11 2.12 2.13 2.14 2.15 2.16 2.17 2.18 2.19 «Prompt Robustness: How to Measure and How to Enhance». Towards AI. [۲]
  3. 3.0 3.1 3.2 3.3 «PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». arXiv. [۳]
  4. «Realer Toxicity Prompts (RTP-2.0): Multilingual and Adversarial Prompts for Evaluating Neural Toxic Degeneration in Large Language Models». Language Technologies Institute - School of Computer Science - Carnegie Mellon University. [۴]