---
title: "HellaSwag Benchmark (FA)"
source: "https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)"
wiki: "systems-analysis.info/int"
article: "HellaSwag_Benchmark_(FA)"
language: "fa"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Persian"
revision_id: 2837
wiki_created_at: 2026-09-06T23:11:45Z
wiki_modified_at: 2026-09-06T23:11:45Z
downloaded_at: 2026-09-07T22:53:38Z
---

# HellaSwag Benchmark (FA)

**HellaSwag** — یک مجموعه داده مرجع (benchmark) است که در سال ۲۰۱۹ برای ارزیابی توانایی مدل‌های هوش مصنوعی در درک موقعیت‌های روزمره (*commonsense reasoning*) به زبان طبیعی معرفی شد<sup>[\[1\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_note-hellaswag_paper-1)</sup>. این benchmark توسط گروهی از پژوهشگران دانشگاه واشینگتن و مؤسسه هوش مصنوعی آلن توسعه یافت.

وظیفه HellaSwag انتخاب معقول‌ترین تکمیل برای یک متن زمینه‌ای مشخص است. ویژگی کلیدی این مجموعه داده آن است که برای انسان بسیار ساده است، اما حتی مدل‌های زبانی پیشرفته‌ای را که بر الگوهای آماری سطحی تکیه می‌کنند، دچار سردرگمی می‌کند<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_note-hellaswag_arxiv-2)</sup>.

## تاریخچه و پیش‌زمینه

HellaSwag بسط ایده‌های dataset **SWAG** (*Situations With Adversarial Generations*) است که در سال ۲۰۱۸ توسط همان گروه از نویسندگان پیشنهاد شد. در وظیفه SWAG، مدل‌ها باید محتمل‌ترین ادامه برای توصیف یک موقعیت ساده را انتخاب می‌کردند. در ابتدا SWAG برای الگوریتم‌ها دشوار بود، اما با ظهور مدل BERT، نتایج آن بر روی SWAG به سطح **~۸۶٪** رسید و عملاً با عملکرد انسانی برابری کرد<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_note-hellaswag_arxiv-2)</sup>.

این موفقیت تردیدهایی را برانگیخت: آیا BERT واقعاً متن را «درک» می‌کند، یا صرفاً یاد گرفته است که آرتیفکت‌های آماری و الگوهای موجود در مجموعه داده را تشخیص دهد؟ نویسندگان HellaSwag این فرضیه را مطرح کردند که نتیجه بالای BERT نه از درک واقعی، بلکه از تطبیق با ویژگی‌های خاص dataset ناشی می‌شود. آن‌ها نشان دادند که با کوچک‌ترین تغییر در توزیع داده‌ها، دقت BERT به شدت کاهش می‌یابد. این به معنای آن بود که برای ارزیابی عینی پیشرفت در NLP، به یک benchmark جدید، پیچیده‌تر و «دام‌دارتر» نیاز است<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_note-hellaswag_arxiv-2)</sup>.

## توصیف و اهداف dataset

HellaSwag به عنوان آزمونی طراحی شد که هدف آن آشکار کردن محدودیت‌های مدل‌های مدرن در درک روابط علّی و سناریوهای روزمره است.

### ساختار وظیفه

هر نمونه در HellaSwag از دو بخش تشکیل شده است:

1.  **زمینه**: یک پاراگراف کوتاه (تا سه جمله) که آغاز یک موقعیت را توصیف می‌کند.
2.  **چهار گزینه تکمیل**: چهار ادامه ممکن برای داستان که هر کدام نیز از چند جمله تشکیل شده‌اند.

تنها یکی از این تکمیل‌ها درست (واقعی) است و سه مورد دیگر نادرست بوده و به‌طور خاص برای گمراه کردن مدل تولید شده‌اند.

### منابع داده

نمونه‌های موقعیت‌ها از دو منبع گرفته شده‌اند که طیف گسترده‌ای از سناریوهای روزمره را پوشش می‌دهند:

- **ActivityNet Captions**: توصیف اقدامات از ویدئوها (مثلاً «شخصی یک قوطی خیارشور را باز می‌کند»).
- **WikiHow**: دستورالعمل‌های مقالات (مثلاً «چگونه لاستیک خودرو را عوض کنیم»).

هدف HellaSwag ایجاد benchmark‌ای است که انسان به شکل شهودی به راحتی آن را حل کند، اما وظیفه را برای مدل‌هایی که فاقد عقل سلیم کامل هستند، حداکثر دشوار سازد. نویسندگان این اثر را «اثر گیسوطلایی» (*Goldilocks effect*) نامیدند<sup>[\[1\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_note-hellaswag_paper-1)</sup>.

## روش Adversarial Filtering (AF)

نوآوری کلیدی در ایجاد HellaSwag روش **Adversarial Filtering** (**AF**) بود — یک فرآیند تکراری برای انتخاب «دام‌هایی» که برای یک مدل «قربانی» خاص طراحی شده‌اند. این روش امکان ایجاد گزینه‌های نادرستی را فراهم کرد که از منظر مدل‌های آماری به‌طور فریبنده‌ای شبیه به گزینه‌های درست هستند.

طرح کارکرد AF به شرح زیر است:

1.  **تولید**. بر اساس زمینه اولیه، یک مدل زبانی مولد (مثلاً GPT) تعداد زیادی تکمیل نادرست احتمالی ایجاد می‌کند.
2.  **تمیز دادن**. یک مدل طبقه‌بند (مثلاً BERT) که نقش «قربانی» را ایفا می‌کند، تلاش می‌کند تکمیل‌های تولیدشده را از تکمیل واقعی (درست) تشخیص دهد.
3.  **انتخاب**. گزینه‌های نادرستی انتخاب می‌شوند که طبقه‌بند آن‌ها را معقول‌ترین تشخیص داده، یعنی بیشترین احتمال خطا را در مورد آن‌ها داشته است.
4.  **تکرار**. فرآیند بارها تکرار می‌شود تا پاسخ‌های نادرست برای الگوریتم حداکثر شبیه به پاسخ درست شوند.
5.  **تأیید انسانی**. در مرحله پایانی، مجموعه‌های به‌دست‌آمده (زمینه + ۱ تکمیل درست + ۳ تکمیل نادرست برتر) توسط انسان‌ها ارزیابی می‌شوند. ارزیاب‌ها تأیید می‌کنند که گزینه درست به‌طور قطعی طبیعی‌ترین است و تمام گزینه‌های جایگزین حاوی نوعی ناسازگاری منطقی قابل‌تشخیص برای انسان هستند<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_note-hellaswag_arxiv-2)</sup>.

به لطف AF، هر نمونه در HellaSwag از ابتدا به گونه‌ای ساخته شده است که مدل را گمراه کند، اما برای انسان شفاف باقی بماند.

## نتایج و اهمیت

HellaSwag به یک آزمون سخت‌گیرانه برای مدل‌های درک متن تبدیل شد. نتایج آزمایش شکاف عظیمی بین هوش ماشینی و انسانی را نشان داد:

- **انسان** وظایف HellaSwag را تقریباً بدون خطا و با دقتی حدود **۹۵-۹۶٪** حل می‌کند<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_note-hellaswag_arxiv-2)</sup>.
- بهترین مدل در زمان ایجاد این benchmark، **BERT-Large**، تنها به دقت **~۴۷٪** رسید. روش‌های ساده‌تر نتایجی اندکی بالاتر از حدس تصادفی (۲۵٪) نشان دادند<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_note-hellaswag_arxiv-2)</sup>.

شکاف بیش از **۴۵ واحد درصدی** فرضیه‌ای را تأیید کرد که نتایج بالا در آزمون‌های قبلی به معنای درک واقعی نبوده است. HellaSwag نشان داد که حتی پس از آموزش بر روی حجم عظیمی از داده‌ها، مدل‌ها قادر به ایجاد عقل سلیم کلی برای موقعیت‌های جدید نیستند.

در سال‌های بعد، HellaSwag به یکی از آزمون‌های استاندارد برای مدل‌های زبانی جدید تبدیل شد. پیشرفت سیستم‌های هوش مصنوعی را می‌توان از طریق نتایج آن‌ها در این benchmark دنبال کرد.

- در سال ۲۰۲۰، مدل GPT-3 (با ۱۷۵ میلیارد پارامتر) در حالت *few-shot* دقت **~۷۹٪** را نشان داد که از سطح بسیاری از مدل‌های تخصصی آن دوره فراتر رفت، اما همچنان به طور قابل‌توجهی از انسان عقب بود<sup>[\[3\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_note-gpt3_paper-3)</sup>.
- تنها در سال ۲۰۲۳ بود که مدل‌های نسل جدید مانند GPT-4 توانستند در HellaSwag به نتیجه‌ای قابل مقایسه با انسان (حدود **۹۵٪** دقت) دست یابند<sup>[\[4\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_note-hellaswag_official_site-4)</sup>.

ایجاد HellaSwag رویکرد جدیدی را در ارزیابی پیشرفت NLP مشخص کرد که بر ایده **benchmark‌های تکاملی** استوار است: همان‌طور که مدل‌ها بهبود می‌یابند، لازم است آزمون‌های جدید و پیچیده‌تری ایجاد شوند که نقاط ضعف آن‌ها را آشکار سازند.

## پیوندها

- وب‌سایت رسمی پروژه HellaSwag
- مقاله علمی «HellaSwag: Can a Machine Really Finish Your Sentence?»

## منابع

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## یادداشت‌ها

1.  <span id="cite_note-hellaswag_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_ref-hellaswag_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_ref-hellaswag_paper_1-1)</sup> Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». *Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics*. <a href="https://aclanthology.org/P19-1472/" class="external autonumber" rel="nofollow">[۱]</a></span>
2.  <span id="cite_note-hellaswag_arxiv-2">↑ <sup>[2.0](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_ref-hellaswag_arxiv_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_ref-hellaswag_arxiv_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_ref-hellaswag_arxiv_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_ref-hellaswag_arxiv_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_ref-hellaswag_arxiv_2-4)</sup> <sup>[2.5](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_ref-hellaswag_arxiv_2-5)</sup> Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». *arXiv:1905.07830*, 2019. <a href="https://ar5iv.labs.arxiv.org/html/1905.07830" class="external autonumber" rel="nofollow">[۲]</a></span>
3.  <span id="cite_note-gpt3_paper-3">[↑](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_ref-gpt3_paper_3-0) Brown, T. B. et al. «Language Models are Few-Shot Learners». *arXiv:2005.14165*, 2020. <a href="http://arxiv.org/pdf/2005.14165" class="external autonumber" rel="nofollow">[۳]</a></span>
4.  <span id="cite_note-hellaswag_official_site-4">[↑](https://systems-analysis.info/int/HellaSwag_Benchmark_(FA)#cite_ref-hellaswag_official_site_4-0) Zellers, R. et al. «HellaSwag Project Page». <a href="https://rowanzellers.com/hellaswag/" class="external autonumber" rel="nofollow">[۴]</a></span>
