---
title: "HellaSwag benchmark"
source: "https://systems-analysis.info/wiki/HellaSwag_benchmark"
wiki: "systems-analysis.info/wiki"
article: "HellaSwag_benchmark"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Бенчмарки LLM"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 119
wiki_created_at: 2026-09-06T21:55:19Z
wiki_modified_at: 2026-09-06T21:55:19Z
downloaded_at: 2026-09-07T22:17:35Z
---

# HellaSwag benchmark

**HellaSwag** — это эталонный набор данных (бенчмарк), представленный в 2019 году для оценки способности моделей искусственного интеллекта к пониманию повседневных ситуаций (*commonsense reasoning*) на естественном языке<sup>[\[1\]](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_note-hellaswag_paper-1)</sup>. Бенчмарк был разработан группой исследователей из Вашингтонского университета и Институт искусственного интеллекта Аллена.

Задача HellaSwag заключается в выборе наиболее правдоподобного завершения для заданного текстового контекста. Ключевая особенность набора данных состоит в том, что он тривиален для человека, но ставит в тупик даже продвинутые [языковые модели](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели"), которые полагаются на поверхностные статистические закономерности<sup>[\[2\]](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_note-hellaswag_arxiv-2)</sup>.

## История и предпосылки

HellaSwag является развитием идей датасета **SWAG** (*Situations With Adversarial Generations*), предложенного той же группой авторов в 2018 году. В задаче SWAG моделям требовалось выбрать наиболее вероятное продолжение для описания простой ситуации. Изначально SWAG был сложен для алгоритмов, но с появлением модели BERT её результаты на SWAG достигли уровня **~86%**, практически сравнявшись с человеческими<sup>[\[2\]](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_note-hellaswag_arxiv-2)</sup>.

Этот успех породил сомнения: действительно ли BERT «понимает» текст, или же он просто научился распознавать статистические артефакты и шаблоны, присутствующие в наборе данных? Авторы HellaSwag выдвинули гипотезу, что высокий результат BERT объясняется не истинным пониманием, а подгонкой под специфику датасета. Они показали, что при малейшем изменении распределения данных точность BERT резко падает. Это означало, что для объективной оценки прогресса в NLP нужен новый, более сложный и «каверзный» бенчмарк<sup>[\[2\]](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_note-hellaswag_arxiv-2)</sup>.

## Описание и цели датасета

HellaSwag был создан как тест, призванный выявить ограничения современных моделей в понимании причинно-следственных связей и бытовых сценариев.

### Структура задачи

Каждый пример в HellaSwag состоит из двух частей:

1.  **Контекст**: Короткий абзац (до трёх предложений), описывающий начало некоторой ситуации.
2.  **Четыре варианта завершения**: Четыре возможных продолжения истории, также состоящие из нескольких предложений.

Только одно из этих завершений является правильным (реальным), а остальные три — ложными, сгенерированными специально для того, чтобы запутать модель.

### Источники данных

Примеры ситуаций были взяты из двух источников, охватывающих широкий спектр повседневных сценариев:

- **ActivityNet Captions**: Описания действий из видеороликов (например, «человек открывает банку с огурцами»).
- **WikiHow**: Инструкции из статей (например, «как поменять колесо на автомобиле»).

Цель HellaSwag — создать бенчмарк, который легко решается человеком (интуитивно), но максимально затрудняет задачу для моделей, которые не обладают полноценным здравым смыслом. Этот эффект авторы назвали «эффектом Златовласки» (*Goldilocks effect*)<sup>[\[1\]](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_note-hellaswag_paper-1)</sup>.

## Методика Adversarial Filtering (AF)

Ключевой инновацией при создании HellaSwag стал метод **Adversarial Filtering** (**AF**) — итеративный отбор «ловушек», предназначенных для конкретной модели-«жертвы». Этот метод позволил создать ложные варианты, которые обманчиво похожи на правильные с точки зрения статистических моделей.

Схема работы AF выглядит следующим образом:

1.  **Генерация**. На основе исходного контекста языковая модель-генератор (например, [GPT](https://systems-analysis.info/wiki/GPT "GPT")) создаёт множество потенциальных неправильных концовок.
2.  **Дискриминация**. Модель-классификатор (например, [BERT](https://systems-analysis.info/wiki/BERT "BERT")), выступающая в роли «жертвы», пытается отличить сгенерированные продолжения от реального (правильного).
3.  **Отбор**. Отбираются те ложные варианты, которые классификатор посчитал наиболее правдоподобными, то есть те, на которых он с наибольшей вероятностью ошибся.
4.  **Итерация**. Процесс повторяется многократно, пока ложные ответы не становятся максимально похожими на правильный для алгоритма.
5.  **Верификация человеком**. На финальном этапе полученные наборы (контекст + 1 правильная концовка + 3 лучшие ложные) оцениваются людьми. Оценщики подтверждают, что правильный вариант однозначно является наиболее естественным, а все альтернативы содержат какую-либо нелогичность, заметную человеку<sup>[\[2\]](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_note-hellaswag_arxiv-2)</sup>.

Благодаря AF, каждый пример в HellaSwag изначально сконструирован так, чтобы ввести модель в заблуждение, но при этом остаться прозрачным для человека.

## Результаты и значение

HellaSwag стал строгим испытанием для моделей понимания текста. Результаты тестирования показали огромный разрыв между машинным и человеческим интеллектом:

- **Человек** решает задачи HellaSwag практически безошибочно, с точностью около **95-96%**<sup>[\[2\]](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_note-hellaswag_arxiv-2)</sup>.
- Лучшая на момент создания модель, **BERT-Large**, достигла лишь **~47%** точности. Более простые методы показывали результат ненамного выше случайного угадывания (25%)<sup>[\[2\]](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_note-hellaswag_arxiv-2)</sup>.

Разрыв более чем в **45 процентных пунктов** подтвердил гипотезу о том, что высокие показатели на предыдущих тестах не означали реального понимания. HellaSwag продемонстрировал, что даже после обучения на огромных объёмах данных модели не могут выработать общий здравый смысл для новых ситуаций.

В последующие годы HellaSwag вошёл в число стандартных тестов для новых языковых моделей. Прогресс AI-систем можно было отслеживать по их результатам на этом бенчмарке.

- В 2020 году модель GPT-3 (175 млрд параметров) показала точность **~79%** в режиме *few-shot*, что превысило уровень многих специализированных моделей того периода, но всё ещё значительно уступало человеку<sup>[\[3\]](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_note-gpt3_paper-3)</sup>.
- Лишь в 2023 году модели нового поколения, такие как GPT-4, смогли достичь на HellaSwag результата, сопоставимого с человеческим (около **95%** точности)<sup>[\[4\]](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_note-hellaswag_official_site-4)</sup>.

Создание HellaSwag обозначило новый подход к оценке прогресса в NLP, основанный на идее **эволюционирующих бенчмарков**: по мере того как модели совершенствуются, необходимо создавать новые, более сложные тесты, выявляющие их слабые места.

## См. также

- [Оценка LLM](https://systems-analysis.info/wiki/%D0%9E%D1%86%D0%B5%D0%BD%D0%BA%D0%B0_LLM "Оценка LLM")
- [Бенчмарки LLM](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM "Бенчмарки LLM")
- [BERT](https://systems-analysis.info/wiki/BERT "BERT")
- [HumanEval benchmark](https://systems-analysis.info/wiki/HumanEval_benchmark "HumanEval benchmark")
- [MATH benchmark](https://systems-analysis.info/wiki/MATH_benchmark "MATH benchmark")

## Ссылки

- <a href="https://rowanzellers.com/hellaswag/" class="external text" rel="nofollow">Официальный сайт проекта HellaSwag</a>
- <a href="https://aclanthology.org/P19-1472/" class="external text" rel="nofollow">Научная статья «HellaSwag: Can a Machine Really Finish Your Sentence?»</a>

## Литература

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Примечания

1.  <span id="cite_note-hellaswag_paper-1">↑ <sup>[1,0](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_ref-hellaswag_paper_1-0)</sup> <sup>[1,1](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_ref-hellaswag_paper_1-1)</sup> Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». *Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics*. <a href="https://aclanthology.org/P19-1472/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-hellaswag_arxiv-2">↑ <sup>[2,0](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_ref-hellaswag_arxiv_2-0)</sup> <sup>[2,1](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_ref-hellaswag_arxiv_2-1)</sup> <sup>[2,2](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_ref-hellaswag_arxiv_2-2)</sup> <sup>[2,3](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_ref-hellaswag_arxiv_2-3)</sup> <sup>[2,4](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_ref-hellaswag_arxiv_2-4)</sup> <sup>[2,5](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_ref-hellaswag_arxiv_2-5)</sup> Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». *arXiv:1905.07830*, 2019. <a href="https://ar5iv.labs.arxiv.org/html/1905.07830" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-gpt3_paper-3">[↑](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_ref-gpt3_paper_3-0) Brown, T. B. et al. «Language Models are Few-Shot Learners». *arXiv:2005.14165*, 2020. <a href="http://arxiv.org/pdf/2005.14165" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-hellaswag_official_site-4">[↑](https://systems-analysis.info/wiki/HellaSwag_benchmark#cite_ref-hellaswag_official_site_4-0) Zellers, R. et al. «HellaSwag Project Page». <a href="https://rowanzellers.com/hellaswag/" class="external autonumber" rel="nofollow">[4]</a></span>
