WinoGrande benchmark
WinoGrande — это крупномасштабный эталонный набор данных, предназначенный для оценки способности систем искусственного интеллекта к рассуждениям на основе здравого смысла. Он содержит около 44 000 задач, основанных на формате Winograd Schema Challenge (WSC), но значительно расширенных и усложнённых с помощью «адверсариального» метода фильтрации для устранения статистических подсказок[1].
Датасет был разработан в 2019 году группой исследователей из Allen Institute for AI и Вашингтонского университета. Каждая задача представляет собой предложение с пропуском, который необходимо заполнить одним из двух вариантов, выбрав правильный на основе контекста и понимания ситуации. WinoGrande стал одним из ключевых бенчмарков в области обработки естественного языка (NLP)[2].
Предпосылки создания: устаревание WSC
Оригинальный Winograd Schema Challenge (WSC), предложенный в 2011 году, содержал всего 273 задачи и долгое время считался надёжным тестом на здравый смысл. Задачи в нём были сконструированы так, чтобы требовать понимания мира, а не простого сопоставления слов[3].
Однако к 2018–2019 годам, с появлением больших языковых моделей на архитектуре Трансформер, таких как BERT, ситуация изменилась. Модели научились «взламывать» тест, достигая точности около 90% за счёт эксплуатации непреднамеренных статистических закономерностей (артефактов) в данных, а не за счёт реального понимания[4]. WSC перестал быть надёжным индикатором, что и привело к необходимости создания нового, более сложного и масштабного бенчмарка — WinoGrande.
Разработка и метод adversarial filtering
Создание WinoGrande проходило в два основных этапа: массовая генерация задач и их последующая фильтрация.
Краудсорсинг
На первом этапе с помощью платформы Amazon Mechanical Turk была собрана большая база из более чем 47 000 предложений. Крауд-работники создавали пары предложений по схеме Winograd, что обеспечило лингвистическое разнообразие и «шум», свойственный естественной речи, в отличие от задач, написанных небольшой группой экспертов[1].
Алгоритм AfLite
Ключевой инновацией WinoGrande стал алгоритм AfLite (Adversarial Filtering Lite). Этот метод был разработан для автоматического отсеивания задач, которые могут быть решены с помощью простых статистических подсказок, не требуя здравого смысла. Алгоритм использовал простые модели для выявления и удаления тех примеров, где один из ответов был слишком очевидно связан с другими словами в предложении. Например, задача «Львы съели зебр, потому что они хищники» была бы отфильтрована, так как слово «хищники» статистически тесно ассоциируется со «львами».
В результате фильтрации было отброшено около 14% собранных данных. Финальная версия датасета включает 43 972 задания, что делает его значительно более надёжным и сложным тестом[1].
Результаты моделей и прогресс
При выпуске WinoGrande лучшие на тот момент модели показали результаты, значительно уступающие человеческим.
- RoBERTa (улучшенная версия BERT) достигла точности ~79%.
- Человек в среднем решает задачи с точностью ~94%[1].
Этот разрыв подтвердил, что AfLite-фильтрация успешно устранила многие «лёгкие» пути для моделей. Однако с развитием LLM этот разрыв начал сокращаться.
- К 2022 году модель ST-MoE-32B достигла 96,1% точности, превысив человеческий уровень[5].
- GPT-3 показала результат около 88%[6].
- GPT-4, без специального дообучения, решает задачи с точностью ~87,5%[7].
Влияние и критика
WinoGrande стал одним из ключевых бенчмарков для оценки здравого смысла и регулярно используется для тестирования новых моделей. Его результаты публикуются в технических отчётах ведущих ИИ-компаний и на платформах для сравнения моделей[8].
В то же время методика создания датасета стала предметом научной дискуссии. Некоторые исследователи отмечают, что массовый краудсорсинг мог привести к появлению неестественных или двусмысленных фраз. Также высказывались сомнения в том, что автоматическая фильтрация AfLite способна полностью устранить все скрытые артефакты[5]. Тем не менее, WinoGrande стимулировал не только прогресс в метриках, но и важную дискуссию о создании более устойчивых и надёжных методов оценки ИИ.
См. также
Ссылки
Литература
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Примечания
- ↑ 1,0 1,1 1,2 1,3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [1]
- ↑ «allenai/winogrande». Hugging Face. [2]
- ↑ «Winograd schema challenge». In Wikipedia. [3]
- ↑ Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [4]
- ↑ 5,0 5,1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [5]
- ↑ Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [6]
- ↑ OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [7]
- ↑ «Common Sense Reasoning On Winogrande». HyperAI. [8]