WinoGrande benchmark

Материал из Systems analysis Wiki
Перейти к навигации Перейти к поиску

WinoGrande — это крупномасштабный эталонный набор данных, предназначенный для оценки способности систем искусственного интеллекта к рассуждениям на основе здравого смысла. Он содержит около 44 000 задач, основанных на формате Winograd Schema Challenge (WSC), но значительно расширенных и усложнённых с помощью «адверсариального» метода фильтрации для устранения статистических подсказок[1].

Датасет был разработан в 2019 году группой исследователей из Allen Institute for AI и Вашингтонского университета. Каждая задача представляет собой предложение с пропуском, который необходимо заполнить одним из двух вариантов, выбрав правильный на основе контекста и понимания ситуации. WinoGrande стал одним из ключевых бенчмарков в области обработки естественного языка (NLP)[2].

Предпосылки создания: устаревание WSC

Оригинальный Winograd Schema Challenge (WSC), предложенный в 2011 году, содержал всего 273 задачи и долгое время считался надёжным тестом на здравый смысл. Задачи в нём были сконструированы так, чтобы требовать понимания мира, а не простого сопоставления слов[3].

Однако к 2018–2019 годам, с появлением больших языковых моделей на архитектуре Трансформер, таких как BERT, ситуация изменилась. Модели научились «взламывать» тест, достигая точности около 90% за счёт эксплуатации непреднамеренных статистических закономерностей (артефактов) в данных, а не за счёт реального понимания[4]. WSC перестал быть надёжным индикатором, что и привело к необходимости создания нового, более сложного и масштабного бенчмарка — WinoGrande.

Разработка и метод adversarial filtering

Создание WinoGrande проходило в два основных этапа: массовая генерация задач и их последующая фильтрация.

Краудсорсинг

На первом этапе с помощью платформы Amazon Mechanical Turk была собрана большая база из более чем 47 000 предложений. Крауд-работники создавали пары предложений по схеме Winograd, что обеспечило лингвистическое разнообразие и «шум», свойственный естественной речи, в отличие от задач, написанных небольшой группой экспертов[1].

Алгоритм AfLite

Ключевой инновацией WinoGrande стал алгоритм AfLite (Adversarial Filtering Lite). Этот метод был разработан для автоматического отсеивания задач, которые могут быть решены с помощью простых статистических подсказок, не требуя здравого смысла. Алгоритм использовал простые модели для выявления и удаления тех примеров, где один из ответов был слишком очевидно связан с другими словами в предложении. Например, задача «Львы съели зебр, потому что они хищники» была бы отфильтрована, так как слово «хищники» статистически тесно ассоциируется со «львами».

В результате фильтрации было отброшено около 14% собранных данных. Финальная версия датасета включает 43 972 задания, что делает его значительно более надёжным и сложным тестом[1].

Результаты моделей и прогресс

При выпуске WinoGrande лучшие на тот момент модели показали результаты, значительно уступающие человеческим.

  • RoBERTa (улучшенная версия BERT) достигла точности ~79%.
  • Человек в среднем решает задачи с точностью ~94%[1].

Этот разрыв подтвердил, что AfLite-фильтрация успешно устранила многие «лёгкие» пути для моделей. Однако с развитием LLM этот разрыв начал сокращаться.

  • К 2022 году модель ST-MoE-32B достигла 96,1% точности, превысив человеческий уровень[5].
  • GPT-3 показала результат около 88%[6].
  • GPT-4, без специального дообучения, решает задачи с точностью ~87,5%[7].

Влияние и критика

WinoGrande стал одним из ключевых бенчмарков для оценки здравого смысла и регулярно используется для тестирования новых моделей. Его результаты публикуются в технических отчётах ведущих ИИ-компаний и на платформах для сравнения моделей[8].

В то же время методика создания датасета стала предметом научной дискуссии. Некоторые исследователи отмечают, что массовый краудсорсинг мог привести к появлению неестественных или двусмысленных фраз. Также высказывались сомнения в том, что автоматическая фильтрация AfLite способна полностью устранить все скрытые артефакты[5]. Тем не менее, WinoGrande стимулировал не только прогресс в метриках, но и важную дискуссию о создании более устойчивых и надёжных методов оценки ИИ.

См. также

Ссылки

Литература

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Примечания

  1. 1,0 1,1 1,2 1,3 Sakaguchi, K., Le Bras, R., Bhagavatula, C., Choi, Y. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv:1907.10641. [1]
  2. «allenai/winogrande». Hugging Face. [2]
  3. «Winograd schema challenge». In Wikipedia. [3]
  4. Kocijan, V. et al. «The defeat of the Winograd Schema Challenge». Artificial Intelligence. [4]
  5. 5,0 5,1 Lepore, J. «AI Has Been Surprising for Years». Carnegie Endowment for International Peace. [5]
  6. Brown, T. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165. [6]
  7. OpenAI. «GPT-4 Technical Report». arXiv:2303.08774. [7]
  8. «Common Sense Reasoning On Winogrande». HyperAI. [8]