---
title: "HellaSwag Benchmark (PT)"
source: "https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)"
wiki: "systems-analysis.info/int"
article: "HellaSwag_Benchmark_(PT)"
language: "pt"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 2847
wiki_created_at: 2026-09-06T23:11:53Z
wiki_modified_at: 2026-09-06T23:11:53Z
downloaded_at: 2026-09-07T22:53:41Z
---

# HellaSwag Benchmark (PT)

**HellaSwag** — é um conjunto de dados de referência (benchmark) apresentado em 2019 para avaliar a capacidade dos modelos de inteligência artificial de compreender situações cotidianas (*commonsense reasoning*) em linguagem natural<sup>[\[1\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_note-hellaswag_paper-1)</sup>. O benchmark foi desenvolvido por um grupo de pesquisadores da Universidade de Washington e do Allen Institute for Artificial Intelligence.

A tarefa do HellaSwag consiste em escolher a conclusão mais plausível para um determinado contexto textual. A principal característica do conjunto de dados é que ele é trivial para humanos, mas desafiador até mesmo para modelos de linguagem avançados, que se baseiam em padrões estatísticos superficiais<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_note-hellaswag_arxiv-2)</sup>.

## História e contexto

O HellaSwag é uma evolução das ideias do dataset **SWAG** (*Situations With Adversarial Generations*), proposto pelo mesmo grupo de autores em 2018. Na tarefa SWAG, os modelos precisavam escolher a continuação mais provável para a descrição de uma situação simples. Inicialmente, o SWAG era complexo para os algoritmos, mas com o surgimento do modelo BERT, seus resultados no SWAG atingiram um nível de **~86%**, quase se igualando aos resultados humanos<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_note-hellaswag_arxiv-2)</sup>.

Esse sucesso levantou dúvidas: o BERT realmente "compreendia" o texto, ou apenas aprendeu a reconhecer artefatos estatísticos e padrões presentes no conjunto de dados? Os autores do HellaSwag levantaram a hipótese de que o alto desempenho do BERT se devia não a uma verdadeira compreensão, mas a um ajuste excessivo (*overfitting*) às especificidades do dataset. Eles mostraram que, com a menor alteração na distribuição dos dados, a precisão do BERT caía drasticamente. Isso significava que, para uma avaliação objetiva do progresso em PNL, era necessário um novo benchmark, mais complexo e "enganoso"<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_note-hellaswag_arxiv-2)</sup>.

## Descrição e objetivos do dataset

O HellaSwag foi criado como um teste projetado para revelar as limitações dos modelos modernos na compreensão de relações de causa e efeito e cenários do cotidiano.

### Estrutura da tarefa

Cada exemplo no HellaSwag consiste em duas partes:

1.  **Contexto**: Um parágrafo curto (até três sentenças) que descreve o início de uma situação.
2.  **Quatro opções de finalização**: Quatro possíveis continuações para a história, também compostas por algumas sentenças.

Apenas uma dessas finalizações é a correta (real), enquanto as outras três são falsas, geradas especificamente para confundir o modelo.

### Fontes de dados

Os exemplos de situações foram extraídos de duas fontes que cobrem uma ampla gama de cenários cotidianos:

- **ActivityNet Captions**: Descrições de ações de vídeos (por exemplo, "uma pessoa abre um pote de picles").
- **WikiHow**: Instruções de artigos (por exemplo, "como trocar o pneu de um carro").

O objetivo do HellaSwag é criar um benchmark que seja fácil para um ser humano resolver (intuitivamente), mas que dificulte ao máximo a tarefa para modelos que não possuem um senso comum robusto. Os autores chamaram esse efeito de "efeito Cachinhos Dourados" (*Goldilocks effect*)<sup>[\[1\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_note-hellaswag_paper-1)</sup>.

## Metodologia de Filtragem Adversária (AF)

A inovação central na criação do HellaSwag foi o método de **Filtragem Adversária** (**Adversarial Filtering** ou **AF**) — uma seleção iterativa de "armadilhas" projetadas para um modelo específico, considerado a "vítima". Esse método permitiu criar opções falsas que são enganosamente semelhantes às corretas do ponto de vista dos modelos estatísticos.

O esquema de funcionamento da AF é o seguinte:

1.  **Geração**. Com base no contexto inicial, um modelo de linguagem gerador (por exemplo, GPT) cria um grande número de possíveis finais incorretos.
2.  **Discriminação**. Um modelo classificador (por exemplo, BERT), atuando como a "vítima", tenta distinguir as continuações geradas da real (correta).
3.  **Seleção**. São selecionadas as opções falsas que o classificador considerou mais plausíveis, ou seja, aquelas em que ele teve a maior probabilidade de errar.
4.  **Iteração**. O processo é repetido várias vezes, até que as respostas falsas se tornem o mais semelhantes possível da correta para o algoritmo.
5.  **Verificação humana**. Na etapa final, os conjuntos resultantes (contexto + 1 final correto + 3 melhores finais falsos) são avaliados por humanos. Os avaliadores confirmam que a opção correta é inequivocamente a mais natural, enquanto todas as alternativas contêm alguma ilogicidade perceptível para uma pessoa<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_note-hellaswag_arxiv-2)</sup>.

Graças à AF, cada exemplo no HellaSwag é construído desde o início para enganar o modelo, mas permanecer transparente para um ser humano.

## Resultados e importância

O HellaSwag tornou-se um teste rigoroso para modelos de compreensão de texto. Os resultados dos testes mostraram uma enorme lacuna entre a inteligência de máquina e a humana:

- Um **ser humano** resolve as tarefas do HellaSwag quase sem erros, com uma precisão de cerca de **95-96%**<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_note-hellaswag_arxiv-2)</sup>.
- O melhor modelo na época de sua criação, o **BERT-Large**, alcançou apenas **~47%** de precisão. Métodos mais simples apresentaram resultados pouco acima da adivinhação aleatória (25%)<sup>[\[2\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_note-hellaswag_arxiv-2)</sup>.

A diferença de mais de **45 pontos percentuais** confirmou a hipótese de que as altas pontuações em testes anteriores não significavam uma compreensão real. O HellaSwag demonstrou que, mesmo após o treinamento em enormes volumes de dados, os modelos não conseguem desenvolver um senso comum geral para novas situações.

Nos anos seguintes, o HellaSwag tornou-se um dos testes padrão para novos modelos de linguagem. O progresso dos sistemas de IA pôde ser acompanhado por meio de seus resultados neste benchmark.

- Em 2020, o modelo GPT-3 (175 bilhões de parâmetros) demonstrou uma precisão de **~79%** no modo *few-shot*, superando o nível de muitos modelos especializados da época, mas ainda significativamente inferior ao desempenho humano<sup>[\[3\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_note-gpt3_paper-3)</sup>.
- Somente em 2023, modelos de nova geração, como o GPT-4, conseguiram alcançar um resultado no HellaSwag comparável ao desempenho humano (cerca de **95%** de precisão)<sup>[\[4\]](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_note-hellaswag_official_site-4)</sup>.

A criação do HellaSwag marcou uma nova abordagem na avaliação do progresso em PNL, baseada na ideia de **benchmarks evolutivos**: à medida que os modelos melhoram, é necessário criar testes novos e mais complexos para identificar seus pontos fracos.

## Ligações externas

- <a href="https://rowanzellers.com/hellaswag/" class="external text" rel="nofollow">Site oficial do projeto HellaSwag</a>
- <a href="https://aclanthology.org/P19-1472/" class="external text" rel="nofollow">Artigo científico "HellaSwag: Can a Machine Really Finish Your Sentence?"</a>

## Leitura adicional

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Notas

1.  <span id="cite_note-hellaswag_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_ref-hellaswag_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_ref-hellaswag_paper_1-1)</sup> Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». *Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics*. <a href="https://aclanthology.org/P19-1472/" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-hellaswag_arxiv-2">↑ <sup>[2.0](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_ref-hellaswag_arxiv_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_ref-hellaswag_arxiv_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_ref-hellaswag_arxiv_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_ref-hellaswag_arxiv_2-3)</sup> <sup>[2.4](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_ref-hellaswag_arxiv_2-4)</sup> <sup>[2.5](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_ref-hellaswag_arxiv_2-5)</sup> Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». *arXiv:1905.07830*, 2019. <a href="https://ar5iv.labs.arxiv.org/html/1905.07830" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-gpt3_paper-3">[↑](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_ref-gpt3_paper_3-0) Brown, T. B. et al. «Language Models are Few-Shot Learners». *arXiv:2005.14165*, 2020. <a href="http://arxiv.org/pdf/2005.14165" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-hellaswag_official_site-4">[↑](https://systems-analysis.info/int/HellaSwag_Benchmark_(PT)#cite_ref-hellaswag_official_site_4-0) Zellers, R. et al. «HellaSwag Project Page». <a href="https://rowanzellers.com/hellaswag/" class="external autonumber" rel="nofollow">[4]</a></span>
