HellaSwag Benchmark (VI)
HellaSwag — là một bộ dữ liệu chuẩn (benchmark) được giới thiệu vào năm 2019 nhằm đánh giá khả năng hiểu các tình huống thường ngày (commonsense reasoning) của các mô hình trí tuệ nhân tạo trên ngôn ngữ tự nhiên[1]. Benchmark này được phát triển bởi một nhóm các nhà nghiên cứu từ Đại học Washington và Viện Trí tuệ Nhân tạo Allen.
Nhiệm vụ của HellaSwag là chọn phần kết thúc hợp lý nhất cho một ngữ cảnh văn bản cho trước. Đặc điểm then chốt của bộ dữ liệu nằm ở chỗ nó hoàn toàn đơn giản đối với con người, nhưng lại khiến ngay cả các mô hình ngôn ngữ tiên tiến cũng bị bối rối — những mô hình vốn dựa vào các quy luật thống kê bề mặt[2].
Lịch sử và tiền đề
HellaSwag là sự phát triển tiếp nối của các ý tưởng trong dataset SWAG (Situations With Adversarial Generations), được đề xuất bởi cùng nhóm tác giả vào năm 2018. Trong nhiệm vụ SWAG, các mô hình cần chọn phần tiếp theo có khả năng xảy ra nhất cho mô tả của một tình huống đơn giản. Ban đầu SWAG khó đối với các thuật toán, nhưng khi mô hình BERT xuất hiện, kết quả của nó trên SWAG đạt mức ~86%, gần bằng mức của con người[2].
Thành công này đã đặt ra nghi vấn: liệu BERT có thực sự "hiểu" văn bản, hay đơn giản là nó đã học cách nhận dạng các artifact thống kê và các mẫu có trong bộ dữ liệu? Các tác giả của HellaSwag đã đặt ra giả thuyết rằng kết quả cao của BERT không đến từ sự hiểu biết thực sự mà là do khớp với đặc thù của dataset. Họ đã chỉ ra rằng chỉ cần thay đổi nhỏ trong phân phối dữ liệu, độ chính xác của BERT sẽ giảm mạnh. Điều này có nghĩa là để đánh giá khách quan tiến bộ trong NLP, cần có một benchmark mới, phức tạp hơn và "hóc búa" hơn[2].
Mô tả và mục tiêu của dataset
HellaSwag được tạo ra như một bài kiểm tra nhằm phát hiện những hạn chế của các mô hình hiện đại trong việc hiểu mối quan hệ nhân quả và các kịch bản đời thường.
Cấu trúc nhiệm vụ
Mỗi ví dụ trong HellaSwag bao gồm hai phần:
- Ngữ cảnh: Một đoạn văn ngắn (đến ba câu), mô tả phần mở đầu của một tình huống nào đó.
- Bốn phương án kết thúc: Bốn phần tiếp theo có thể có của câu chuyện, cũng bao gồm vài câu.
Chỉ một trong số các phần kết thúc đó là đúng (thực tế), còn ba cái kia là sai, được tạo ra đặc biệt để đánh lừa mô hình.
Nguồn dữ liệu
Các ví dụ tình huống được lấy từ hai nguồn, bao quát một phổ rộng các kịch bản đời thường:
- ActivityNet Captions: Mô tả các hành động từ các video (ví dụ: "một người mở hộp dưa chuột").
- WikiHow: Hướng dẫn từ các bài viết (ví dụ: "cách thay lốp xe ô tô").
Mục tiêu của HellaSwag là tạo ra một benchmark mà con người giải quyết dễ dàng (theo trực giác), nhưng lại gây khó khăn tối đa cho các mô hình không có khả năng suy luận thông thường đầy đủ. Hiệu ứng này được các tác giả gọi là "hiệu ứng Goldilocks" (Goldilocks effect)[1].
Phương pháp Adversarial Filtering (AF)
Đổi mới then chốt trong quá trình tạo HellaSwag là phương pháp Adversarial Filtering (AF) — quá trình lọc lặp đi lặp lại các "bẫy" được thiết kế nhắm vào mô hình "nạn nhân" cụ thể. Phương pháp này cho phép tạo ra các phương án sai trông rất giống với phương án đúng từ góc độ của các mô hình thống kê.
Sơ đồ hoạt động của AF như sau:
- Sinh. Dựa trên ngữ cảnh ban đầu, một mô hình ngôn ngữ sinh (ví dụ: GPT) tạo ra nhiều phần kết thúc sai tiềm năng.
- Phân biệt. Một mô hình phân loại (ví dụ: BERT), đóng vai trò "nạn nhân", cố gắng phân biệt các phần tiếp theo được tạo ra với phần tiếp theo thực sự (đúng).
- Lựa chọn. Những phương án sai nào mà bộ phân loại cho là hợp lý nhất được chọn lại — tức là những phương án có xác suất khiến nó mắc lỗi cao nhất.
- Lặp lại. Quá trình được lặp lại nhiều lần cho đến khi các câu trả lời sai trở nên giống câu trả lời đúng nhất có thể đối với thuật toán.
- Xác minh bởi con người. Ở giai đoạn cuối, các bộ thu được (ngữ cảnh + 1 phần kết thúc đúng + 3 phương án sai tốt nhất) được đánh giá bởi con người. Những người đánh giá xác nhận rằng phương án đúng rõ ràng là tự nhiên nhất, còn tất cả các phương án thay thế đều chứa một số sự bất hợp lý mà con người có thể nhận ra[2].
Nhờ AF, mỗi ví dụ trong HellaSwag ngay từ đầu được xây dựng để đánh lừa mô hình, nhưng vẫn giữ tính minh bạch đối với con người.
Kết quả và ý nghĩa
HellaSwag đã trở thành một bài kiểm tra nghiêm ngặt đối với các mô hình hiểu văn bản. Kết quả thử nghiệm cho thấy khoảng cách rất lớn giữa trí tuệ máy móc và con người:
- Con người giải quyết các nhiệm vụ HellaSwag gần như không mắc lỗi, với độ chính xác khoảng 95-96%[2].
- Mô hình tốt nhất tại thời điểm tạo ra benchmark, BERT-Large, chỉ đạt ~47% độ chính xác. Các phương pháp đơn giản hơn cho kết quả không cao hơn đoán ngẫu nhiên (25%) là bao nhiêu[2].
Khoảng cách hơn 45 điểm phần trăm đã xác nhận giả thuyết rằng kết quả cao trên các bài kiểm tra trước không đồng nghĩa với sự hiểu biết thực sự. HellaSwag đã chứng minh rằng ngay cả sau khi được huấn luyện trên khối lượng dữ liệu khổng lồ, các mô hình vẫn không thể hình thành khả năng suy luận thông thường chung cho các tình huống mới.
Trong những năm tiếp theo, HellaSwag đã trở thành một trong những bài kiểm tra tiêu chuẩn cho các mô hình ngôn ngữ mới. Có thể theo dõi tiến bộ của các hệ thống AI qua kết quả của chúng trên benchmark này.
- Năm 2020, mô hình GPT-3 (175 tỷ tham số) cho thấy độ chính xác ~79% ở chế độ few-shot, vượt qua mức của nhiều mô hình chuyên biệt thời đó, nhưng vẫn thua con người đáng kể[3].
- Mãi đến năm 2023, các mô hình thế hệ mới như GPT-4 mới có thể đạt kết quả trên HellaSwag tương đương với con người (khoảng 95% độ chính xác)[4].
Việc tạo ra HellaSwag đã đánh dấu một cách tiếp cận mới trong việc đánh giá tiến bộ trong NLP, dựa trên ý tưởng benchmark tiến hóa: khi các mô hình ngày càng hoàn thiện hơn, cần tạo ra các bài kiểm tra mới, phức tạp hơn để phát hiện những điểm yếu của chúng.
Liên kết
- Trang web chính thức của dự án HellaSwag
- Bài báo khoa học «HellaSwag: Can a Machine Really Finish Your Sentence?»
Tài liệu tham khảo
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Chú thích
- ↑ 1.0 1.1 Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. [1]
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 Zellers, R. et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv:1905.07830, 2019. [2]
- ↑ Brown, T. B. et al. «Language Models are Few-Shot Learners». arXiv:2005.14165, 2020. [3]
- ↑ Zellers, R. et al. «HellaSwag Project Page». [4]