GSM8K (Grade School Math 8K) (VI)

From Systems analysis Wiki
Jump to navigation Jump to search

GSM8K (Grade School Math 8K) — là một bộ dữ liệu chuẩn chứa khoảng 8,5 nghìn bài toán văn bản ở trình độ toán học phổ thông. Bộ dữ liệu này được tạo ra vào năm 2021 bởi các nhà nghiên cứu từ OpenAI nhằm đánh giá và phát triển khả năng suy luận toán học nhiều bước của các mô hình ngôn ngữ lớn (LLM)[1]. GSM8K đã trở thành một trong những benchmark quan trọng nhất để đo lường tiến bộ trong lĩnh vực tư duy toán học của trí tuệ nhân tạo.

Mỗi bài toán trong dataset là một câu chuyện văn bản ngắn, việc giải quyết yêu cầu thực hiện từ 2 đến 8 phép tính số học liên tiếp (cộng, trừ, nhân, chia). Mặc dù có vẻ đơn giản, các bài toán đòi hỏi sự hiểu biết sâu sắc về văn bản và khả năng suy luận logic, khiến chúng trở nên thách thức với nhiều LLM[2].

Các đặc điểm chính

Quy mô và cấu trúc

Dataset GSM8K chứa khoảng 8500 bài toán, được chia thành hai phần:

  • Tập huấn luyện: ~7500 bài toán, được thiết kế để fine-tuning mô hình. Mỗi bài toán đi kèm với lời giải chi tiết từng bước.
  • Tập kiểm tra: ~1000 bài toán, được sử dụng để đánh giá độc lập hiệu suất của các mô hình[1].

Độ khó và nội dung

Các bài toán được cố tình soạn thảo sao cho một học sinh trung học có năng lực có thể giải được, nhưng đồng thời chúng đòi hỏi suy luận nhiều bước. Điều này cho phép kiểm tra không chỉ kiến thức toán học của mô hình, mà còn khả năng phân rã vấn đề và thực hiện các thao tác logic một cách tuần tự.

Sự đa dạng ngôn ngữ

Cách diễn đạt các bài toán trong GSM8K có sự đa dạng lớn về phong cách và cấu trúc ngôn ngữ. Điều này được thực hiện để kiểm tra khả năng của các mô hình trong việc hiểu điều kiện bài toán được diễn đạt theo nhiều cách khác nhau và tránh việc "học thuộc" các mẫu cụ thể[3].

Lịch sử và sự phát triển của việc đánh giá mô hình

Các mô hình đầu tiên và kết quả cơ sở

Trong công trình gốc năm 2021, các tác giả đã chỉ ra rằng ngay cả các mô hình lớn thời bấy giờ, chẳng hạn như GPT-3 (175 tỷ tham số), đã gặp phải những khó khăn đáng kể với dataset này. Sau khi fine-tuning và sử dụng một mô hình xác minh bổ trợ, độ chính xác của lời giải chỉ đạt khoảng 55%[1]. Kết quả này cho thấy rằng một lỗi nhỏ trong chuỗi suy luận có thể dẫn đến câu trả lời hoàn toàn sai.

Kỹ thuật đột phá: Chain-of-Thought

Bước đột phá trong việc giải các bài toán GSM8K là phương pháp «chuỗi suy luận» (Chain-of-Thought, CoT). Vào năm 2022, các nhà nghiên cứu từ Google đã chỉ ra rằng nếu khuyến khích mô hình trình bày rõ ràng các bước giải trước khi đưa ra câu trả lời, độ chính xác tăng lên đáng kể. Mô hình PaLM (540 tỷ tham số) khi sử dụng CoT đạt độ chính xác 58%[4]. Việc áp dụng kỹ thuật phức tạp hơn là self-consistency (tạo ra nhiều phương án giải và chọn câu trả lời xuất hiện nhiều nhất) đã cho phép nâng độ chính xác lên tới 74%[4].

Vượt qua trình độ con người

Kể từ năm 2023, các mô hình sinh mới nhất đã vượt qua trình độ con người trên benchmark này.

  • GPT-4 của OpenAI ở chế độ few-shot CoT (khi trong gợi ý được cung cấp một vài ví dụ về bài toán đã giải) đạt độ chính xác khoảng 92%[5], và với các chiến lược bổ sung — lên tới 97%[6].
  • Claude 2 của Anthropic cho kết quả 88%, còn phiên bản mới hơn Claude 3 — khoảng 95%[3].

Các chỉ số cao như vậy cho thấy sự tiến bộ đáng kể trong khả năng suy luận của LLM, nhưng cũng chỉ ra rằng GSM8K đang trở nên "gần như đã được giải quyết" đối với các mô hình tiên tiến, điều này thúc đẩy việc phát triển các benchmark phức tạp hơn, chẳng hạn như MATHMMLU.

Vai trò trong quá trình huấn luyện và phát triển mô hình

Ngoài việc đánh giá, GSM8K được sử dụng tích cực để huấn luyện và cải thiện các mô hình.

  • Fine-tuning (tinh chỉnh): Tập huấn luyện với các lời giải từng bước là nguồn tài nguyên quý giá để fine-tuning các mô hình về logic toán học.
  • Huấn luyện bộ xác minh: Trong công trình gốc của OpenAI, một phần dữ liệu GSM8K được sử dụng để huấn luyện một mô hình xác minh riêng biệt, đánh giá tính đúng đắn của các lời giải được tạo ra. Phương pháp huấn luyện riêng biệt giữa bộ tạo và bộ phê bình này đã chứng minh được hiệu quả của nó[1].
  • Prompt Engineering: Sự hiện diện của số lượng lớn các ví dụ cho phép các nhà nghiên cứu phát triển và hoàn thiện các kỹ thuật gợi ý, chẳng hạn như Chain-of-ThoughtTree-of-Thought, giúp huấn luyện mô hình suy luận mà không thay đổi trọng số của nó.

Liên kết

  • Trang dataset trên Papers With Code
  • Kho lưu trữ chính thức trên GitHub

Tài liệu tham khảo

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Ghi chú

  1. 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [1]
  2. «GSM8K Dataset». Papers With Code. [2]
  3. 3.0 3.1 «GSM8K Benchmark». Klu.ai. [3]
  4. 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [4]
  5. Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [5]
  6. «Achieving >97% on GSM8K». arXiv:2404.14963. [6]