GSM8K (Grade School Math 8K) (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

GSM8K (Grade School Math 8K) — това е еталонен набор от данни, съдържащ около 8,5 хиляди текстови задачи по математика от училищно ниво. Той е създаден през 2021 година от изследователи от OpenAI с цел оценка и развитие на способностите на големите езикови модели (LLM) за многостъпково математическо разсъждение[1]. GSM8K се превърна в един от ключовите benchmark-и за измерване на напредъка в областта на математическото мислене на изкуствения интелект.

Всяка задача в dataset-а представлява кратка текстова история, чието решение изисква извършването на от 2 до 8 последователни аритметични действия (събиране, изваждане, умножение, деление). Въпреки привидната простота, задачите изискват задълбочено разбиране на текста и логически разсъждения, което ги прави трудни за много LLM[2].

Ключови характеристики

Обем и структура

Dataset-ът GSM8K съдържа около 8500 задачи, разделени на две части:

  • Обучителна извадка: ~7500 задачи, предназначени за дообучение (fine-tuning) на модели. Всяка задача е снабдена с подробно стъпка по стъпка решение.
  • Тестова извадка: ~1000 задачи, използвани за независима оценка на производителността на моделите[1].

Сложност и съдържание

Задачите са умишлено съставени така, че да могат да бъдат решени от способен ученик от средното училище, но в същото време изискват многостъпкови разсъждения. Това позволява да се тества не толкова математическите знания на модела, колкото способността ѝ да декомпозира проблема и последователно да изпълнява логически операции.

Езиково разнообразие

Формулировките на задачите в GSM8K се отличават с голямо разнообразие от стилове и езикови конструкции. Това е направено с цел проверка на способността на моделите да разбират условията на задачите, изразени по различни начини, и да избягват „наизустяването" на конкретни шаблони[3].

История и еволюция на оценката на моделите

Ранни модели и базови резултати

В оригиналната работа от 2021 година авторите показаха, че дори крупните модели от онова време, като GPT-3 (175 млрд. параметъра), изпитваха значителни затруднения с dataset-а. След дообучение и използване на спомагателен модел-верификатор точността на решенията достигаше едва около 55%[1]. Този резултат демонстрира, че дори една малка грешка в логическата верига може да доведе до напълно грешен отговор.

Пробивни методики: Chain-of-Thought

Пробив в решаването на задачите от GSM8K стана подходът „верига на разсъждението" (Chain-of-Thought, CoT). През 2022 година изследователи от Google показаха, че ако моделът бъде насърчен изрично да описва стъпките на решението преди извеждането на отговора, точността нараства значително. Моделът PaLM (540 млрд. параметъра) с използване на CoT достигна 58% точност[4]. Прилагането на по-сложната техника self-consistency (генериране на няколко варианта на решение и избор на най-честия отговор) позволи точността да бъде повишена до 74%[4].

Преодоляване на човешкото ниво

Започвайки от 2023 година, най-новите генеративни модели надминаха човешкото ниво на този benchmark.

  • GPT-4 от OpenAI в режим few-shot CoT (когато в подсказката са дадени няколко примера за решени задачи) достигна точност около 92%[5], а с допълнителни стратегии — до 97%[6].
  • Claude 2 от Anthropic показа резултат 88%, а по-новата версия Claude 3 — около 95%[3].

Такива високи показатели свидетелстват за значителен напредък в способностите на LLM за разсъждение, но също така посочват, че GSM8K се превръща в „почти решен" за водещите модели, което стимулира разработването на по-сложни benchmark-и, като MATH и MMLU.

Роля в обучението и развитието на моделите

Освен за оценка, GSM8K се използва активно за обучение и усъвършенстване на модели.

  • Fine-tuning (дообучение): Обучителната извадка с решения стъпка по стъпка е ценен ресурс за дообучение на модели по математическа логика.
  • Обучение на верификатори: В оригиналната работа на OpenAI част от данните на GSM8K е използвана за обучение на отделен модел-верификатор, който оценявал правилността на генерираните решения. Този подход на разделно обучение на генератор и критик доказа своята ефективност[1].
  • Prompt Engineering: Наличието на голям брой примери позволи на изследователите да разработват и усъвършенстват техники за подсказки, като Chain-of-Thought и Tree-of-Thought, които обучават модела да разсъждава без промяна на неговите тегла.

Връзки

  • Страница на dataset-а в Papers With Code
  • Официално хранилище в GitHub

Литература

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Бележки

  1. 1.0 1.1 1.2 1.3 Cobbe, Karl et al. «Training Verifiers to Solve Math Word Problems». arXiv:2110.14168. [1]
  2. «GSM8K Dataset». Papers With Code. [2]
  3. 3.0 3.1 «GSM8K Benchmark». Klu.ai. [3]
  4. 4.0 4.1 Wei, Jason et al. «Language Models Perform Reasoning via Chain of Thought». Google Research Blog. [4]
  5. Yu, L., et al. «Solving Challenging Math Word Problems Using GPT-4». EMNLP 2023. [5]
  6. «Achieving >97% on GSM8K». arXiv:2404.14963. [6]