---
title: "SuperGLUE"
source: "https://systems-analysis.info/wiki/SuperGLUE"
wiki: "systems-analysis.info/wiki"
article: "SuperGLUE"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Бенчмарки LLM"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 184
wiki_created_at: 2026-09-06T22:04:58Z
wiki_modified_at: 2026-09-06T22:04:58Z
downloaded_at: 2026-09-07T22:18:08Z
---

# SuperGLUE

**SuperGLUE** — это комплексный **[бенчмарк](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM "Бенчмарки LLM")** (набор тестовых заданий) для оценки систем обработки естественного языка, особенно **[больших языковых моделей](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели")** (БЯМ)<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Он был представлен в 2019 году группой исследователей под руководством Алекса Вана из Нью-Йоркского университета при участии Facebook AI Research и других организаций<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>.

Создание SuperGLUE было вызвано тем, что к середине 2019 года предшествующий бенчмарк [GLUE](https://systems-analysis.info/wiki/GLUE_benchmark "GLUE benchmark") стал «простой задачей» для современных моделей: совокупный показатель лучших моделей на GLUE достиг 88,4, превысив средний уровень человека (87,1)<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Таким образом, запас для дальнейшего прогресса сократился<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. В ответ на это авторы разработали SuperGLUE как более сложную альтернативу, способную обеспечить более строгую проверку понимания языка моделями<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Цель SuperGLUE — предоставить нейтральный и трудно «обучаемый» показатель прогресса в области общего языкового понимания для английского языка<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Ожидалось, что заметное улучшение результатов на SuperGLUE потребует существенных инноваций в методах машинного обучения — например, более эффективного обучения на небольших выборках, мультизадачного и самосупервайзного обучения<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Иными словами, в SuperGLUE включены задания, которые просты для человека, но сложны для машинного интеллекта<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>, чтобы стимулировать разработку моделей с истинно глубоким пониманием языка.

## Особенности и отличия от GLUE

SuperGLUE во многом повторяет формат [GLUE](https://systems-analysis.info/wiki/GLUE_benchmark "GLUE benchmark") — он предлагает единый **интегральный показатель качества** по совокупности задач, публичный **лидерборд** и **инструментарий** для анализа моделей<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Однако SuperGLUE привносит ряд улучшений и нововведений по сравнению с предшественником<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>:

- **Более сложные задания**: в SuperGLUE отобраны **восемь наиболее трудных задач**<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Две из них унаследованы из GLUE (в числе самых сложных там), остальные были выбраны из новых кандидатур на основе их сложности для современных NLP-моделей<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Таким образом, бенчмарк фокусируется на тех аспектах понимания, где модели ранее показывали наихудшие результаты.
- **Разнообразие форматов**: если в GLUE все задачи сводились к классификации предложений или пар предложений, то SuperGLUE включает более **широкий спектр форматов**<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Помимо классификации, добавлены задачи на **разрешение кореференции** и **ответы на вопросы**, требующие от модели понимания связного текста и **логического вывода**<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>.
- **Оценка человека на всех задачах**: для каждой задачи SuperGLUE рассчитан **базовый уровень производительности человека** (non-expert)<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>, подтверждающий, что даже сильные модели типа [BERT](https://systems-analysis.info/wiki/BERT "BERT") существенно уступали человеку на момент запуска бенчмарка<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Наличие **человеческого ориентира** (~90% совокупно) обеспечивает «запас» для роста модели и служит целевым ориентиром<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>.
- **Прозрачные правила и инструменты**: пересмотрены правила размещения результатов на лидерборде (для обеспечения честного сравнения и указания вклада авторов датасетов)<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Также опубликован новый открытый кодовый инструментарий для удобства тонкой настройки и мультизадачного обучения моделей на данных SuperGLUE<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>.

В совокупности эти меры делают SuperGLUE более надежным тестом для **обобщённых языковых способностей** моделей, не позволяющим достичь высоких результатов за счёт узкого читерства или подгонки под специфичные форматы прежнего GLUE<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>.

## Набор задач SuperGLUE

SuperGLUE cостоит из **восьми задач**, охватывающих разные аспекты понимания текста.

- **BoolQ** (Boolean Questions): задача типа **вопрос-ответ (QA)**, где каждому примеру дан короткий текст (отрывок из Википедии) и вопрос, на который нужно ответить «да» или «нет»<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Вопросы сформулированы пользователями (из поисковых запросов Google) и требуют извлечения явного или неявного факта из текста; метрика качества — доля правильных ответов (accuracy)<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>.
- **CB** (CommitmentBank): задача на **логическое следование** (textual entailment) с тремя классами<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Датасет состоит из коротких текстов, содержащих сложноподчинённые предложения; требуется определить, в какой степени автор текста **коммитирован к истинности** вложенного высказывания<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Фактически это проверка, выводится ли утверждение из данного контекста. Задача сложна из-за малых размеров выборки (ок. 250 примеров) и дисбаланса классов; качество оценивается по точности и F1-мере, усреднённой по классам<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>.
- **COPA** (Choice of Plausible Alternatives): задача на **причинно-следственное рассуждение**<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Модели даётся предпосылка (одно предложение) и нужно выбрать правильную причину или следствие из двух вариантов<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Все примеры COPA сформулированы вручную и требуют **здравого смысла** для установления причинно-следственной связи. Тематика включает ситуации из блогов и специализированной энциклопедии; метрика – точность (доля правильных выборов)<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Пример: дано предложение «ребёнок приобрёл иммунитет к болезни» и вопрос «в чём причина?» – человек сразу понимает, что правильный ответ «он получил вакцину», тогда как модели приходится угадывать причинную связь<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>.
- **MultiRC** (Multi-Sentence Reading Comprehension): задача на **многофразовое понимание текста** с элементами множественного выбора<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Модель получает абзац текста, вопрос по содержанию абзаца и список возможных ответов; нужно определить, какие ответы верны (в каждом вопросе может быть несколько правильных ответов)<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Особенности: для ответа на вопрос, как правило, требуется объединить информацию из нескольких предложений текста, что проверяет способность модели **связывать факты**<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Качество измеряется двумя метриками: F1 по ответам (учитывает частично верные наборы) и Exact Match - доля вопросов, на которые даны полностью правильные наборы ответов<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>.
- **ReCoRD** (Reading Comprehension with Commonsense Reasoning Dataset): задача на **чтение с пониманием и использованием знаний**<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Представляет собой модифицированный Cloze-тест: дан новостной текст (статья CNN/Daily Mail) и предложение с пропущенным сущностным словом; модель должна выбрать, какая сущность из текста подходит на место пропуска<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Варианты ответа задаются как все сущности, упомянутые в статье, при этом могут совпадать по сути<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Для успешного решения требуется понимание контекста и здравый смысл. Метрики – максимальный token-level F1 и Exact Match (точное совпадение) по предсказанным ответам<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>.
- **RTE** (Recognizing Textual Entailment): задача бинарной классификации на **текстовое следование** (entailment vs. not entailment)<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Набор данных объединяет примеры из нескольких конкурсов по распознаванию текстового вывода (серия RTE 1-5)<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Каждое задание содержит пару текстовых фрагментов (premise-hypothesis); модель должна определить, следует ли гипотеза из текста. В отличие от многих больших наборов данных, RTE довольно мал (ок. 2,5 тыс. обучающих примеров), но показал значительный выигрыш от трансфер-обучения: точность выросла с ~56% (уровень случайного угадывания) до ~86% с появлением моделей типа [BERT](https://systems-analysis.info/wiki/BERT "BERT")<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Тем не менее, на момент запуска SuperGLUE точность моделей всё ещё отставала от человека примерно на 8 процентных пунктов<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>, поэтому RTE был включён как одна из задач, сохранявших зазор до человеческого уровня.
- **WiC** (Word-in-Context): задача на **разрешение неоднозначности значения слова в контексте** (WSD)<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Дается два независимых предложения, в каждом из которых встречается одно и то же многозначное слово; нужно определить, использовано ли это слово **в том же значении** в обоих случаях<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Данные взяты из словарных ресурсов (WordNet, VerbNet, Wiktionary), поэтому охватывают широкий спектр слов и значений<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Задача формализована как бинарная классификация и оценивается по доле верных ответов. WiC требует от модели понимания тонких смысловых различий, фактически проверяя **лексическую семантику**.
- **WSC** (Winograd Schema Challenge): задача на **разрешение кореференции с использованием здравого смысла**<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Каждое задание состоит из одного предложения, содержащего местоимение, и списка из двух сущностей (существительных) из этого же предложения<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Требуется определить, к какому из предложенных существительных **относится данное местоимение**<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Пример классического winograd-предложения: «Трофей не поместился в чемодан, потому что он был слишком маленьким» – человек понимает, что «он» относится к чемодану (слишком маленьким был чемодан). Подобные примеры невозможно решить без **повседневного знания и контекста**<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. В GLUE уже присутствовал упрощённый вариант этой задачи (WNLI), но модели долгое время не могли превзойти на нём даже уровень случайности<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Лишь специальные приёмы, такие как добавление внешних данных с похожими примерами, подняли качество моделей на WSC до ~90% к 2019 году<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Однако человек решает задачи WSC практически без ошибок (~96-100% верных ответов)<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. В SuperGLUE включена оригинальная версия WSC в формате бинарной классификации (для каждой пары «местоимение-сущность» модель отвечает, совпадают ли они по референции)<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Эта задача остаётся одним из самых трудных тестов, требующих коммонсенс-размышлений.

Все тесты SuperGLUE имеют **закрытые тестовые наборы** с неизвестными для разработчиков ответами<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Модели отправляют свои предсказания на сервер, где вычисляется совокупный балл — усреднённая по задачам точность (для задач с несколькими метриками сначала усредняется внутренняя метрика)<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Такой единый **SuperGLUE score** упрощает сравнение моделей по общему уровню языкового интеллекта.

## Результаты и прогресс моделей

При запуске SuperGLUE авторы привели в качестве ориентира результаты сильной базовой модели (усиленного [BERT](https://systems-analysis.info/wiki/BERT "BERT")) – и они оказались **значительно ниже человеческих** на всех задачах<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. В среднем лучшая на тот момент модель набрала примерно **20 пунктов меньше**, чем человек, по интегральной метрике<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. На отдельных заданиях разрыв был особенно велик: например, в задаче WSC модель едва достигала ~65% точности против 100% у человека (отставание ~35 пунктов)<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Даже на «проще» выглядящих задачах (BoolQ, CB, RTE, WiC) автоматические системы уступали ~10 пунктов человеческому уровню<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. Эти различия подтвердили, что SuperGLUE действительно бросает серьёзный вызов текущим технологиям и не может быть решён тривиально.

Тем не менее, всего через несколько месяцев после появления SuperGLUE начался **быстрый прогресс**<sup>[\[1\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-neurips-main-1)</sup>. В конце 2019 года исследователи Google представили модель **[T5](https://systems-analysis.info/wiki/T5 "T5")** (Text-To-Text Transfer Transformer) с 11 миллиардами параметров, которая добилась совокупного результата 88,9, вплотную приблизившись к человеческому уровню ~89,8<sup>[\[2\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-reddit-t5-2)</sup>. Фактически, Т5 улучшила предыдущий рекорд на SuperGLUE сразу на 4,3 пункта и сократила долю ошибок почти на треть<sup>[\[2\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-reddit-t5-2)</sup>, оставив лишь минимальный разрыв в **0,9 пункта** до показателя человека<sup>[\[2\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-reddit-t5-2)</sup>. Разработчики отмечали, что SuperGLUE намеренно подобран так, что для людей задачи просты, поэтому выход модели на уровень ~89% стал важной вехой<sup>[\[2\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-reddit-t5-2)</sup>.

Первым же, кому удалось **превзойти усреднённое человеческое качество**, стала модель от Microsoft **DeBERTa** (Decoding-enhanced [BERT](https://systems-analysis.info/wiki/BERT "BERT") with disentangled attention)<sup>[\[3\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-microsoft-deberta-3)</sup>. В январе 2021 года исследователи сообщили, что версия DeBERTa с 1,5 млрд параметров набрала **89,9 балла**, чуть выше человеческого ориентира 89,8<sup>[\[3\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-microsoft-deberta-3)</sup>. Это был **первый случай**, когда единичная модель превосходила человека по метрике SuperGLUE<sup>[\[3\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-microsoft-deberta-3)</sup>. Вдобавок, ансамбль из нескольких моделей DeBERTA повысил рекорд до ~90,3 балла<sup>[\[3\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-microsoft-deberta-3)</sup>. Модель DeBERTa опередила прежнего лидера (Google Т5) примерно на 0,6% и продемонстрировала эффективность новых идей в архитектуре [Transformer](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer "Архитектура Transformer") (раздельное представление содержимого и позиции слов, улучшенный декодер масок и пр.)<sup>[\[4\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-syncedreview-deberta-4)</sup>.

Прогресс не остановился на достигнутом: по мере роста размеров и сложности языковых моделей результаты SuperGLUE продолжали улучшаться<sup>[\[5\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-microsoft-scaling-5)</sup>. К концу 2021 года на вершине лидерборда оказалась модель Microsoft **T-NLRv5** (семейство Microsoft Turing NLR) — она ещё больше увеличила разрыв сверх человеческого уровня<sup>[\[5\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-microsoft-scaling-5)</sup>. Последние нерешённые для машин задачи GLUE (например, тонкости NLI) были «закрыты» этой моделью, вплотную приблизившейся к **полноценному паритету с человеком** даже по самым трудным подзадачам<sup>[\[5\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-microsoft-scaling-5)</sup>.

На 2022-2023 годы порог человеческого уровня на SuperGLUE был уверенно преодолён несколькими независимыми крупными моделями<sup>[\[6\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-ainavigator-benchmarks-6)</sup>. Например, модель **PaLM** от Google (540 млрд параметров) при дообучении на задачах SuperGLUE достигла порядка 90,4 балла, а модель **GPT-4** (разработанная OpenAI) показала результат даже немного выше<sup>[\[6\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-ainavigator-benchmarks-6)</sup>. К середине 2023 года в таблице лидеров SuperGLUE насчитывалось сразу несколько моделей с результатом выше 90 (т.е. превышающих средний человеческий уровень)<sup>[\[6\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-ainavigator-benchmarks-6)</sup>. Можно говорить, что бенчмарк **практически решён** современными системами<sup>[\[6\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-ainavigator-benchmarks-6)</sup>: показатели лучших моделей настолько высоки, что превосходят возможности большинства неквалифицированных людей<sup>[\[6\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-ainavigator-benchmarks-6)</sup>. Этот успех свидетельствует о гигантском прогрессе в NLP за короткое время, но одновременно указывает на необходимость новых, ещё более сложных тестов для новейших моделей<sup>[\[6\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-ainavigator-benchmarks-6)</sup>. Уже появляются последующие бенчмарки (например, MMLU, BIG-Bench и др.), призванные проверять модели на более широкое понимание и эрудицию, выходящую за рамки задач SuperGLUE<sup>[\[6\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-ainavigator-benchmarks-6)</sup>.

## Влияние и дальнейшие исследования

SuperGLUE, таким образом, закрепился как **важный этап развития оценочных методик** в обработке языка<sup>[\[3\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-microsoft-deberta-3)</sup>. В энтузиастских и научных кругах его результаты стали своего рода «лакмусовой бумажкой» для новых архитектур БЯМ: достижение или превышение человеческого уровня на SuperGLUE воспринимается как признак передовой модели с глубоким языковым пониманием<sup>[\[3\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-microsoft-deberta-3)</sup>. Это отразилось и на практике — многие современные языковые модели, достигшие высоких результатов на SuperGLUE, легли в основу прикладных систем вопрос-ответ, диалоговых агентов, систем обобщения текста и др.<sup>[\[3\]](https://systems-analysis.info/wiki/SuperGLUE#cite_note-microsoft-deberta-3)</sup>. SuperGLUE продолжает использоваться исследователями для тонкой настройки и сравнения алгоритмов, хотя передовое положение теперь постепенно смещается к новым рубежам оценки искусственного интеллекта.

## См. также

- [Бенчмарки LLM](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM "Бенчмарки LLM")
- [Оценка LLM](https://systems-analysis.info/wiki/%D0%9E%D1%86%D0%B5%D0%BD%D0%BA%D0%B0_LLM "Оценка LLM")
- [GLUE benchmark](https://systems-analysis.info/wiki/GLUE_benchmark "GLUE benchmark")
- [Архитектура Transformer](https://systems-analysis.info/wiki/%D0%90%D1%80%D1%85%D0%B8%D1%82%D0%B5%D0%BA%D1%82%D1%83%D1%80%D0%B0_Transformer "Архитектура Transformer")
- [T5](https://systems-analysis.info/wiki/T5 "T5")

## Ссылки

- <a href="https://super.gluebenchmark.com/" class="external text" rel="nofollow">Официальный сайт SuperGLUE</a>
- <a href="http://papers.neurips.cc/paper/8589-superglue-a-stickier-benchmark-for-general-purpose-language-understanding-systems.pdf" class="external text" rel="nofollow">Оригинальная статья SuperGLUE (NeurIPS)</a>
- <a href="https://www.microsoft.com/en-us/research/blog/microsoft-deberta-surpasses-human-performance-on-the-superglue-benchmark/" class="external text" rel="nofollow">Статья Microsoft о достижении человеческого уровня DeBERTa</a>
- <a href="https://paperswithcode.com/dataset/superglue" class="external text" rel="nofollow">Страница датасета SuperGLUE на Papers With Code</a>

## Литература

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Примечания

1.  <span id="cite_note-neurips-main-1">↑ <sup>[1,00](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-0)</sup> <sup>[1,01](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-1)</sup> <sup>[1,02](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-2)</sup> <sup>[1,03](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-3)</sup> <sup>[1,04](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-4)</sup> <sup>[1,05](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-5)</sup> <sup>[1,06](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-6)</sup> <sup>[1,07](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-7)</sup> <sup>[1,08](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-8)</sup> <sup>[1,09](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-9)</sup> <sup>[1,10](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-10)</sup> <sup>[1,11](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-11)</sup> <sup>[1,12](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-12)</sup> <sup>[1,13](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-13)</sup> <sup>[1,14](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-14)</sup> <sup>[1,15](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-15)</sup> <sup>[1,16](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-16)</sup> <sup>[1,17](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-17)</sup> <sup>[1,18](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-18)</sup> <sup>[1,19](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-19)</sup> <sup>[1,20](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-20)</sup> <sup>[1,21](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-21)</sup> <sup>[1,22](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-22)</sup> <sup>[1,23](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-23)</sup> <sup>[1,24](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-24)</sup> <sup>[1,25](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-25)</sup> <sup>[1,26](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-26)</sup> <sup>[1,27](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-27)</sup> <sup>[1,28](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-28)</sup> <sup>[1,29](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-29)</sup> <sup>[1,30](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-30)</sup> <sup>[1,31](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-31)</sup> <sup>[1,32](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-32)</sup> <sup>[1,33](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-33)</sup> <sup>[1,34](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-34)</sup> <sup>[1,35](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-35)</sup> <sup>[1,36](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-36)</sup> <sup>[1,37](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-37)</sup> <sup>[1,38](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-38)</sup> <sup>[1,39](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-39)</sup> <sup>[1,40](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-40)</sup> <sup>[1,41](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-41)</sup> <sup>[1,42](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-42)</sup> <sup>[1,43](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-43)</sup> <sup>[1,44](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-44)</sup> <sup>[1,45](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-45)</sup> <sup>[1,46](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-46)</sup> <sup>[1,47](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-47)</sup> <sup>[1,48](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-48)</sup> <sup>[1,49](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-49)</sup> <sup>[1,50](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-50)</sup> <sup>[1,51](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-51)</sup> <sup>[1,52](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-52)</sup> <sup>[1,53](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-53)</sup> <sup>[1,54](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-54)</sup> <sup>[1,55](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-55)</sup> <sup>[1,56](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-56)</sup> <sup>[1,57](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-57)</sup> <sup>[1,58](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-neurips-main_1-58)</sup> Wang, Alex et al. (2019). «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». *NeurIPS*. <a href="http://papers.neurips.cc/paper/8589-superglue-a-stickier-benchmark-for-general-purpose-language-understanding-systems.pdf" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-reddit-t5-2">↑ <sup>[2,0](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-reddit-t5_2-0)</sup> <sup>[2,1](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-reddit-t5_2-1)</sup> <sup>[2,2](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-reddit-t5_2-2)</sup> <sup>[2,3](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-reddit-t5_2-3)</sup> «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit /r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-microsoft-deberta-3">↑ <sup>[3,0](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-microsoft-deberta_3-0)</sup> <sup>[3,1](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-microsoft-deberta_3-1)</sup> <sup>[3,2](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-microsoft-deberta_3-2)</sup> <sup>[3,3](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-microsoft-deberta_3-3)</sup> <sup>[3,4](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-microsoft-deberta_3-4)</sup> <sup>[3,5](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-microsoft-deberta_3-5)</sup> <sup>[3,6](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-microsoft-deberta_3-6)</sup> «Microsoft DeBERTa surpasses human performance on the SuperGLUE benchmark». *Microsoft Research Blog*. <a href="https://www.microsoft.com/en-us/research/blog/microsoft-deberta-surpasses-human-performance-on-the-superglue-benchmark/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-syncedreview-deberta-4">[↑](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-syncedreview-deberta_4-0) «Microsoft DeBERTa Tops Human Performance on SuperGLUE NLU Benchmark». *Synced Review*. <a href="https://syncedreview.com/2021/01/06/microsoft-deberta-tops-human-performance-on-superglue-nlu-benchmark/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-microsoft-scaling-5">↑ <sup>[5,0](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-microsoft-scaling_5-0)</sup> <sup>[5,1](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-microsoft-scaling_5-1)</sup> <sup>[5,2](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-microsoft-scaling_5-2)</sup> «Efficiently and effectively scaling up language model pretraining for best language representation model on GLUE and SuperGLUE». *Microsoft Research Blog*. <a href="https://www.microsoft.com/en-us/research/blog/efficiently-and-effectively-scaling-up-language-model-pretraining-for-best-language-representation-model-on-glue-and-superglue/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-ainavigator-benchmarks-6">↑ <sup>[6,0](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-ainavigator-benchmarks_6-0)</sup> <sup>[6,1](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-ainavigator-benchmarks_6-1)</sup> <sup>[6,2](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-ainavigator-benchmarks_6-2)</sup> <sup>[6,3](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-ainavigator-benchmarks_6-3)</sup> <sup>[6,4](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-ainavigator-benchmarks_6-4)</sup> <sup>[6,5](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-ainavigator-benchmarks_6-5)</sup> <sup>[6,6](https://systems-analysis.info/wiki/SuperGLUE#cite_ref-ainavigator-benchmarks_6-6)</sup> «The Ultimate Guide to AI Benchmarks». *The AI Navigator*. <a href="https://www.theainavigator.com/blog/the-ultimate-guide-to-ai-benchmarks/" class="external autonumber" rel="nofollow">[6]</a></span>
