---
title: "SafetyBench"
source: "https://systems-analysis.info/wiki/SafetyBench"
wiki: "systems-analysis.info/wiki"
article: "SafetyBench"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Бенчмарки LLM"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 180
wiki_created_at: 2026-09-06T22:04:55Z
wiki_modified_at: 2026-09-06T22:04:55Z
downloaded_at: 2026-09-07T22:18:06Z
---

# SafetyBench

**SafetyBench** — это первый **комплексный [бенчмарк](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM "Бенчмарки LLM")** для всесторонней оценки **безопасности [больших языковых моделей](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели")** <sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Он был разработан группой исследователей из Университета Цинхуа и представлен в 2023 году<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.

С развитием БЯМ (например, появлением ChatGPT) и их массовым внедрением усилилось внимание к проблемам безопасности таких систем<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Исследования показали, что диалоговые модели могут допускать утечки приватной информации пользователей или генерировать токсичные высказывания<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Таким образом, оценка безопасности БЯМ стала критически важной задачей для их надёжного применения на практике. Однако до недавнего времени отсутствовали комплексные бенчмарки (наборы тестов), охватывающие все основные аспекты безопасности модели; имеющиеся датасеты проверяли лишь отдельные стороны (например, токсичность либо социальные предубеждения) и не давали целостной картины<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Отсутствие всеобъемлющего метода оценки затрудняло как выявление уязвимостей, так и разработку более безопасных языковых моделей<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. SafetyBench был создан, чтобы восполнить этот пробел<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.

## Разработка и описание SafetyBench

SafetyBench представляет собой набор из **11 435 вопросов с выбором ответа** (multiple-choice), охватывающих **7 различных категорий** типичных проблем или угроз, связанных с содержанием, генерируемым ИИ<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Важной особенностью является **двуязычность**: каждый вопрос доступен на **английском** и **китайском** языках, что позволяет оценивать как англоязычные, так и китайские модели на единообразном материале<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. По сути, SafetyBench стал первым масштабным инструментом, позволяющим автоматически и с высокой точностью тестировать понимание моделью вопросов безопасного поведения и контента<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Формат заданий с одним правильным ответом, аналогичный известным бенчмаркам вроде [MMLU](https://systems-analysis.info/wiki/MMLU_benchmark "MMLU benchmark"), обеспечивает объективность и эффективность оценки, снижая зависимость от трудоемкой ручной проверки ответов модели<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.

Разработчики SafetyBench опирались на ранее предложенную таксономию типичных сценариев, связанных с небезопасным контентом<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. В частности, категории бенчмарка были выделены на основе 8 сценариев, описанных в работе Sun и соавт. (2023), однако одна из категорий (политически чувствительные темы) была исключена, чтобы избежать несопоставимости ответов в китайском и английском контекстах<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Таким образом, итоговый набор включает 7 категорий безопасности, общих для двух языков.

## Категории безопасности в SafetyBench

Каждый тестовый вопрос в SafetyBench относится к одной из семи категорий, охватывающих широкий спектр потенциально опасных или нежелательных аспектов<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Ниже приведены эти категории и их краткое описание:

- **Оскорбительное содержание** (Offensiveness) – угрозы, оскорбления, грубость, нецензурная брань, сарказм и другие проявления неприемлемого тона<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Модель должна уметь распознавать подобные выпады и противостоять токсичному или агрессивному контенту<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.
- **Предвзятость и дискриминация** (Unfairness and Bias) – проявления социального бэйаса и несправедливости по признакам расы, пола, религии и др<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Модель должна идентифицировать и избегать языковых конструкций, выражающих предубеждения или дискриминацию<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.
- **Физическое здоровье** (Physical Health) – ситуации и высказывания, способные повлиять на физическое здоровье человека<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Модель должна знать корректные, безопасные действия и советы для поддержания здоровья в разных жизненных обстоятельствах<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.
- **Психическое здоровье** (Mental Health) – вопросы, связанные с психологическим благополучием, эмоциями и ментальным здоровьем<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Модель должна предлагать правильные способы поддержания психического здоровья и предотвращения негативных эмоциональных воздействий<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.
- **Незаконная деятельность** (Illegal Activities) – сценарии, предполагающие противоправные действия<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Модель должна различать законное и незаконное поведение, обладать базовыми знаниями о нормах закона и не подстрекать к нарушению закона<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.
- **Этика и мораль** (Ethics and Morality) – ситуации, связанные с неэтичным или аморальным поведением, даже если оно не подпадает напрямую под закон<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Модель должна демонстрировать высокие этические стандарты и осуждать неэтичные поступки или высказывания<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.
- **Конфиденциальность и собственность** (Privacy and Property) – вопросы, касающиеся приватной информации, права собственности, финансовых рисков и т.д.<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup> Модель должна чутко понимать принципы конфиденциальности и имущественных прав и предотвращать непреднамеренное разглашение личных данных или причинение имущественного ущерба<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.

Каждая категория представлена сотнями или тысячами вопросов, что позволяет всесторонне проверить знание моделью соответствующих норм и принципов<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.

## Сбор и подготовка данных

Для формирования такого масштабного тестового набора авторы SafetyBench привлекли **разнообразные источники данных**<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. В исследовании указано, что вопросы собирались из трех основных источников<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>:

- **Существующие датасеты**: Для ряда категорий (в частности, оскорбления, предубеждения, физическое здоровье, этика) были использованы публично доступные наборы данных<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Авторы взяли исходные тексты из таких наборов и преобразовали их в формат вопросов с вариантами ответов<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Например, для категории Offensiveness частично использован корпус COLD (датасет детекции оскорблений в китайском языке)<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>; для английского языка привлечены данные из конкурса Jigsaw Toxic Comment и др.<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Аналогично, для Unfairness and Bias были задействованы китайские наборы (COLD, CDial-Bias) и англоязычные ресурсы<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Такой подход позволил покрыть сразу четыре категории за счет переработки уже размеченного материала<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.
- **Экзаменационные вопросы**: Помимо датасетов, исследователи вручную отобрали подходящие задания из различных экзаменационных материалов и опросников, посвященных вопросам безопасности и жизненных навыков<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. В частности, были извлечены вопросы из учебных экзаменов по этике и правоведению (например, школьные тесты по основам безопасности), которые соответствуют категориям Незаконная деятельность, Этика и мораль и другим смежным темам<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Каждый такой вопрос также приведен к формату множественного выбора и отнесён к одной из категорий<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.
- **Генерация новых вопросов**: Для некоторых аспектов (например, конфиденциальность или психическое здоровье), где в открытых источниках оказалось недостаточно разнообразных данных, авторы прибегли к генерации дополнительных вопросов с помощью самих языковых моделей высокого уровня (таких как ChatGPT)<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Были сформулированы промпты для создания разнообразных ситуаций по этим тематикам, после чего полученные варианты тщательно **отфильтрованы и проверены экспертами** перед включением в бенчмарк<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Такой контролируемый augmented подход позволил заполнить пробелы в покрытии категорий<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.

В итоге каждый вопрос SafetyBench был **двуязычно представлен** — на китайском и на английском языках<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Для обеспечения эквивалентности содержания авторы перевели все собранные английские вопросы на китайский и наоборот с помощью коммерческого API машинного перевода Baidu<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Использование данного перевода обусловлено тем, что некоторые высокоуровневые БЯМ (например, сам ChatGPT) отказывались обрабатывать или точно переводить потенциально опасный контент, иногда смягчая формулировки при переводе<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Автоматические переводы затем были вручную вычитаны и скорректированы, чтобы устранить возможные неточности или культурные нюансы<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. В целом все вопросы прошли этап **человеческой проверки качества**<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>, что призвано гарантировать корректность формулировок и соответствие ожидаемых ответов в обоих языках<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.

Распределение источников в итоговом датасете примерно следующее: около половины вопросов взято из открытых датасетов, значительная доля — из экзаменационных материалов, и оставшаяся часть сгенерирована моделями (после отбора)<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Такой подход обеспечил как широту охвата тем, так и достаточную глубину (множество примеров на каждую категорию).

## Методика экспериментов и результаты

После подготовки набора SafetyBench авторы провели масштабное тестирование современных языковых моделей, чтобы определить уровень их понимания вопросов безопасности. Оценка моделей осуществляется **автоматически**<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>: каждой модели поочередно задаются все вопросы (на соответствующем языке), и фиксируется доля правильных ответов (т.е. процент совпадения выбранного моделью варианта с верным ответом)<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Такой процент служит показателем того, насколько хорошо модель “разбирается” в проблемах безопасности и дает корректные с точки зрения безопасности ответы<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.

В испытаниях, проведенных разработчиками, участвовали **25 популярных БЯМ** различного происхождения (как открытые модели, так и проприетарные API-сервисы) на обоих языках<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Тестирование выполнялось в двух режимах: **zero-shot** (модели отвечают на вопросы без каких-либо примеров) и **few-shot** (моделям предварительно показывается несколько примеров вопросов с правильными ответами, чтобы задать контекст)<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Такой протокол позволяет оценить как базовые возможности модели, так и способность улучшать ответы при наличии обучающих подсказок.

Главный вывод тестов — **современные модели сильно разнятся по уровню безопасностных знаний, и ни одна из доступных БЯМ пока не является безупречной** во всех категориях<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Лидером по результатам стала модель **GPT-4** (OpenAI): она показала наивысшую среднюю точность и существенно опередила все остальные модели во множестве категорий<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. В режиме zero-shot GPT-4 превзошел ближайшего преследователя (модель GPT-3.5-turbo) почти на **10 процентных пунктов** по общей точности<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Разрыв особенно велик в отдельных областях, например, по вопросам физической безопасности и морально-этических дилемм GPT-4 отвечал правильно заметно чаще конкурентов<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.

В то же время даже у GPT-4 выявлены **слабые места**. В категории «Предвзятость и дискриминация» (Unfairness and Bias) эта модель справилась хуже относительно своих же результатов по другим разделам<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Анализ ответов показал, что GPT-4 иногда ошибочно помечает нейтральные высказывания о дискриминации как проявление предубеждения или путается в специфических выражениях и событиях<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Такие ошибки подчёркивают, что даже самая продвинутая модель может недооценивать культурные или языковые нюансы, влияющие на оценку этичности высказывания<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.

Остальные модели значительно отстали от GPT-4<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. В среднем большинство открытых БЯМ (включая разные версии [LLaMA](https://systems-analysis.info/wiki/LLaMA "LLaMA"), [Falcon](https://systems-analysis.info/wiki/Falcon "Falcon"), отечественные китайские модели и т.д.) показали **существенно более низкую точность**, зачастую не превышая 70-80% правильных ответов<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Многие из них особенно слабо справляются с отдельными категориями: например, ряд моделей набрали менее 70% по разделам, связанным с социальными предубеждениями или тонкими этическими вопросами<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. В совокупности ни одна модель (кроме GPT-4) не преодолела условный порог 80% по общему показателю безопасности, что говорит о большом просторе для дальнейшего улучшения их безопасного поведения<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Такая разница между GPT-4 и моделями с открытым кодом указывает на эффект более масштабного обучения и целевой alignment-настройки у закрытых моделей.

Интересно, что производительность некоторых систем оказалась **языкозависимой**<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Модели, созданные в Китае (например, Baidu Ernie, Alibaba Tongyi и др.), как правило, лучше отвечали на китайской версии тестов, чем на английской<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Напротив, семейство GPT-моделей от OpenAI продемонстрировало более сбалансированные результаты<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Это может отражать разный объем и качество обучения на соответствующих языковых данных, а также наличие встроенных фильтров или цензурных механизмов в некоторых региональных моделях.

При добавлении few-shot примеров (нескольких демонстрационных Q&A перед тестированием) наблюдались **разнонаправленные эффекты**<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Некоторые модели сумели заметно повысить точность благодаря подсказкам: так, большие языковые модели предыдущего поколения вроде text-davinci-003 (GPT-3) или китайская InternLM получили ощутимый прирост качества в режиме пять-шаг<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Однако у ряда моделей дополнительный контекст почти не улучшил результат, а в некоторых случаях даже снизил точность<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. В частности, для GPT-3.5 авторы зафиксировали небольшой **«отрицательный прирост» при few-shot**<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>, что они связывают с явлением **«налог выравнивания»** (alignment tax)<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Тем не менее, в среднем предоставление примеров сделало ответы более стабильными и снизило долю случаев, когда модель отказывается дать чёткий ответ<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.

Отдельно исследователи оценили производительность моделей на **фильтрованном поднаборе вопросов**, касающихся китайского языка<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Дело в том, что API некоторых крупных китайских моделей автоматически отклоняют запросы с определенными «чувствительными» словами<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Поэтому была сформирована сокращённая выборка из 2100 вопросов без триггерных слов, и на ней сравнили ряд моделей в пятнашаговом режиме<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Результаты показали, что на этой облегченной версии разрыв между GPT-4 и лучшими локальными моделями сокращается: так, китайская модель ChatGLM2 набрала всего на ~3% меньше GPT-4, практически сравнявшись с ней по совокупному баллу<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Также Ernie Bot от Baidu уверенно выступил по большинству категорий (кроме раздела предвзятости) и приблизился к лидерам<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Эти данные говорят о том, что под жестким фильтрующим контролем (исключив наиболее опасные запросы) некоторые национальные модели способны конкурировать с мировыми лидерами по части безопасного поведения.

## Значение бенчмарка и выводы разработчиков

SafetyBench представляет собой важный шаг к систематическому измерению и улучшению безопасности больших языковых моделей<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. В отличие от сценариев прямого взаимодействия (где пользователи могут пытаться «взломать» модель инструкциями или провокациями), данный бенчмарк фокусируется на способности ИИ **правильно понимать и различать безопасное и небезопасное содержание**<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Авторы подчёркивают, что такое понимание — необходимый фундамент для того, чтобы модель вообще могла генерировать безопасные ответы в открытых диалогах<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Напротив, глубокое усвоение норм морали, правил этикета, признаков токсичности и пр. облегчает настройку модели так, чтобы она избегала опасных высказываний и решений<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Таким образом, высокие показатели на SafetyBench можно рассматривать как **индикатор готовности модели к безопасной эксплуатации**<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>, а провалы в определённых категориях сигнализируют о зонах риска, требующих доработки<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>.

Важно отметить, что SafetyBench намеренно **не включает некоторые аспекты, связанные с атакой на сами инструкции модели** (так называемые jailbreak-промпты, манипулирование ролями и т.д.)<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Авторы объясняют, что проблемы типа instruction attacks имеют иную природу, связанную с конфликтом между выполнением пользовательского приказа и соблюдением встроенных правил безопасности<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Эти аспекты решаются другими методами и выходят за рамки понимания модели<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Поэтому SafetyBench сконцентрирован именно на содержательном уровне знаний модели о безопасном поведении. Тем не менее, совокупный охват семи ключевых категорий в бенчмарке уже сейчас позволяет выявлять уязвимости моделей: например, известно, что GPT-4 показывает относительно более слабый результат на вопросах о предвзятости, а некоторые открытые модели сильно отстают по разделам, связанным с моралью или законом<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Такая информация дает разработчикам конкретные ориентиры, над чем необходимо работать при дальнейшей дообучении или фильтрации ответов.

Бенчмарк SafetyBench **открыт для сообщества**<sup>[\[2\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-abs-2)</sup>: его данные и методические материалы выложены в свободном доступе<sup>[\[2\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-abs-2)</sup>, а на специально созданной платформе поддерживается **онлайн-лидерборд** результатов различных моделей<sup>[\[2\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-abs-2)</sup>. Исследователи приглашают разработчиков тестировать свои новые модели на этом наборе и публиковать результаты, что будет способствовать прозрачному сравнению систем и отслеживанию прогресса в повышении безопасности ИИ.

Наконец, авторы подчёркивают, что целью SafetyBench является **стимулировать улучшение моделей**<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>, а не просто создать очередной рейтинг<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. Они призывают разработчиков не ограничиваться попытками “подогнать" модель под тест, а системно устранять выявленные проблемные моменты<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. По мере того как новые версии моделей будут обучаться на большем количестве данных, с более сложными техниками alignment-настройки, ожидается рост их показателей и на SafetyBench<sup>[\[1\]](https://systems-analysis.info/wiki/SafetyBench#cite_note-arxiv-main-v2-1)</sup>. В перспективе этот бенчмарк может стать стандартным инструментом для проверки соответствия языковых моделей требованиям безопасности, а его методология — основой для разработки ещё более совершенных тестовых наборов в области ответственного ИИ.

## См. также

- [Бенчмарки LLM](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM "Бенчмарки LLM")
- [MMLU benchmark](https://systems-analysis.info/wiki/MMLU_benchmark "MMLU benchmark")
- [MT-Bench benchmark](https://systems-analysis.info/wiki/MT-Bench_benchmark "MT-Bench benchmark")
- [Оценка LLM](https://systems-analysis.info/wiki/%D0%9E%D1%86%D0%B5%D0%BD%D0%BA%D0%B0_LLM "Оценка LLM")
- [Falcon](https://systems-analysis.info/wiki/Falcon "Falcon")

## Ссылки

- <a href="https://arxiv.org/abs/2309.07045" class="external text" rel="nofollow">Оригинальная статья SafetyBench (arXiv)</a>
- <a href="https://github.com/thu-coai/SafetyBench" class="external text" rel="nofollow">Репозиторий SafetyBench на GitHub</a>
- <a href="https://huggingface.co/datasets/SafetyBench/SafetyBench" class="external text" rel="nofollow">Страница датасета SafetyBench на Hugging Face</a>
- <a href="https://aclanthology.org/2024.acl-long.830/" class="external text" rel="nofollow">Статья SafetyBench на ACL Anthology</a>

## Литература

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Примечания

1.  <span id="cite_note-arxiv-main-v2-1">↑ <sup>[1,00](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-0)</sup> <sup>[1,01](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-1)</sup> <sup>[1,02](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-2)</sup> <sup>[1,03](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-3)</sup> <sup>[1,04](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-4)</sup> <sup>[1,05](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-5)</sup> <sup>[1,06](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-6)</sup> <sup>[1,07](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-7)</sup> <sup>[1,08](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-8)</sup> <sup>[1,09](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-9)</sup> <sup>[1,10](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-10)</sup> <sup>[1,11](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-11)</sup> <sup>[1,12](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-12)</sup> <sup>[1,13](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-13)</sup> <sup>[1,14](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-14)</sup> <sup>[1,15](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-15)</sup> <sup>[1,16](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-16)</sup> <sup>[1,17](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-17)</sup> <sup>[1,18](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-18)</sup> <sup>[1,19](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-19)</sup> <sup>[1,20](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-20)</sup> <sup>[1,21](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-21)</sup> <sup>[1,22](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-22)</sup> <sup>[1,23](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-23)</sup> <sup>[1,24](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-24)</sup> <sup>[1,25](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-25)</sup> <sup>[1,26](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-26)</sup> <sup>[1,27](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-27)</sup> <sup>[1,28](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-28)</sup> <sup>[1,29](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-29)</sup> <sup>[1,30](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-30)</sup> <sup>[1,31](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-31)</sup> <sup>[1,32](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-32)</sup> <sup>[1,33](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-33)</sup> <sup>[1,34](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-34)</sup> <sup>[1,35](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-35)</sup> <sup>[1,36](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-36)</sup> <sup>[1,37](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-37)</sup> <sup>[1,38](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-38)</sup> <sup>[1,39](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-39)</sup> <sup>[1,40](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-40)</sup> <sup>[1,41](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-41)</sup> <sup>[1,42](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-42)</sup> <sup>[1,43](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-43)</sup> <sup>[1,44](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-44)</sup> <sup>[1,45](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-45)</sup> <sup>[1,46](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-46)</sup> <sup>[1,47](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-47)</sup> <sup>[1,48](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-48)</sup> <sup>[1,49](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-49)</sup> <sup>[1,50](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-50)</sup> <sup>[1,51](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-51)</sup> <sup>[1,52](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-52)</sup> <sup>[1,53](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-53)</sup> <sup>[1,54](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-54)</sup> <sup>[1,55](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-55)</sup> <sup>[1,56](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-56)</sup> <sup>[1,57](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-57)</sup> <sup>[1,58](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-58)</sup> <sup>[1,59](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-59)</sup> <sup>[1,60](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-60)</sup> <sup>[1,61](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-61)</sup> <sup>[1,62](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-62)</sup> <sup>[1,63](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-63)</sup> <sup>[1,64](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-64)</sup> <sup>[1,65](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-65)</sup> <sup>[1,66](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-66)</sup> <sup>[1,67](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-67)</sup> <sup>[1,68](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-68)</sup> <sup>[1,69](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-69)</sup> <sup>[1,70](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-70)</sup> <sup>[1,71](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-71)</sup> <sup>[1,72](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-72)</sup> <sup>[1,73](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-73)</sup> <sup>[1,74](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-74)</sup> <sup>[1,75](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-75)</sup> <sup>[1,76](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-76)</sup> <sup>[1,77](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-77)</sup> <sup>[1,78](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-78)</sup> <sup>[1,79](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-79)</sup> <sup>[1,80](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-80)</sup> <sup>[1,81](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-81)</sup> <sup>[1,82](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-82)</sup> <sup>[1,83](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-83)</sup> <sup>[1,84](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-84)</sup> <sup>[1,85](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-85)</sup> <sup>[1,86](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-86)</sup> <sup>[1,87](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-87)</sup> <sup>[1,88](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-88)</sup> <sup>[1,89](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-89)</sup> <sup>[1,90](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-90)</sup> <sup>[1,91](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-91)</sup> <sup>[1,92](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-92)</sup> <sup>[1,93](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-v2_1-93)</sup> Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models with Multiple Choice Questions». *arXiv*. <a href="https://ar5iv.labs.arxiv.org/html/2309.07045v2" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv-main-abs-2">↑ <sup>[2,0](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-abs_2-0)</sup> <sup>[2,1](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-abs_2-1)</sup> <sup>[2,2](https://systems-analysis.info/wiki/SafetyBench#cite_ref-arxiv-main-abs_2-2)</sup> Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models». *arXiv*. <a href="https://arxiv.org/abs/2309.07045" class="external autonumber" rel="nofollow">[2]</a></span>
