SafetyBench — セーフティベンチ

From Systems analysis Wiki
Jump to navigation Jump to search

SafetyBenchは、大規模言語モデルの安全性を包括的に評価するための初の総合的なベンチマークです[1]。これは、清華大学の研究者グループによって開発され、2023年に発表されました[1]

LLM(例えばChatGPTの登場)の発展と大規模な導入に伴い、このようなシステムの安全性に関する問題への関心が高まっています[1]。研究により、対話モデルがユーザーの個人情報を漏洩させたり、有害な発言を生成したりする可能性があることが示されています[1]。そのため、LLMの安全性を評価することは、実世界で確実に利用するための極めて重要な課題となりました。しかし、最近まで、モデルの安全性の主要な側面をすべて網羅する包括的なベンチマーク(テストセット)は存在しませんでした。既存のデータセットは、特定の側面(例えば、有害性や社会的偏見)のみを検証するものであり、全体像を把握することはできませんでした[1]。包括的な評価方法がなかったため、脆弱性の特定も、より安全な言語モデルの開発も困難でした[1]。SafetyBenchは、このギャップを埋めるために作成されました[1]

SafetyBenchの開発と概要

SafetyBenchは、AIが生成するコンテンツに関連する典型的な問題や脅威の7つの異なるカテゴリを網羅する11,435問の多肢選択問題から構成されています[1]。重要な特徴はバイリンガルであることで、各問題は英語中国語で提供されており、英語モデルと中国語モデルを統一された基準で評価することができます[1]。実質的に、SafetyBenchは、モデルの安全な振る舞いやコンテンツに関する問題の理解度を、自動的かつ高精度にテストすることを可能にする初の本格的なツールとなりました[1]。MMLUのような著名なベンチマークと同様に、正解が1つしかない課題形式は、評価の客観性と効率性を保証し、時間のかかる手作業によるモデルの回答検証への依存を低減します[1]

SafetyBenchの開発者は、以前に提案された安全でないコンテンツに関連する典型的なシナリオのタクソノミーを基にしています[1]。具体的には、ベンチマークのカテゴリはSunら(2023年)の研究で記述された8つのシナリオに基づいていますが、そのうちの1つ(政治的にデリケートなトピック)は、中国語と英語の文脈で回答の比較可能性を確保するために除外されました[1]。その結果、最終的なセットには、両言語に共通する7つの安全性カテゴリが含まれています。

SafetyBenchにおける安全性のカテゴリ

SafetyBenchの各テスト問題は、潜在的に危険または望ましくない側面の広範なスペクトラムをカバーする7つのカテゴリのいずれかに属しています[1]。以下に、これらのカテゴリとその簡単な説明を示します:

  • 攻撃的なコンテンツ (Offensiveness) – 脅迫、侮辱、無礼、下品な言葉、皮肉など、不適切なトーンの表れ[1]。モデルは、このような攻撃を認識し、有害または攻撃的なコンテンツに対抗する能力を持つべきです[1]
  • 不公平性とバイアス (Unfairness and Bias) – 人種、性別、宗教などに基づく社会的バイアスや不公平の表れ[1]。モデルは、偏見や差別を表現する言語構造を特定し、避けるべきです[1]
  • 身体的健康 (Physical Health) – 人の身体的健康に影響を与える可能性のある状況や発言[1]。モデルは、様々な生活状況において健康を維持するための正確で安全な行動やアドバイスを知っているべきです[1]
  • 精神的健康 (Mental Health) – 心理的な幸福、感情、メンタルヘルスに関連する問題[1]。モデルは、精神的健康を維持し、否定的な感情的影響を防ぐための正しい方法を提案すべきです[1]
  • 違法行為 (Illegal Activities) – 違法な行為を伴うシナリオ[1]。モデルは、合法的な行動と違法な行動を区別し、法の規範に関する基本的な知識を持ち、法律違反を扇動しないべきです[1]
  • 倫理と道徳 (Ethics and Morality) – 直接法律に抵触しない場合でも、非倫理的または不道徳的な行動に関連する状況[1]。モデルは、高い倫理基準を示し、非倫理的な行為や発言を非難すべきです[1]
  • プライバシーと所有権 (Privacy and Property) – 個人情報、所有権、金融リスクなどに関する問題[1]。モデルは、プライバシーと財産権の原則を敏感に理解し、個人データの意図しない開示や財産的損害の発生を防ぐべきです[1]

各カテゴリには数百から数千の問題が含まれており、モデルが関連する規範や原則をどの程度理解しているかを包括的に検証することができます[1]

データの収集と準備

このような大規模なテストセットを作成するために、SafetyBenchの作成者は多様なデータソースを活用しました[1]。研究では、問題が3つの主要なソースから収集されたと述べられています[1]

  • 既存のデータセット: いくつかのカテゴリ(特に攻撃、偏見、身体的健康、倫理)については、公開されているデータセットが使用されました[1]。作成者は、これらのセットから元のテキストを取得し、多肢選択問題の形式に変換しました[1]。例えば、「Offensiveness」カテゴリには、中国語の侮辱検出データセットであるCOLDが部分的に使用されています[1]。英語については、Jigsaw Toxic Commentコンペティションなどのデータが利用されました[1]。同様に、「Unfairness and Bias」カテゴリには、中国語のデータセット(COLD, CDial-Bias)と英語のリソースが使用されました[1]。このアプローチにより、既にラベル付けされた資料を再利用することで、4つのカテゴリをカバーすることができました[1]
  • 試験問題: データセットに加えて、研究者は安全性やライフスキルに関する様々な試験資料やアンケートから適切な課題を手動で選び出しました[1]。特に、倫理や法学に関する学習試験(例えば、安全の基礎に関する学校のテスト)から、違法行為、倫理と道徳、およびその他の関連トピックのカテゴリに合致する問題が抽出されました[1]。これらの問題も多肢選択形式に変換され、いずれかのカテゴリに分類されました[1]
  • 新規問題の生成: 一部の側面(例えば、プライバシーや精神的健康)では、公開ソースに多様なデータが不足していたため、作成者は高レベルの言語モデル(ChatGPTなど)を使用して追加の問題を生成しました[1]。これらのテーマに関する多様な状況を作成するためのプロンプトが作成され、生成された選択肢はベンチマークに含める前に専門家によって慎重にフィルタリングおよび検証されました[1]。この管理された拡張アプローチにより、カテゴリのカバレッジのギャップを埋めることができました[1]

最終的に、SafetyBenchの各問題は、中国語と英語のバイリンガルで提示されました[1]。内容の等価性を確保するために、作成者は収集したすべての英語の問題をBaiduの商用機械翻訳APIを使用して中国語に翻訳し、その逆も行いました[1]。この翻訳サービスが使用された理由は、一部の高レベルLLM(例えばChatGPT自体)が、潜在的に危険なコンテンツの処理や正確な翻訳を拒否し、翻訳時に表現を和らげることがあったためです[1]。自動翻訳は、その後、考えられる不正確さや文化的なニュアンスを排除するために手動で校正・修正されました[1]。全体として、すべての問題は人間による品質チェックの段階を経ており[1]、これにより両言語における表現の正確性と期待される回答の一致が保証されています[1]

最終的なデータセットにおけるソースの分布は、およそ半分が公開データセットから、かなりの部分が試験資料から、残りが(選別後の)モデルによって生成されたものとなっています[1]。このアプローチにより、トピックの広範なカバレッジと十分な深さ(各カテゴリに多数の例)の両方が確保されました。

実験方法と結果

SafetyBenchのセットを準備した後、作成者は現代の言語モデルに対して大規模なテストを実施し、それらの安全性に関する問題の理解度を評価しました。モデルの評価は自動的に行われます[1]。各モデルにすべての問題が(対応する言語で)順次提示され、正解率(モデルが選択した選択肢が正解と一致した割合)が記録されます[1]。このパーセンテージは、モデルが安全性の問題をどれだけ「理解」し、安全性の観点から正しい回答を提供するかを示す指標となります[1]

開発者が実施したテストには、さまざまな出自を持つ25の人気のLLM(オープンモデルとプロプライエタリなAPIサービスの両方)が両言語で参加しました[1]。テストは2つのモードで実行されました:zero-shot(モデルが例なしで質問に答える)とfew-shot(モデルに文脈を設定するために、事前に正解付きのいくつかの質問例が示される)です[1]。このプロトコルにより、モデルの基本的な能力と、学習ヒントが与えられた場合に回答を改善する能力の両方を評価することができます。

テストの主な結論は、現代のモデルは安全性の知識レベルに大きな差があり、利用可能なLLMの中でどのモデルもすべてのカテゴリで完璧ではないということです[1]。結果のリーダーはGPT-4(OpenAI)モデルでした。これは最高の平均正解率を示し、多くのカテゴリで他のすべてのモデルを大幅に上回りました[1]。zero-shotモードでは、GPT-4は次点のモデル(GPT-3.5-turbo)を総合正解率でほぼ10パーセントポイント上回りました[1]。この差は特定の分野で特に大きく、例えば、身体的安全性や道徳的・倫理的ジレンマに関する質問では、GPT-4は競合他社よりも著しく高い頻度で正しく回答しました[1]

同時に、GPT-4でさえ弱点が特定されました。「不公平性とバイアス」(Unfairness and Bias)カテゴリでは、このモデルは他のセクションでの自身の成績と比較して劣っていました[1]。回答の分析によると、GPT-4は差別に関する中立的な発言を誤って偏見の表れとしてマークしたり、特定の表現や出来事で混乱したりすることがありました[1]。このような間違いは、最も先進的なモデルでさえ、発言の倫理性を評価する上で影響を与える文化的または言語的なニュアンスを過小評価する可能性があることを強調しています[1]

他のモデルはGPT-4に大きく遅れをとりました[1]。平均して、ほとんどのオープンLLM(さまざまなバージョンのLLaMA、Falcon、中国国内のモデルなどを含む)は著しく低い正解率を示し、しばしば正解率が70〜80%を超えませんでした[1]。これらの多くは特定のカテゴリで特に弱く、例えば、社会的偏見や微妙な倫理的問題に関連するセクションでは、多くのモデルが70%未満のスコアでした[1]。全体として、(GPT-4を除き)どのモデルも総合的な安全性指標で80%という仮想的な閾値を超えることはなく、これは安全な振る舞いをさらに改善する余地が大きいことを示しています[1]。GPT-4とオープンソースモデルとのこのような差は、クローズドモデルにおけるより大規模なトレーニングとターゲットを絞ったアラインメント調整の効果を示唆しています。

興味深いことに、一部のシステムのパフォーマンスは言語に依存していました[1]。中国で作成されたモデル(例:Baidu Ernie、Alibaba Tongyiなど)は、一般的に英語バージョンよりも中国語バージョンのテストで良い成績を収めました[1]。対照的に、OpenAIのGPTモデルファミリーは、よりバランスの取れた結果を示しました[1]。これは、それぞれの言語データでのトレーニングの量と質の差、および一部の地域モデルに組み込まれているフィルターや検閲メカニズムの存在を反映している可能性があります。

_few-shot_の例(テスト前にいくつかのデモンストレーションQ&Aを追加)を追加すると、さまざまな方向性の効果が観察されました[1]。一部のモデルは、ヒントのおかげで正解率を著しく向上させることができました。例えば、text-davinci-003(GPT-3)や中国のInternLMのような前世代の大規模言語モデルは、5-shotモードで品質が大幅に向上しました[1]。しかし、一部のモデルでは追加のコンテキストが結果をほとんど改善せず、場合によっては正解率を低下させることさえありました[1]。特に、GPT-3.5については、著者らは_few-shot_でのわずかな「負の成長」を記録し[1]、これを「アラインメント税」(alignment tax)という現象に関連付けています[1]。それにもかかわらず、平均的には、例を提供することで回答がより安定し、モデルが明確な回答を拒否するケースの割合が減少しました[1]

研究者は別途、中国語に関連するフィルタリングされた質問のサブセットでモデルのパフォーマンスを評価しました[1]。これは、一部の主要な中国モデルのAPIが、特定の「機微な」単語を含むリクエストを自動的に拒否するためです[1]。そのため、トリガーとなる単語を含まない2100問の短縮サンプルが作成され、その上でいくつかのモデルが15-shotモードで比較されました[1]。結果は、この簡易版ではGPT-4と最高のローカルモデルとの差が縮まることを示しました。例えば、中国のモデルChatGLM2はGPT-4より約3%低いスコアで、総合スコアでほぼ同等になりました[1]。また、BaiduのErnie Botは(偏見のセクションを除き)ほとんどのカテゴリで優れたパフォーマンスを発揮し、リーダーに近づきました[1]。これらのデータは、厳しいフィルタリング制御下(最も危険なクエリを除外)では、一部の国内モデルが安全な振る舞いの面で世界のリーダーと競争できることを示唆しています。

ベンチマークの意義と開発者の結論

SafetyBenchは、大規模言語モデルの安全性を体系的に測定し、改善するための重要な一歩です[1]。直接対話のシナリオ(ユーザーが指示や挑発でモデルを「ハック」しようとする可能性がある)とは異なり、このベンチマークは、AIが安全なコンテンツと安全でないコンテンツを正しく理解し、区別する能力に焦点を当てています[1]。著者らは、このような理解が、モデルがオープンな対話で安全な回答を生成するための必要不可欠な基盤であると強調しています[1]。逆に、道徳規範、エチケットのルール、有害性の兆候などを深く学習することは、モデルが危険な発言や決定を避けるように調整することを容易にします[1]。したがって、SafetyBenchでの高いスコアはモデルが安全な運用への準備ができていることの指標と見なすことができ[1]、特定のカテゴリでの失敗は、さらなる改善が必要なリスク領域を示唆します[1]

SafetyBenchが意図的にモデルの指示自体への攻撃に関連するいくつかの側面を含んでいないこと(いわゆるジェイルブレイクプロンプト、役割操作など)は重要です[1]。著者らは、_instruction attacks_のような問題は、ユーザーの命令を実行することと組み込まれた安全規則を遵守することとの間の対立に関連する、異なる性質を持つと説明しています[1]。これらの側面は他の方法で解決されるべきであり、モデルの理解の範囲を超えています[1]。そのため、SafetyBenchは、モデルの安全な振る舞いに関する内容レベルの知識に焦点を当てています。それでも、ベンチマークにおける7つの主要カテゴリの包括的なカバレッジは、モデルの脆弱性を特定することを可能にしています。例えば、GPT-4は偏見に関する質問で比較的弱い結果を示すことが知られており、一部のオープンモデルは道徳や法律に関連するセクションで大きく遅れをとっています[1]。このような情報は、開発者がさらなるファインチューニングや回答のフィルタリングで取り組むべき具体的な指針を提供します。

SafetyBenchベンチマークはコミュニティに公開されています[2]。そのデータと方法論に関する資料は自由にアクセスでき[2]、特別に作成されたプラットフォームでは、さまざまなモデルの結果のオンラインリーダーボードが維持されています[2]。研究者は、開発者が新しいモデルをこのセットでテストし、結果を公開することを奨励しており、これによりシステムの透明な比較とAIの安全性向上における進捗の追跡が促進されます。

最後に、著者らは、SafetyBenchの目的が単に別のランキングを作成することではなく、モデルの改善を促進することであると強調しています[1]。彼らは開発者に対し、モデルをテストに「適合」させようとするだけでなく、特定された問題点を体系的に排除するよう呼びかけています[1]。新しいバージョンのモデルがより多くのデータで、より複雑なアラインメント調整技術を用いてトレーニングされるにつれて、SafetyBenchでのスコアも向上することが期待されます[1]。将来的には、このベンチマークは、言語モデルが安全要件に適合しているかを確認するための標準ツールとなり、その方法論は、責任あるAIの分野でさらに高度なテストセットを開発するための基盤となる可能性があります。

外部リンク

参考文献

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

脚注

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 1.47 1.48 1.49 1.50 1.51 1.52 1.53 1.54 1.55 1.56 1.57 1.58 1.59 1.60 1.61 1.62 1.63 1.64 1.65 1.66 1.67 1.68 1.69 1.70 1.71 1.72 1.73 1.74 1.75 1.76 1.77 1.78 1.79 1.80 1.81 1.82 1.83 1.84 1.85 1.86 1.87 1.88 1.89 1.90 1.91 1.92 Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models with Multiple Choice Questions». arXiv. [1]
  2. 2.0 2.1 2.2 Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models». arXiv. [2]