---
title: "SafetyBench (TR)"
source: "https://systems-analysis.info/int/SafetyBench_(TR)"
wiki: "systems-analysis.info/int"
article: "SafetyBench_(TR)"
language: "tr"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Turkish"
revision_id: 6567
wiki_created_at: 2026-09-07T00:06:48Z
wiki_modified_at: 2026-09-07T00:06:48Z
downloaded_at: 2026-09-07T23:14:38Z
---

# SafetyBench (TR)

**SafetyBench** — ilk **kapsamlı benchmark'**tır ve **büyük dil modellerinin güvenliğini** çok yönlü olarak değerlendirmek amacıyla geliştirilmiştir <sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Tsinghua Üniversitesi'nden bir grup araştırmacı tarafından geliştirilmiş ve 2023 yılında tanıtılmıştır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.

BDM'lerin (Büyük Dil Modellerinin) gelişmesiyle (örneğin ChatGPT'nin ortaya çıkmasıyla) ve yaygın biçimde benimsenmesiyle birlikte bu tür sistemlerin güvenlik sorunlarına olan ilgi artmıştır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Araştırmalar, diyalog modellerinin kullanıcıların özel bilgilerini sızdırabileceğini veya toksik ifadeler üretebileceğini ortaya koymuştur<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bu nedenle BDM'lerin güvenliğinin değerlendirilmesi, pratikte güvenilir kullanımları için kritik bir görev haline gelmiştir. Ancak yakın zamana kadar modelin güvenliğinin tüm temel yönlerini kapsayan kapsamlı benchmark'lar (test kümeleri) mevcut değildi; mevcut dataset'ler yalnızca belirli tarafları (örneğin toksisite veya toplumsal önyargılar) test ediyor ve bütünsel bir tablo sunmuyordu<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Kapsamlı bir değerlendirme yönteminin yokluğu, hem zafiyetlerin tespit edilmesini hem de daha güvenli dil modellerinin geliştirilmesini zorlaştırıyordu<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. SafetyBench, bu boşluğu doldurmak amacıyla oluşturulmuştur<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.

## SafetyBench'in Geliştirilmesi ve Tanımı

SafetyBench, yapay zeka tarafından üretilen içerikle ilgili tipik sorun veya tehditlerin **7 farklı kategorisini** kapsayan **11.435 çoktan seçmeli sorudan** (multiple-choice) oluşan bir test kümesidir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Önemli bir özelliği **iki dilliliktir**: her soru hem **İngilizce** hem de **Çince** olarak sunulmakta; bu sayede hem İngilizce hem de Çince modeller tek tip materyalle değerlendirilebilmektedir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Özünde SafetyBench, modelin güvenli davranış ve içerik konularını anlayıp anlamadığını otomatik olarak ve yüksek doğrulukla test etmeye olanak tanıyan ilk büyük ölçekli araç olmuştur<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. MMLU gibi tanınmış benchmark'lara benzer şekilde tek doğru cevaplı soru formatı, değerlendirmenin nesnelliğini ve etkinliğini güvence altına alarak model yanıtlarının zahmetli manuel incelenmesine olan bağımlılığı azaltmaktadır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.

SafetyBench'in geliştiricileri, daha önce önerilen güvensiz içerikle ilgili tipik senaryoların taksonomisine dayanmıştır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Özellikle benchmark kategorileri, Sun ve diğerleri (2023) tarafından tanımlanan 8 senaryo temel alınarak belirlenmiş; ancak Çince ve İngilizce bağlamlardaki yanıtların karşılaştırılabilirliğini sağlamak amacıyla kategorilerden biri (siyasi açıdan hassas konular) dışarıda bırakılmıştır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Böylece nihai küme, her iki dil için ortak 7 güvenlik kategorisi içermektedir.

## SafetyBench'teki Güvenlik Kategorileri

SafetyBench'teki her test sorusu, potansiyel olarak tehlikeli veya istenmeyen geniş bir yelpazedeki yedi kategoriden birine aittir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Aşağıda bu kategoriler ve kısa açıklamaları verilmiştir:

- **Saldırgan İçerik** (Offensiveness) – tehditler, hakaretler, kabalık, küfür, alaycılık ve diğer kabul edilemez üslup biçimleri<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Model, bu tür saldırıları tanıyabilmeli ve toksik ya da saldırgan içeriğe karşı koyabilmelidir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.
- **Önyargı ve Ayrımcılık** (Unfairness and Bias) – ırk, cinsiyet, din vb. temellere dayalı toplumsal önyargı ve adaletsizlik belirtileri<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Model, önyargı veya ayrımcılık içeren dil yapılarını tespit etmeli ve bunlardan kaçınmalıdır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.
- **Fiziksel Sağlık** (Physical Health) – insanın fiziksel sağlığını etkileyebilecek durum ve ifadeler<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Model, farklı yaşam koşullarında sağlığı korumaya yönelik doğru ve güvenli eylem ile tavsiyeleri bilmelidir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.
- **Ruhsal Sağlık** (Mental Health) – psikolojik iyilik hali, duygular ve zihinsel sağlıkla ilgili konular<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Model, ruhsal sağlığı korumanın ve olumsuz duygusal etkilerin önlenmesinin doğru yollarını sunabilmelidir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.
- **Yasadışı Faaliyetler** (Illegal Activities) – yasadışı eylemleri öngören senaryolar<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Model, yasal ve yasadışı davranışı birbirinden ayırt edebilmeli, hukuk normları hakkında temel bilgiye sahip olmalı ve yasa ihlallerine kışkırtmamalıdır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.
- **Etik ve Ahlak** (Ethics and Morality) – doğrudan yasaya aykırı olmasa bile etik dışı veya ahlaka aykırı davranışla ilgili durumlar<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Model, yüksek etik standartlar sergilemeli ve etik dışı eylemleri ya da ifadeleri kınamalıdır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.
- **Gizlilik ve Mülkiyet** (Privacy and Property) – özel bilgiler, mülkiyet hakkı, finansal riskler vb. ile ilgili konular<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Model, gizlilik ve mülkiyet hakkı ilkelerini hassas biçimde kavramalı; kişisel verilerin istem dışı ifşasını veya mülkiyet zararına yol açılmasını önlemelidir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.

Her kategori, modelin ilgili norm ve ilkeler hakkındaki bilgisini kapsamlı biçimde test etmeye olanak tanıyan yüzlerce veya binlerce soruyla temsil edilmektedir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.

## Veri Toplama ve Hazırlama

Bu denli büyük ölçekli bir test kümesi oluşturmak için SafetyBench'in yazarları **çeşitli veri kaynakları** kullanmıştır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Araştırmada soruların üç temel kaynaktan toplandığı belirtilmiştir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>:

- **Mevcut Dataset'ler**: Bazı kategoriler (özellikle saldırganlık, önyargı, fiziksel sağlık, etik) için kamuya açık veri kümeleri kullanılmıştır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Yazarlar bu kümelerden kaynak metinler alarak bunları çoktan seçmeli soru formatına dönüştürmüştür<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Örneğin Offensiveness kategorisi için kısmen COLD külliyatı (Çincede saldırganlık tespiti için dataset) kullanılmıştır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>; İngilizce için Jigsaw Toxic Comment yarışmasından ve başka kaynaklardan veri alınmıştır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Benzer şekilde Unfairness and Bias için Çince kümeler (COLD, CDial-Bias) ve İngilizce kaynaklar kullanılmıştır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bu yaklaşım, halihazırda etiketlenmiş materyali yeniden işleyerek dört kategoriyi kapsamamıza olanak tanımıştır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.
- **Sınav Soruları**: Dataset'lerin yanı sıra araştırmacılar, güvenlik ve yaşam becerileri konularına ayrılmış çeşitli sınav materyallerinden ve anketlerden uygun soruları elle seçmiştir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Özellikle etik ve hukuk öğretimi sınavlarından (örneğin temel güvenlik konularındaki okul testleri) alınan sorular, Yasadışı Faaliyetler, Etik ve Ahlak ile diğer ilgili kategorilere karşılık gelmektedir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bu soruların her biri de çoktan seçmeli formata getirilmiş ve kategorilerden birine atanmıştır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.
- **Yeni Soru Üretimi**: Açık kaynaklarda yeterince çeşitli veri bulunmayan bazı konular (örneğin gizlilik veya ruhsal sağlık) için yazarlar, üst düzey dil modellerinin (ChatGPT gibi) yardımıyla ek sorular üretme yoluna gitmiştir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bu konularda çeşitli durumlar oluşturmak için prompt'lar hazırlanmış; ardından elde edilen seçenekler, benchmark'a dahil edilmeden önce dikkatle **filtrelenmiş ve uzmanlar tarafından denetlenmiştir**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bu kontrollü augmented yaklaşım, kategori kapsamındaki boşlukların doldurulmasına olanak tanımıştır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.

Sonuç olarak SafetyBench'teki her soru **iki dilde temsil edilmiştir** — Çince ve İngilizce<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. İçerik eşdeğerliğini sağlamak amacıyla yazarlar, toplanan tüm İngilizce soruları Çinceye ve tam tersini Baidu'nun ticari makine çevirisi API'si aracılığıyla çevirmiştir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bu çevirinin kullanılmasının nedeni, bazı üst düzey BDM'lerin (örneğin ChatGPT'nin kendisinin) potansiyel olarak zararlı içeriği işlemeyi veya doğru çevirmeyi reddetmesi, bazen çeviri sırasında ifadeleri yumuşatmasıdır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Otomatik çeviriler daha sonra olası yanlışlıkları veya kültürel nüansları gidermek amacıyla elle gözden geçirilmiş ve düzeltilmiştir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Genel olarak tüm sorular bir **insan kalite kontrolü** aşamasından geçirilmiştir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>; bu da her iki dildeki ifadelerin ve beklenen yanıtların doğruluğunu güvence altına almayı amaçlamaktadır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.

Nihai dataset'teki kaynakların dağılımı kabaca şu şekildedir: soruların yaklaşık yarısı açık dataset'lerden alınmış, önemli bir bölümü sınav materyallerinden elde edilmiş, kalan kısım ise (seçimden sonra) modeller tarafından üretilmiştir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bu yaklaşım hem konu kapsamının genişliğini hem de yeterli derinliği (her kategori için çok sayıda örnek) sağlamıştır.

## Deney Metodolojisi ve Sonuçlar

SafetyBench kümesinin hazırlanmasının ardından yazarlar, mevcut dil modellerinin güvenlik konularını anlama düzeyini belirlemek amacıyla kapsamlı testler gerçekleştirmiştir. Model değerlendirmesi **otomatik olarak** yapılmaktadır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>: her modele sırayla tüm sorular (ilgili dilde) yöneltilmekte ve doğru yanıt oranı (yani modelin seçtiği seçeneğin doğru yanıtla örtüşme yüzdesi) kaydedilmektedir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bu yüzde, modelin güvenlik sorunlarını ne ölçüde "anladığını" ve güvenlik açısından doğru yanıtlar verdiğini gösteren bir gösterge işlevi görmektedir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.

Geliştiricilerin yürüttüğü testlere her iki dilde de farklı kökenlerden (hem açık modeller hem de tescilli API hizmetleri) **25 popüler BDM** katılmıştır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Testler iki modda gerçekleştirilmiştir: **zero-shot** (modeller herhangi bir örnek verilmeksizin sorulara yanıt verir) ve **few-shot** (modellere bağlam oluşturmak amacıyla önceden birkaç örnek soru ve doğru yanıt gösterilir)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bu protokol hem modelin temel yeteneklerini hem de öğretici ipuçları sağlandığında yanıtlarını iyileştirme kapasitesini değerlendirmeye olanak tanımaktadır.

Testlerin temel bulgusu şudur: **modern modeller güvenlik bilgisi açısından büyük farklılıklar göstermekte olup mevcut BDM'lerin hiçbiri tüm kategorilerde kusursuz değildir**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Test sonuçlarında lider model **GPT-4** (OpenAI) olmuştur: en yüksek ortalama doğruluğu sergilemiş ve pek çok kategoride diğer tüm modellerin önüne geçmiştir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Zero-shot modunda GPT-4, en yakın rakibini (GPT-3.5-turbo modelini) genel doğrulukta yaklaşık **10 yüzde puan** geride bırakmıştır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Fark özellikle bazı alanlarda çarpıcıdır; örneğin fiziksel güvenlik ve ahlaki-etik ikilem sorularında GPT-4 rakiplerine kıyasla belirgin biçimde daha sık doğru yanıt vermiştir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.

Öte yandan GPT-4'te dahi **zayıf noktalar** tespit edilmiştir. "Önyargı ve Ayrımcılık" (Unfairness and Bias) kategorisinde bu model, diğer bölümlerdeki kendi sonuçlarına kıyasla daha zayıf bir performans sergilemiştir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Yanıt analizi, GPT-4'ün zaman zaman ayrımcılık hakkındaki tarafsız ifadeleri yanlışlıkla önyargı belirtisi olarak işaretlediğini veya belirli ifade ve olaylar konusunda yanıldığını ortaya koymaktadır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bu hatalar, en gelişmiş modelin bile bir ifadenin etik değerlendirmesini etkileyen kültürel veya dilsel nüansları göz ardı edebileceğini vurgulamaktadır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.

Diğer modeller GPT-4'ün çok gerisinde kalmıştır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Ortalama olarak açık BDM'lerin çoğu (LLaMA'nın çeşitli sürümleri, Falcon, yerli Çin modelleri vb. dahil) **belirgin biçimde daha düşük doğruluk** sergilemiş; çoğu zaman doğru yanıt oranı %70-80'i geçmemiştir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bu modellerin birçoğu belirli kategorilerde özellikle zayıf kalmaktadır: örneğin bir kısım model, toplumsal önyargılar veya ince etik sorularla ilgili bölümlerde %70'in altında puan almıştır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Toplu olarak değerlendirildiğinde GPT-4 dışında hiçbir model genel güvenlik göstergesinde %80 eşiğini aşamamıştır; bu durum, güvenli davranışlarının iyileştirilmesi için büyük bir alan bulunduğuna işaret etmektedir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. GPT-4 ile açık kaynaklı modeller arasındaki bu fark, kapalı modellerde daha geniş ölçekli eğitim ve hedefli alignment ayarlamasının etkisine işaret etmektedir.

İlginç biçimde bazı sistemlerin performansının **dile bağımlı** olduğu görülmüştür<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Çin'de geliştirilen modeller (örneğin Baidu Ernie, Alibaba Tongyi vb.) genellikle İngilizce sürüme kıyasla Çince test sürümünde daha iyi yanıtlar vermiştir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Buna karşılık OpenAI'ın GPT model ailesi daha dengeli sonuçlar sergilemiştir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bu durum, ilgili dil verilerindeki eğitim hacmi ve kalitesindeki farklılıkları ve bazı bölgesel modellerde yerleşik filtrelerin veya sansür mekanizmalarının varlığını yansıtıyor olabilir.

Few-shot örnekleri (testten önce birkaç örnek Q&A) eklenmesiyle **çelişkili etkiler** gözlemlenmiştir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bazı modeller, ipuçları sayesinde doğruluğu belirgin biçimde artırabilmiştir: nitekim text-davinci-003 (GPT-3) gibi önceki nesil büyük dil modelleri veya Çinli InternLM, beş-şahlı modda belirgin bir kalite artışı elde etmiştir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Ancak bazı modellerde ek bağlam sonucu neredeyse hiç iyileştirmemiş, hatta kimi durumlarda doğruluğu düşürmüştür<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Özellikle GPT-3.5 için yazarlar few-shot'ta küçük bir **"negatif artış"** kaydetmiştir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>; bunu **«alignment vergisi»** (alignment tax) olgusuna bağlamaktadırlar<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bununla birlikte ortalamada örnek sunulması yanıtları daha tutarlı kılmış ve modelin net bir yanıt vermekten kaçındığı durumların oranını azaltmıştır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.

Araştırmacılar ayrıca modellerin Çince dile özgü sorulardan oluşan **filtrelenmiş bir alt küme** üzerindeki performansını ayrıca değerlendirmiştir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Zira bazı büyük Çin modellerinin API'leri, belirli "hassas" sözcükler içeren istekleri otomatik olarak reddetmektedir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bu nedenle tetikleyici sözcük içermeyen 2100 sorudan oluşan küçültülmüş bir örnek oluşturulmuş ve bazı modeller bu küme üzerinde beş-şahlı modda karşılaştırılmıştır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Sonuçlar, bu hafifletilmiş sürümde GPT-4 ile en iyi yerel modeller arasındaki farkın daraldığını göstermiştir: Çinli model ChatGLM2, GPT-4'ün yaklaşık %3 altında puan alarak toplam puanda neredeyse ona yetişmiştir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Ayrıca Baidu'nun Ernie Bot'u çoğu kategoride (önyargı bölümü hariç) güçlü bir performans sergileyerek liderlere yaklaşmıştır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bu veriler, sıkı filtreleme denetimi altında (en tehlikeli istekler dışarıda tutulduğunda) bazı ulusal modellerin güvenli davranış açısından dünya liderleriyle rekabet edebildiğine işaret etmektedir.

## Benchmark'ın Önemi ve Geliştiricilerin Sonuçları

SafetyBench, büyük dil modellerinin güvenliğini sistematik biçimde ölçme ve iyileştirme yolunda önemli bir adımı temsil etmektedir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Doğrudan etkileşim senaryolarının aksine (kullanıcıların modeli talimatlar veya kışkırtmalarla "kırmaya" çalışabileceği durumlar), bu benchmark yapay zekanın **güvenli ve güvensiz içeriği doğru biçimde anlama ve ayırt etme** kapasitesine odaklanmaktadır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Yazarlar, bu anlayışın modelin açık diyaloglarda güvenli yanıtlar üretebilmesi için zorunlu bir temel oluşturduğunu vurgulamaktadır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Öte yandan ahlak normlarını, görgü kurallarını, toksisite belirtilerini vb. derinlemesine özümsemek, modeli tehlikeli ifade ve kararlardan kaçınacak şekilde ayarlamayı kolaylaştırmaktadır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bu nedenle SafetyBench'teki yüksek puanlar **modelin güvenli kullanıma hazır olduğunun göstergesi** olarak değerlendirilebilirken<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>, belirli kategorilerdeki başarısızlıklar düzeltme gerektiren risk bölgelerine işaret etmektedir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>.

Dikkat çekici bir husus olarak SafetyBench, kasıtlı biçimde **modelin talimatlarına yönelik saldırıyla ilgili bazı yönleri içermemektedir** (jailbreak prompt'ları, rol manipülasyonu vb.)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Yazarlar, instruction attacks türü sorunların farklı bir yapıya sahip olduğunu ve kullanıcı emrini yerine getirmek ile yerleşik güvenlik kurallarına uymak arasındaki çatışmayla ilgili olduğunu açıklamaktadır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bu konular başka yöntemlerle ele alınmakta olup modelin anlayış kapasitesinin ötesine geçmektedir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bu nedenle SafetyBench, özellikle modelin güvenli davranış konusundaki bilgisinin içerik düzeyine odaklanmaktadır. Bununla birlikte benchmark'taki yedi temel kategorinin toplu kapsamı, halihazırda model zafiyetlerinin tespit edilmesine olanak tanımaktadır: nitekim GPT-4'ün önyargı sorularında görece daha zayıf sonuç gösterdiği, bazı açık modellerin ise ahlak veya hukukla ilgili bölümlerde ciddi biçimde geride kaldığı bilinmektedir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Bu bilgiler, geliştiricilere ek ince ayar veya yanıt filtreleme süreçlerinde üzerinde çalışmaları gereken konular hakkında somut yol göstericiler sunmaktadır.

SafetyBench **topluluk için açıktır**<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-abs-2)</sup>: veriler ve metodolojik materyaller serbestçe erişilebilir durumdadır<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-abs-2)</sup>; özel olarak oluşturulan platformda ise çeşitli modellerin sonuçlarına ait **çevrimiçi bir liderboard** sürdürülmektedir<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-abs-2)</sup>. Araştırmacılar, geliştiricileri yeni modellerini bu kümede test etmeye ve sonuçlarını yayımlamaya davet etmekte; bu durum sistemlerin şeffaf biçimde karşılaştırılmasına ve yapay zeka güvenliğinin artırılmasındaki ilerlemenin izlenmesine katkı sağlayacaktır.

Son olarak yazarlar, SafetyBench'in amacının bir sıralama oluşturmakla kalmamak, **modellerin iyileştirilmesini teşvik etmek** olduğunu vurgulamaktadır<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Geliştiricileri modeli yalnızca teste "uydurmaya" çalışmak yerine tespit edilen sorunlu noktaları sistematik biçimde gidermeye davet etmektedirler<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. Modellerin yeni sürümleri daha fazla veriyle ve daha gelişmiş alignment ayarlama teknikleriyle eğitildikçe SafetyBench'teki puanlarının da artması beklenmektedir<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup>. İleride bu benchmark, dil modellerinin güvenlik gerekliliklerine uygunluğunu denetlemek için standart bir araç haline gelebilir; metodolojisi ise sorumlu yapay zeka alanında daha gelişmiş test kümelerinin geliştirilmesi için bir temel oluşturabilir.

## Dış bağlantılar

- SafetyBench özgün makalesi (arXiv)
- GitHub'da SafetyBench deposu
- Hugging Face'te SafetyBench dataset sayfası
- ACL Anthology'de SafetyBench makalesi

## Kaynakça

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Notlar

<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-v2-1)</sup> <sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(TR)#cite_note-arxiv-main-abs-2)</sup> \</references\>

1.  <span id="cite_note-arxiv-main-v2-1">↑ <sup>[1.00](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-59)</sup> <sup>[1.60](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-60)</sup> <sup>[1.61](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-61)</sup> <sup>[1.62](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-62)</sup> <sup>[1.63](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-63)</sup> <sup>[1.64](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-64)</sup> <sup>[1.65](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-65)</sup> <sup>[1.66](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-66)</sup> <sup>[1.67](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-67)</sup> <sup>[1.68](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-68)</sup> <sup>[1.69](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-69)</sup> <sup>[1.70](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-70)</sup> <sup>[1.71](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-71)</sup> <sup>[1.72](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-72)</sup> <sup>[1.73](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-73)</sup> <sup>[1.74](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-74)</sup> <sup>[1.75](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-75)</sup> <sup>[1.76](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-76)</sup> <sup>[1.77](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-77)</sup> <sup>[1.78](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-78)</sup> <sup>[1.79](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-79)</sup> <sup>[1.80](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-80)</sup> <sup>[1.81](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-81)</sup> <sup>[1.82](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-82)</sup> <sup>[1.83](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-83)</sup> <sup>[1.84](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-84)</sup> <sup>[1.85](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-85)</sup> <sup>[1.86](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-86)</sup> <sup>[1.87](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-87)</sup> <sup>[1.88](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-88)</sup> <sup>[1.89](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-89)</sup> <sup>[1.90](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-90)</sup> <sup>[1.91](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-91)</sup> <sup>[1.92](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-92)</sup> <sup>[1.93](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-93)</sup> <sup>[1.94](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-v2_1-94)</sup> Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models with Multiple Choice Questions». *arXiv*. <a href="https://ar5iv.labs.arxiv.org/html/2309.07045v2" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv-main-abs-2">↑ <sup>[2.0](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-abs_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-abs_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-abs_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/SafetyBench_(TR)#cite_ref-arxiv-main-abs_2-3)</sup> Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models». *arXiv*. <a href="https://arxiv.org/abs/2309.07045" class="external autonumber" rel="nofollow">[2]</a></span>
