SafetyBench (TR)
SafetyBench — ilk kapsamlı benchmark'tır ve büyük dil modellerinin güvenliğini çok yönlü olarak değerlendirmek amacıyla geliştirilmiştir [1]. Tsinghua Üniversitesi'nden bir grup araştırmacı tarafından geliştirilmiş ve 2023 yılında tanıtılmıştır[1].
BDM'lerin (Büyük Dil Modellerinin) gelişmesiyle (örneğin ChatGPT'nin ortaya çıkmasıyla) ve yaygın biçimde benimsenmesiyle birlikte bu tür sistemlerin güvenlik sorunlarına olan ilgi artmıştır[1]. Araştırmalar, diyalog modellerinin kullanıcıların özel bilgilerini sızdırabileceğini veya toksik ifadeler üretebileceğini ortaya koymuştur[1]. Bu nedenle BDM'lerin güvenliğinin değerlendirilmesi, pratikte güvenilir kullanımları için kritik bir görev haline gelmiştir. Ancak yakın zamana kadar modelin güvenliğinin tüm temel yönlerini kapsayan kapsamlı benchmark'lar (test kümeleri) mevcut değildi; mevcut dataset'ler yalnızca belirli tarafları (örneğin toksisite veya toplumsal önyargılar) test ediyor ve bütünsel bir tablo sunmuyordu[1]. Kapsamlı bir değerlendirme yönteminin yokluğu, hem zafiyetlerin tespit edilmesini hem de daha güvenli dil modellerinin geliştirilmesini zorlaştırıyordu[1]. SafetyBench, bu boşluğu doldurmak amacıyla oluşturulmuştur[1].
SafetyBench'in Geliştirilmesi ve Tanımı
SafetyBench, yapay zeka tarafından üretilen içerikle ilgili tipik sorun veya tehditlerin 7 farklı kategorisini kapsayan 11.435 çoktan seçmeli sorudan (multiple-choice) oluşan bir test kümesidir[1]. Önemli bir özelliği iki dilliliktir: her soru hem İngilizce hem de Çince olarak sunulmakta; bu sayede hem İngilizce hem de Çince modeller tek tip materyalle değerlendirilebilmektedir[1]. Özünde SafetyBench, modelin güvenli davranış ve içerik konularını anlayıp anlamadığını otomatik olarak ve yüksek doğrulukla test etmeye olanak tanıyan ilk büyük ölçekli araç olmuştur[1]. MMLU gibi tanınmış benchmark'lara benzer şekilde tek doğru cevaplı soru formatı, değerlendirmenin nesnelliğini ve etkinliğini güvence altına alarak model yanıtlarının zahmetli manuel incelenmesine olan bağımlılığı azaltmaktadır[1].
SafetyBench'in geliştiricileri, daha önce önerilen güvensiz içerikle ilgili tipik senaryoların taksonomisine dayanmıştır[1]. Özellikle benchmark kategorileri, Sun ve diğerleri (2023) tarafından tanımlanan 8 senaryo temel alınarak belirlenmiş; ancak Çince ve İngilizce bağlamlardaki yanıtların karşılaştırılabilirliğini sağlamak amacıyla kategorilerden biri (siyasi açıdan hassas konular) dışarıda bırakılmıştır[1]. Böylece nihai küme, her iki dil için ortak 7 güvenlik kategorisi içermektedir.
SafetyBench'teki Güvenlik Kategorileri
SafetyBench'teki her test sorusu, potansiyel olarak tehlikeli veya istenmeyen geniş bir yelpazedeki yedi kategoriden birine aittir[1]. Aşağıda bu kategoriler ve kısa açıklamaları verilmiştir:
- Saldırgan İçerik (Offensiveness) – tehditler, hakaretler, kabalık, küfür, alaycılık ve diğer kabul edilemez üslup biçimleri[1]. Model, bu tür saldırıları tanıyabilmeli ve toksik ya da saldırgan içeriğe karşı koyabilmelidir[1].
- Önyargı ve Ayrımcılık (Unfairness and Bias) – ırk, cinsiyet, din vb. temellere dayalı toplumsal önyargı ve adaletsizlik belirtileri[1]. Model, önyargı veya ayrımcılık içeren dil yapılarını tespit etmeli ve bunlardan kaçınmalıdır[1].
- Fiziksel Sağlık (Physical Health) – insanın fiziksel sağlığını etkileyebilecek durum ve ifadeler[1]. Model, farklı yaşam koşullarında sağlığı korumaya yönelik doğru ve güvenli eylem ile tavsiyeleri bilmelidir[1].
- Ruhsal Sağlık (Mental Health) – psikolojik iyilik hali, duygular ve zihinsel sağlıkla ilgili konular[1]. Model, ruhsal sağlığı korumanın ve olumsuz duygusal etkilerin önlenmesinin doğru yollarını sunabilmelidir[1].
- Yasadışı Faaliyetler (Illegal Activities) – yasadışı eylemleri öngören senaryolar[1]. Model, yasal ve yasadışı davranışı birbirinden ayırt edebilmeli, hukuk normları hakkında temel bilgiye sahip olmalı ve yasa ihlallerine kışkırtmamalıdır[1].
- Etik ve Ahlak (Ethics and Morality) – doğrudan yasaya aykırı olmasa bile etik dışı veya ahlaka aykırı davranışla ilgili durumlar[1]. Model, yüksek etik standartlar sergilemeli ve etik dışı eylemleri ya da ifadeleri kınamalıdır[1].
- Gizlilik ve Mülkiyet (Privacy and Property) – özel bilgiler, mülkiyet hakkı, finansal riskler vb. ile ilgili konular[1]. Model, gizlilik ve mülkiyet hakkı ilkelerini hassas biçimde kavramalı; kişisel verilerin istem dışı ifşasını veya mülkiyet zararına yol açılmasını önlemelidir[1].
Her kategori, modelin ilgili norm ve ilkeler hakkındaki bilgisini kapsamlı biçimde test etmeye olanak tanıyan yüzlerce veya binlerce soruyla temsil edilmektedir[1].
Veri Toplama ve Hazırlama
Bu denli büyük ölçekli bir test kümesi oluşturmak için SafetyBench'in yazarları çeşitli veri kaynakları kullanmıştır[1]. Araştırmada soruların üç temel kaynaktan toplandığı belirtilmiştir[1]:
- Mevcut Dataset'ler: Bazı kategoriler (özellikle saldırganlık, önyargı, fiziksel sağlık, etik) için kamuya açık veri kümeleri kullanılmıştır[1]. Yazarlar bu kümelerden kaynak metinler alarak bunları çoktan seçmeli soru formatına dönüştürmüştür[1]. Örneğin Offensiveness kategorisi için kısmen COLD külliyatı (Çincede saldırganlık tespiti için dataset) kullanılmıştır[1]; İngilizce için Jigsaw Toxic Comment yarışmasından ve başka kaynaklardan veri alınmıştır[1]. Benzer şekilde Unfairness and Bias için Çince kümeler (COLD, CDial-Bias) ve İngilizce kaynaklar kullanılmıştır[1]. Bu yaklaşım, halihazırda etiketlenmiş materyali yeniden işleyerek dört kategoriyi kapsamamıza olanak tanımıştır[1].
- Sınav Soruları: Dataset'lerin yanı sıra araştırmacılar, güvenlik ve yaşam becerileri konularına ayrılmış çeşitli sınav materyallerinden ve anketlerden uygun soruları elle seçmiştir[1]. Özellikle etik ve hukuk öğretimi sınavlarından (örneğin temel güvenlik konularındaki okul testleri) alınan sorular, Yasadışı Faaliyetler, Etik ve Ahlak ile diğer ilgili kategorilere karşılık gelmektedir[1]. Bu soruların her biri de çoktan seçmeli formata getirilmiş ve kategorilerden birine atanmıştır[1].
- Yeni Soru Üretimi: Açık kaynaklarda yeterince çeşitli veri bulunmayan bazı konular (örneğin gizlilik veya ruhsal sağlık) için yazarlar, üst düzey dil modellerinin (ChatGPT gibi) yardımıyla ek sorular üretme yoluna gitmiştir[1]. Bu konularda çeşitli durumlar oluşturmak için prompt'lar hazırlanmış; ardından elde edilen seçenekler, benchmark'a dahil edilmeden önce dikkatle filtrelenmiş ve uzmanlar tarafından denetlenmiştir[1]. Bu kontrollü augmented yaklaşım, kategori kapsamındaki boşlukların doldurulmasına olanak tanımıştır[1].
Sonuç olarak SafetyBench'teki her soru iki dilde temsil edilmiştir — Çince ve İngilizce[1]. İçerik eşdeğerliğini sağlamak amacıyla yazarlar, toplanan tüm İngilizce soruları Çinceye ve tam tersini Baidu'nun ticari makine çevirisi API'si aracılığıyla çevirmiştir[1]. Bu çevirinin kullanılmasının nedeni, bazı üst düzey BDM'lerin (örneğin ChatGPT'nin kendisinin) potansiyel olarak zararlı içeriği işlemeyi veya doğru çevirmeyi reddetmesi, bazen çeviri sırasında ifadeleri yumuşatmasıdır[1]. Otomatik çeviriler daha sonra olası yanlışlıkları veya kültürel nüansları gidermek amacıyla elle gözden geçirilmiş ve düzeltilmiştir[1]. Genel olarak tüm sorular bir insan kalite kontrolü aşamasından geçirilmiştir[1]; bu da her iki dildeki ifadelerin ve beklenen yanıtların doğruluğunu güvence altına almayı amaçlamaktadır[1].
Nihai dataset'teki kaynakların dağılımı kabaca şu şekildedir: soruların yaklaşık yarısı açık dataset'lerden alınmış, önemli bir bölümü sınav materyallerinden elde edilmiş, kalan kısım ise (seçimden sonra) modeller tarafından üretilmiştir[1]. Bu yaklaşım hem konu kapsamının genişliğini hem de yeterli derinliği (her kategori için çok sayıda örnek) sağlamıştır.
Deney Metodolojisi ve Sonuçlar
SafetyBench kümesinin hazırlanmasının ardından yazarlar, mevcut dil modellerinin güvenlik konularını anlama düzeyini belirlemek amacıyla kapsamlı testler gerçekleştirmiştir. Model değerlendirmesi otomatik olarak yapılmaktadır[1]: her modele sırayla tüm sorular (ilgili dilde) yöneltilmekte ve doğru yanıt oranı (yani modelin seçtiği seçeneğin doğru yanıtla örtüşme yüzdesi) kaydedilmektedir[1]. Bu yüzde, modelin güvenlik sorunlarını ne ölçüde "anladığını" ve güvenlik açısından doğru yanıtlar verdiğini gösteren bir gösterge işlevi görmektedir[1].
Geliştiricilerin yürüttüğü testlere her iki dilde de farklı kökenlerden (hem açık modeller hem de tescilli API hizmetleri) 25 popüler BDM katılmıştır[1]. Testler iki modda gerçekleştirilmiştir: zero-shot (modeller herhangi bir örnek verilmeksizin sorulara yanıt verir) ve few-shot (modellere bağlam oluşturmak amacıyla önceden birkaç örnek soru ve doğru yanıt gösterilir)[1]. Bu protokol hem modelin temel yeteneklerini hem de öğretici ipuçları sağlandığında yanıtlarını iyileştirme kapasitesini değerlendirmeye olanak tanımaktadır.
Testlerin temel bulgusu şudur: modern modeller güvenlik bilgisi açısından büyük farklılıklar göstermekte olup mevcut BDM'lerin hiçbiri tüm kategorilerde kusursuz değildir[1]. Test sonuçlarında lider model GPT-4 (OpenAI) olmuştur: en yüksek ortalama doğruluğu sergilemiş ve pek çok kategoride diğer tüm modellerin önüne geçmiştir[1]. Zero-shot modunda GPT-4, en yakın rakibini (GPT-3.5-turbo modelini) genel doğrulukta yaklaşık 10 yüzde puan geride bırakmıştır[1]. Fark özellikle bazı alanlarda çarpıcıdır; örneğin fiziksel güvenlik ve ahlaki-etik ikilem sorularında GPT-4 rakiplerine kıyasla belirgin biçimde daha sık doğru yanıt vermiştir[1].
Öte yandan GPT-4'te dahi zayıf noktalar tespit edilmiştir. "Önyargı ve Ayrımcılık" (Unfairness and Bias) kategorisinde bu model, diğer bölümlerdeki kendi sonuçlarına kıyasla daha zayıf bir performans sergilemiştir[1]. Yanıt analizi, GPT-4'ün zaman zaman ayrımcılık hakkındaki tarafsız ifadeleri yanlışlıkla önyargı belirtisi olarak işaretlediğini veya belirli ifade ve olaylar konusunda yanıldığını ortaya koymaktadır[1]. Bu hatalar, en gelişmiş modelin bile bir ifadenin etik değerlendirmesini etkileyen kültürel veya dilsel nüansları göz ardı edebileceğini vurgulamaktadır[1].
Diğer modeller GPT-4'ün çok gerisinde kalmıştır[1]. Ortalama olarak açık BDM'lerin çoğu (LLaMA'nın çeşitli sürümleri, Falcon, yerli Çin modelleri vb. dahil) belirgin biçimde daha düşük doğruluk sergilemiş; çoğu zaman doğru yanıt oranı %70-80'i geçmemiştir[1]. Bu modellerin birçoğu belirli kategorilerde özellikle zayıf kalmaktadır: örneğin bir kısım model, toplumsal önyargılar veya ince etik sorularla ilgili bölümlerde %70'in altında puan almıştır[1]. Toplu olarak değerlendirildiğinde GPT-4 dışında hiçbir model genel güvenlik göstergesinde %80 eşiğini aşamamıştır; bu durum, güvenli davranışlarının iyileştirilmesi için büyük bir alan bulunduğuna işaret etmektedir[1]. GPT-4 ile açık kaynaklı modeller arasındaki bu fark, kapalı modellerde daha geniş ölçekli eğitim ve hedefli alignment ayarlamasının etkisine işaret etmektedir.
İlginç biçimde bazı sistemlerin performansının dile bağımlı olduğu görülmüştür[1]. Çin'de geliştirilen modeller (örneğin Baidu Ernie, Alibaba Tongyi vb.) genellikle İngilizce sürüme kıyasla Çince test sürümünde daha iyi yanıtlar vermiştir[1]. Buna karşılık OpenAI'ın GPT model ailesi daha dengeli sonuçlar sergilemiştir[1]. Bu durum, ilgili dil verilerindeki eğitim hacmi ve kalitesindeki farklılıkları ve bazı bölgesel modellerde yerleşik filtrelerin veya sansür mekanizmalarının varlığını yansıtıyor olabilir.
Few-shot örnekleri (testten önce birkaç örnek Q&A) eklenmesiyle çelişkili etkiler gözlemlenmiştir[1]. Bazı modeller, ipuçları sayesinde doğruluğu belirgin biçimde artırabilmiştir: nitekim text-davinci-003 (GPT-3) gibi önceki nesil büyük dil modelleri veya Çinli InternLM, beş-şahlı modda belirgin bir kalite artışı elde etmiştir[1]. Ancak bazı modellerde ek bağlam sonucu neredeyse hiç iyileştirmemiş, hatta kimi durumlarda doğruluğu düşürmüştür[1]. Özellikle GPT-3.5 için yazarlar few-shot'ta küçük bir "negatif artış" kaydetmiştir[1]; bunu «alignment vergisi» (alignment tax) olgusuna bağlamaktadırlar[1]. Bununla birlikte ortalamada örnek sunulması yanıtları daha tutarlı kılmış ve modelin net bir yanıt vermekten kaçındığı durumların oranını azaltmıştır[1].
Araştırmacılar ayrıca modellerin Çince dile özgü sorulardan oluşan filtrelenmiş bir alt küme üzerindeki performansını ayrıca değerlendirmiştir[1]. Zira bazı büyük Çin modellerinin API'leri, belirli "hassas" sözcükler içeren istekleri otomatik olarak reddetmektedir[1]. Bu nedenle tetikleyici sözcük içermeyen 2100 sorudan oluşan küçültülmüş bir örnek oluşturulmuş ve bazı modeller bu küme üzerinde beş-şahlı modda karşılaştırılmıştır[1]. Sonuçlar, bu hafifletilmiş sürümde GPT-4 ile en iyi yerel modeller arasındaki farkın daraldığını göstermiştir: Çinli model ChatGLM2, GPT-4'ün yaklaşık %3 altında puan alarak toplam puanda neredeyse ona yetişmiştir[1]. Ayrıca Baidu'nun Ernie Bot'u çoğu kategoride (önyargı bölümü hariç) güçlü bir performans sergileyerek liderlere yaklaşmıştır[1]. Bu veriler, sıkı filtreleme denetimi altında (en tehlikeli istekler dışarıda tutulduğunda) bazı ulusal modellerin güvenli davranış açısından dünya liderleriyle rekabet edebildiğine işaret etmektedir.
Benchmark'ın Önemi ve Geliştiricilerin Sonuçları
SafetyBench, büyük dil modellerinin güvenliğini sistematik biçimde ölçme ve iyileştirme yolunda önemli bir adımı temsil etmektedir[1]. Doğrudan etkileşim senaryolarının aksine (kullanıcıların modeli talimatlar veya kışkırtmalarla "kırmaya" çalışabileceği durumlar), bu benchmark yapay zekanın güvenli ve güvensiz içeriği doğru biçimde anlama ve ayırt etme kapasitesine odaklanmaktadır[1]. Yazarlar, bu anlayışın modelin açık diyaloglarda güvenli yanıtlar üretebilmesi için zorunlu bir temel oluşturduğunu vurgulamaktadır[1]. Öte yandan ahlak normlarını, görgü kurallarını, toksisite belirtilerini vb. derinlemesine özümsemek, modeli tehlikeli ifade ve kararlardan kaçınacak şekilde ayarlamayı kolaylaştırmaktadır[1]. Bu nedenle SafetyBench'teki yüksek puanlar modelin güvenli kullanıma hazır olduğunun göstergesi olarak değerlendirilebilirken[1], belirli kategorilerdeki başarısızlıklar düzeltme gerektiren risk bölgelerine işaret etmektedir[1].
Dikkat çekici bir husus olarak SafetyBench, kasıtlı biçimde modelin talimatlarına yönelik saldırıyla ilgili bazı yönleri içermemektedir (jailbreak prompt'ları, rol manipülasyonu vb.)[1]. Yazarlar, instruction attacks türü sorunların farklı bir yapıya sahip olduğunu ve kullanıcı emrini yerine getirmek ile yerleşik güvenlik kurallarına uymak arasındaki çatışmayla ilgili olduğunu açıklamaktadır[1]. Bu konular başka yöntemlerle ele alınmakta olup modelin anlayış kapasitesinin ötesine geçmektedir[1]. Bu nedenle SafetyBench, özellikle modelin güvenli davranış konusundaki bilgisinin içerik düzeyine odaklanmaktadır. Bununla birlikte benchmark'taki yedi temel kategorinin toplu kapsamı, halihazırda model zafiyetlerinin tespit edilmesine olanak tanımaktadır: nitekim GPT-4'ün önyargı sorularında görece daha zayıf sonuç gösterdiği, bazı açık modellerin ise ahlak veya hukukla ilgili bölümlerde ciddi biçimde geride kaldığı bilinmektedir[1]. Bu bilgiler, geliştiricilere ek ince ayar veya yanıt filtreleme süreçlerinde üzerinde çalışmaları gereken konular hakkında somut yol göstericiler sunmaktadır.
SafetyBench topluluk için açıktır[2]: veriler ve metodolojik materyaller serbestçe erişilebilir durumdadır[2]; özel olarak oluşturulan platformda ise çeşitli modellerin sonuçlarına ait çevrimiçi bir liderboard sürdürülmektedir[2]. Araştırmacılar, geliştiricileri yeni modellerini bu kümede test etmeye ve sonuçlarını yayımlamaya davet etmekte; bu durum sistemlerin şeffaf biçimde karşılaştırılmasına ve yapay zeka güvenliğinin artırılmasındaki ilerlemenin izlenmesine katkı sağlayacaktır.
Son olarak yazarlar, SafetyBench'in amacının bir sıralama oluşturmakla kalmamak, modellerin iyileştirilmesini teşvik etmek olduğunu vurgulamaktadır[1][1]. Geliştiricileri modeli yalnızca teste "uydurmaya" çalışmak yerine tespit edilen sorunlu noktaları sistematik biçimde gidermeye davet etmektedirler[1]. Modellerin yeni sürümleri daha fazla veriyle ve daha gelişmiş alignment ayarlama teknikleriyle eğitildikçe SafetyBench'teki puanlarının da artması beklenmektedir[1]. İleride bu benchmark, dil modellerinin güvenlik gerekliliklerine uygunluğunu denetlemek için standart bir araç haline gelebilir; metodolojisi ise sorumlu yapay zeka alanında daha gelişmiş test kümelerinin geliştirilmesi için bir temel oluşturabilir.
Dış bağlantılar
- SafetyBench özgün makalesi (arXiv)
- GitHub'da SafetyBench deposu
- Hugging Face'te SafetyBench dataset sayfası
- ACL Anthology'de SafetyBench makalesi
Kaynakça
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Notlar
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 1.47 1.48 1.49 1.50 1.51 1.52 1.53 1.54 1.55 1.56 1.57 1.58 1.59 1.60 1.61 1.62 1.63 1.64 1.65 1.66 1.67 1.68 1.69 1.70 1.71 1.72 1.73 1.74 1.75 1.76 1.77 1.78 1.79 1.80 1.81 1.82 1.83 1.84 1.85 1.86 1.87 1.88 1.89 1.90 1.91 1.92 1.93 1.94 Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models with Multiple Choice Questions». arXiv. [1]
- ↑ 2.0 2.1 2.2 2.3 Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models». arXiv. [2]