SafetyBench (TL)
SafetyBench — ito ang unang komprehensibong benchmark para sa masusing pagtatasa ng kaligtasan ng malalaking language model [1]. Ito ay binuo ng isang grupo ng mga mananaliksik mula sa Tsinghua University at ipinakita noong 2023[1].
Sa pag-unlad ng mga LLM (halimbawa, ang paglabas ng ChatGPT) at ng kanilang malawakang paggamit, lumaki ang atensyon sa mga isyu ng kaligtasan ng gayong mga sistema[1]. Ipinakita ng mga pananaliksik na ang mga conversational na modelo ay maaaring magdulot ng pagtagas ng pribadong impormasyon ng mga gumagamit o gumawa ng mga nakakalason na pahayag[1]. Kaya naman, ang pagtatasa ng kaligtasan ng mga LLM ay naging kritikal na gawain para sa kanilang maaasahang paggamit sa praktika. Gayunpaman, hanggang kamakailan ay wala pang komprehensibong mga benchmark (mga hanay ng pagsubok) na sumasaklaw sa lahat ng pangunahing aspeto ng kaligtasan ng modelo; ang mga umiiral na dataset ay sinusuri lamang ang ilang partikular na panig (halimbawa, toxicity o social na pagkiling) at hindi nagbibigay ng kumpletong larawan[1]. Ang kawalan ng isang pangkalahatang paraan ng pagtatasa ay nagpahirap sa parehong pagtukoy ng mga kahinaan at sa pagbuo ng mas ligtas na mga language model[1]. Ang SafetyBench ay nilikha upang punan ang agwat na ito[1].
Pagbuo at Paglalarawan ng SafetyBench
Ang SafetyBench ay binubuo ng hanay ng 11,435 na tanong na may pagpipilian ng sagot (multiple-choice), na sumasaklaw sa 7 iba't ibang kategorya ng mga tipikal na problema o banta na may kaugnayan sa nilalaman na ginagawa ng AI[1]. Ang isang mahalagang katangian nito ay ang dalawang wika: bawat tanong ay available sa Ingles at Tsino, na nagbibigay-daan upang masuri ang parehong mga modelo sa Ingles at sa Tsino sa pamamagitan ng pantay na materyal[1]. Sa esensya, ang SafetyBench ang naging unang malakihang instrumento na nagbibigay-daan sa awtomatiko at may mataas na katumpakan na pagsubok ng pag-unawa ng modelo sa mga tanong ng ligtas na pag-uugali at nilalaman[1]. Ang format ng mga gawain na may isang tamang sagot, katulad ng mga kilalang benchmark tulad ng MMLU, ay tinitiyak ang obhektibidad at kahusayan ng pagtatasa, na nagbabawas ng pag-asa sa mahirap na manu-manong pagsusuri ng mga sagot ng modelo[1].
Ang mga developer ng SafetyBench ay umasa sa naunang iminungkahing taksonomi ng mga tipikal na sitwasyon na may kaugnayan sa hindi ligtas na nilalaman[1]. Sa partikular, ang mga kategorya ng benchmark ay natukoy batay sa 8 sitwasyong inilarawan sa gawa ni Sun at mga kasama (2023), ngunit ang isa sa mga kategorya (mga paksa na may politikal na sensitivity) ay tinanggal upang maiwasan ang hindi pagkakatugma ng mga sagot sa mga kontekstong Tsino at Ingles[1]. Kaya naman, ang panghuling hanay ay kinabibilangan ng 7 kategorya ng kaligtasan, na karaniwan sa dalawang wika.
Mga Kategorya ng Kaligtasan sa SafetyBench
Ang bawat tanong sa pagsubok sa SafetyBench ay kabilang sa isa sa pitong kategorya, na sumasaklaw sa malawak na hanay ng mga potensyal na mapanganib o hindi kanais-nais na aspeto[1]. Nasa ibaba ang mga kategoryang ito at ang kanilang maikling paglalarawan:
- Nakakasakit na Nilalaman (Offensiveness) – mga banta, pang-iinsulto, kabastusan, malalaswang salita, sarcasm at iba pang pagpapakita ng hindi katanggap-tanggap na tono[1]. Dapat matukoy ng modelo ang mga ganitong pag-atake at labanan ang nakakalason o agresibong nilalaman[1].
- Pagkiling at Diskriminasyon (Unfairness and Bias) – mga pagpapakita ng social na pagkiling at kawalan ng katarungan batay sa lahi, kasarian, relihiyon at iba pa[1]. Dapat matukoy at maiwasan ng modelo ang mga istruktura ng wika na nagpapahayag ng pagkiling o diskriminasyon[1].
- Pisikal na Kalusugan (Physical Health) – mga sitwasyon at pahayag na maaaring makaapekto sa pisikal na kalusugan ng tao[1]. Dapat malaman ng modelo ang mga tamang, ligtas na aksyon at payo para sa pagpapanatili ng kalusugan sa iba't ibang sitwasyon sa buhay[1].
- Mental na Kalusugan (Mental Health) – mga tanong na may kaugnayan sa sikolohikal na kagalingan, emosyon at mental na kalusugan[1]. Dapat mag-alok ang modelo ng mga tamang paraan ng pagpapanatili ng mental na kalusugan at pag-iwas sa mga negatibong emosyonal na epekto[1].
- Iligal na Aktibidad (Illegal Activities) – mga sitwasyong nagsasangkot ng mga labag-sa-batas na aksyon[1]. Dapat makilala ng modelo ang legal at ilegal na pag-uugali, magkaroon ng pangunahing kaalaman sa mga pamantayan ng batas, at huwag udyukan ang paglabag sa batas[1].
- Etika at Moralidad (Ethics and Morality) – mga sitwasyong may kaugnayan sa hindi etikal o imoral na pag-uugali, kahit na hindi ito direktang saklaw ng batas[1]. Dapat ipakita ng modelo ang mataas na etikal na pamantayan at kondenahin ang mga hindi etikal na kilos o pahayag[1].
- Pribasidad at Ari-arian (Privacy and Property) – mga tanong tungkol sa pribadong impormasyon, karapatan sa ari-arian, mga panganib sa pananalapi at iba pa[1]. Dapat na maunawaan nang mabuti ng modelo ang mga prinsipyo ng pribasidad at karapatan sa ari-arian at maiwasan ang hindi sinasadyang pagsisiwalat ng personal na datos o pagdudulot ng pinsala sa ari-arian[1].
Bawat kategorya ay kinakatawan ng daan-daan o libu-libong mga tanong, na nagbibigay-daan sa komprehensibong pagsusuri ng kaalaman ng modelo sa mga kaugnay na pamantayan at prinsipyo[1].
Pangongolekta at Paghahanda ng Data
Upang makabuo ng gayong malawak na hanay ng pagsubok, ang mga may-akda ng SafetyBench ay gumamit ng iba't ibang pinagkukunan ng data[1]. Sa pananaliksik ay tinukoy na ang mga tanong ay nakolekta mula sa tatlong pangunahing pinagkukunan[1]:
- Mga Umiiral na Dataset: Para sa ilang kategorya (lalo na ang mga pang-insulto, pagkiling, pisikal na kalusugan, etika) ay ginamit ang mga publiko na available na hanay ng data[1]. Kinuha ng mga may-akda ang mga orihinal na teksto mula sa mga hanay na ito at na-convert ang mga ito sa format ng mga tanong na may mga pagpipilian ng sagot[1]. Halimbawa, para sa kategorya ng Offensiveness ay bahagyang ginamit ang corpus na COLD (isang dataset para sa pagtukoy ng mga pang-insulto sa wikang Tsino)[1]; para sa wikang Ingles ay ginagamit ang data mula sa kompetisyon ng Jigsaw Toxic Comment at iba pa[1]. Katulad nito, para sa Unfairness and Bias ay ginamit ang mga Tsinong hanay (COLD, CDial-Bias) at mga mapagkukunang Ingles[1]. Ang ganitong diskarte ay nagbigay-daan upang masaklaw ang apat na kategorya nang sabay-sabay sa pamamagitan ng muling pagproseso ng naka-label na materyal[1].
- Mga Tanong sa Pagsusulit: Bukod sa mga dataset, manu-mano ring pinili ng mga mananaliksik ang mga angkop na gawain mula sa iba't ibang materyales ng pagsusulit at mga talatanungan na nakatuon sa mga tanong ng kaligtasan at mga kasanayang pangkabuhayan[1]. Sa partikular, ang mga tanong ay kinuha mula sa mga pang-akademikong pagsusulit sa etika at batas (halimbawa, mga pang-aralang pagsubok sa mga pundasyon ng kaligtasan), na tumutugma sa mga kategorya ng Iligal na Aktibidad, Etika at Moralidad at iba pang kaugnay na paksa[1]. Ang bawat ganitong tanong ay nai-convert din sa format ng multiple choice at itinalaga sa isa sa mga kategorya[1].
- Pagbuo ng Mga Bagong Tanong: Para sa ilang aspeto (halimbawa, pribasidad o mental na kalusugan), kung saan hindi sapat ang iba't ibang data sa mga bukas na mapagkukunan, ang mga may-akda ay gumamit ng pagbuo ng mga karagdagang tanong sa tulong ng mismong mataas na antas na mga language model (tulad ng ChatGPT)[1]. Ang mga prompt ay binuo para lumikha ng iba't ibang sitwasyon sa mga paksang ito, pagkatapos ay ang mga resultang variant ay maingat na na-filter at sinuri ng mga eksperto bago isama sa benchmark[1]. Ang ganitong kontroladong augmented na diskarte ay nagbigay-daan upang mapunan ang mga puwang sa coverage ng mga kategorya[1].
Sa huli, ang bawat tanong ng SafetyBench ay ipinakita sa dalawang wika — sa Tsino at sa Ingles[1]. Upang matiyak ang pagkakatumbas ng nilalaman, isinalin ng mga may-akda ang lahat ng nakolektang mga tanong sa Ingles sa Tsino at kabaliktaran sa tulong ng komersyal na API ng makina ng pagsasalin ng Baidu[1]. Ang paggamit ng ganitong pagsasalin ay dahil sa ilang mataas na antas na LLM (halimbawa, ang mismong ChatGPT) ay tumanggi na iproseso o tumpak na isalin ang potensyal na mapanganib na nilalaman, minsan ay pinapadali ang mga pagbabalangkas sa panahon ng pagsasalin[1]. Ang mga awtomatikong pagsasalin ay pagkatapos ay manu-manong nabasa at na-correct upang maalis ang mga posibleng pagkakamali o kultural na nuances[1]. Sa kabuuan, ang lahat ng tanong ay dumaan sa yugto ng human quality checking[1], na layuning matiyak ang kawastuhan ng mga pagbabalangkas at ang pagkakatugma ng mga inaasahang sagot sa parehong wika[1].
Ang distribusyon ng mga pinagkukunan sa panghuling dataset ay humigit-kumulang ganito: halos kalahati ng mga tanong ay kinuha mula sa mga bukas na dataset, malaking bahagi ay mula sa mga materyales ng pagsusulit, at ang natitirang bahagi ay nabuo ng mga modelo (pagkatapos ng pagpili)[1]. Ang ganitong diskarte ay nagbigay ng parehong lapad ng coverage ng mga paksa at sapat na lalim (maraming halimbawa sa bawat kategorya).
Pamamaraan ng mga Eksperimento at mga Resulta
Pagkatapos ng paghahanda ng hanay ng SafetyBench, nagsagawa ang mga may-akda ng malawak na pagsubok sa mga modernong language model upang matukoy ang antas ng kanilang pag-unawa sa mga tanong ng kaligtasan. Ang pagtatasa ng mga modelo ay isinasagawa nang awtomatiko[1]: ang bawat modelo ay sunud-sunod na tinatanong ang lahat ng mga tanong (sa naaangkop na wika), at ang proporsyon ng mga tamang sagot ay naitatala (ibig sabihin, ang porsyento ng pagkakatugma ng variant na pinili ng modelo sa tamang sagot)[1]. Ang ganitong porsyento ay nagsisilbing tagapagpahiwatig kung gaano kahusay ang "pag-unawa" ng modelo sa mga isyu ng kaligtasan at nagbibigay ng mga sagot na tama mula sa pananaw ng kaligtasan[1].
Sa mga pagsubok na isinagawa ng mga developer, 25 popular na LLM ng iba't ibang pinagmulan (parehong mga bukas na modelo at proprietary API-service) sa parehong wika ang lumahok[1]. Ang pagsubok ay isinagawa sa dalawang mode: zero-shot (ang mga modelo ay sumasagot sa mga tanong nang walang anumang mga halimbawa) at few-shot (ang mga modelo ay ipinakita muna ng ilang mga halimbawa ng mga tanong na may tamang mga sagot upang magtakda ng konteksto)[1]. Ang ganitong protocol ay nagbibigay-daan upang masuri ang parehong mga pangunahing kakayahan ng modelo at ang kakayahang pagbutihin ang mga sagot kapag may mga gabay na prompt.
Ang pangunahing konklusyon ng mga pagsubok ay — ang mga modernong modelo ay lubos na nag-iiba-iba sa antas ng kaalaman sa kaligtasan, at wala sa mga available na LLM ang ganap na walang kapintasan sa lahat ng kategorya[1]. Ang nangunguna sa mga resulta ay ang modelo ng GPT-4 (OpenAI): ito ay nagpakita ng pinakamataas na average na katumpakan at malaki ang paglamang sa lahat ng iba pang mga modelo sa maraming kategorya[1]. Sa zero-shot na mode, nalampasan ng GPT-4 ang pinakamalapit na kakumpitensya nito (ang modelo ng GPT-3.5-turbo) ng halos 10 puntos ng porsyento sa kabuuang katumpakan[1]. Ang agwat ay partikular na malaki sa ilang mga larangan, halimbawa, sa mga tanong ng pisikal na kaligtasan at moral-etikal na dilemma, ang GPT-4 ay sumasagot nang tama nang mas madalas kaysa sa mga kakumpitensya[1].
Sa parehong oras, kahit sa GPT-4 ay natukoy ang mga mahinang bahagi. Sa kategorya ng "Pagkiling at Diskriminasyon" (Unfairness and Bias) ang modelong ito ay kumukuha ng mas mababang marka kumpara sa sarili nitong mga resulta sa iba pang mga seksyon[1]. Ang pagsusuri ng mga sagot ay nagpakita na ang GPT-4 ay minsan ay maling nagtatanda ng mga neutral na pahayag tungkol sa diskriminasyon bilang pagpapakita ng pagkiling o nalilito sa mga tiyak na ekspresyon at kaganapan[1]. Ang mga ganitong pagkakamali ay nagbibigay-diin na kahit ang pinaka-advanced na modelo ay maaaring magkulang sa pag-unawa ng kultural o lingguwistikong nuances na nakakaapekto sa pagtatasa ng pagiging etikal ng isang pahayag[1].
Ang iba pang mga modelo ay malaki ang pagkakalag sa GPT-4[1]. Sa average, karamihan sa mga bukas na LLM (kabilang ang iba't ibang bersyon ng LLaMA, Falcon, mga lokal na Tsinong modelo at iba pa) ay nagpakita ng lubos na mas mababang katumpakan, madalas na hindi lalampas sa 70-80% ng mga tamang sagot[1]. Marami sa kanila ang partikular na mahina sa ilang kategorya: halimbawa, ang ilang mga modelo ay nakakuha ng wala pang 70% sa mga seksyong may kaugnayan sa social na pagkiling o maselang etikal na mga tanong[1]. Sa kabuuan, wala ni isang modelo (maliban sa GPT-4) ang nakalagpas sa kondisyonal na threshold na 80% sa kabuuang tagapagpahiwatig ng kaligtasan, na nagpapahiwatig ng malaking puwang para sa karagdagang pagpapabuti ng kanilang ligtas na pag-uugali[1]. Ang ganitong pagkakaiba sa pagitan ng GPT-4 at ng mga modelo na may bukas na code ay nagpapahiwatig ng epekto ng mas malawak na pagsasanay at target na alignment fine-tuning sa mga closed na modelo.
Kawili-wili, ang pagganap ng ilang sistema ay nakadepende sa wika[1]. Ang mga modelong nilikha sa Tsina (halimbawa, Baidu Ernie, Alibaba Tongyi at iba pa) ay karaniwang mas mahusay na sumasagot sa Tsinong bersyon ng mga pagsubok kaysa sa Ingles[1]. Sa kabaligtaran, ang pamilya ng mga GPT-modelo mula sa OpenAI ay nagpakita ng mas balanseng mga resulta[1]. Maaari itong magpahayag ng iba't ibang dami at kalidad ng pagsasanay sa kaugnay na data ng wika, pati na rin ang presensya ng mga built-in na filter o mekanismo ng censura sa ilang mga rehiyonal na modelo.
Sa pagdaragdag ng mga few-shot na halimbawa (ilang demonstrasyonal na Q&A bago ang pagsubok) ay nagpakita ng magkakaibang direksyong mga epekto[1]. Ang ilang mga modelo ay nagawa pang lubos na mapataas ang katumpakan salamat sa mga pahiwatig: kaya naman, ang mga malalaking language model ng nakaraang henerasyon tulad ng text-davinci-003 (GPT-3) o ang Tsinong InternLM ay nakatanggap ng kapansin-pansing pagtaas ng kalidad sa few-shot na mode[1]. Gayunpaman, para sa ilang mga modelo ang karagdagang konteksto ay halos hindi nagpabuti ng resulta, at sa ilang mga kaso ay kahit na nagpababa ng katumpakan[1]. Sa partikular, para sa GPT-3.5 ang mga may-akda ay nagtatala ng maliit na \'negatibong pagtaas\' sa few-shot[1], na iniuugnay nila sa penomenon ng "alignment tax"[1]. Gayunpaman, sa average, ang pagbibigay ng mga halimbawa ay gumawa ng mga sagot na mas matatag at nagbabawas ng proporsyon ng mga kaso kapag ang modelo ay tumatanggi na magbigay ng malinaw na sagot[1].
Hiwalay, sinuri ng mga mananaliksik ang pagganap ng mga modelo sa isang na-filter na subset ng mga tanong na may kaugnayan sa wikang Tsino[1]. Ang dahilan ay ang API ng ilang malalaking Tsinong modelo ay awtomatikong tinatanggihan ang mga kahilingan na may ilang "sensitibong" salita[1]. Kaya naman, isang pinaikling sample ng 2100 na mga tanong nang walang mga trigger na salita ang nabuo, at sa pamamagitan nito ay inihambing ang ilang mga modelo sa few-shot na mode[1]. Ang mga resulta ay nagpakita na sa pinasimpleng bersyong ito ang agwat sa pagitan ng GPT-4 at ng mga pinakamahusay na lokal na modelo ay bumababa: kaya naman, ang Tsinong modelo ng ChatGLM2 ay nakakuha ng halos ~3% na mas kaunti kaysa sa GPT-4, na halos katumbas nito sa kabuuang marka[1]. Gayundin, ang Ernie Bot mula sa Baidu ay matatag na lumabas sa karamihan ng mga kategorya (maliban sa seksyon ng pagkiling) at lumalapit sa mga nangunguna[1]. Ang mga datos na ito ay nagpapahiwatig na sa ilalim ng mahigpit na kontrol sa pag-filter (na inalis ang mga pinaka-mapanganib na kahilingan) ang ilang mga pambansang modelo ay may kakayahang makipagkumpitensya sa mga pandaigdigang lider sa mga tuntunin ng ligtas na pag-uugali.
Kahalagahan ng Benchmark at mga Konklusyon ng mga Developer
Ang SafetyBench ay kumakatawan sa isang mahalagang hakbang patungo sa sistematikong pagsukat at pagpapabuti ng kaligtasan ng malalaking language model[1]. Hindi katulad ng mga senaryo ng direktang pakikipag-ugnayan (kung saan ang mga gumagamit ay maaaring sumubok na "i-hack" ang modelo sa pamamagitan ng mga instruksyon o probokasyon), ang benchmark na ito ay nakatuon sa kakayahan ng AI na wastong maunawaan at makilala ang ligtas at hindi ligtas na nilalaman[1]. Binibigyang-diin ng mga may-akda na ang ganitong pag-unawa ay isang kinakailangang pundasyon para sa modelo upang makabuo ng mga ligtas na sagot sa mga bukas na diyalogo[1]. Sa kabaligtaran, ang malalim na asimilasyon ng mga pamantayan ng moralidad, mga panuntunan ng etiketa, mga tanda ng toxicity at iba pa ay nagpapadali sa pag-configure ng modelo upang maiwasan ang mga mapanganib na pahayag at desisyon[1]. Kaya naman, ang mataas na mga marka sa SafetyBench ay maaaring ituring bilang tagapagpahiwatig ng kahandaan ng modelo para sa ligtas na operasyon[1], at ang mga pagkabigo sa ilang kategorya ay nagsisenyas ng mga zone ng panganib na nangangailangan ng karagdagang pagpapaunlad[1].
Mahalaga na tandaan na ang SafetyBench ay sadyang hindi kasama ang ilang aspeto na may kaugnayan sa pag-atake sa mismong mga instruksyon ng modelo (ang tinatawag na mga jailbreak-prompt, manipulasyon ng mga tungkulin at iba pa)[1]. Ipinaliwanag ng mga may-akda na ang mga problema ng uri ng instruction attacks ay may ibang kalikasan, na nauugnay sa salungatan sa pagitan ng pagsunod sa utos ng gumagamit at pagsunod sa mga built-in na panuntunan ng kaligtasan[1]. Ang mga aspetong ito ay nireresolba ng iba pang mga paraan at higit sa lawak ng pag-unawa ng modelo[1]. Kaya naman, ang SafetyBench ay nakatuon sa nilalaman na antas ng kaalaman ng modelo tungkol sa ligtas na pag-uugali. Gayunpaman, ang pinagsama-samang coverage ng pitong pangunahing kategorya sa benchmark ay nagbibigay-daan na ngayon upang matukoy ang mga kahinaan ng mga modelo: halimbawa, alam na ang GPT-4 ay nagpapakita ng medyo mas mahinang resulta sa mga tanong tungkol sa pagkiling, at ang ilang mga bukas na modelo ay lubos na nahuhuli sa mga seksyon na may kaugnayan sa moralidad o batas[1]. Ang ganitong impormasyon ay nagbibigay sa mga developer ng mga tiyak na gabay tungkol sa kung ano ang kailangang pagtuunan ng pansin sa karagdagang fine-tuning o pag-filter ng mga sagot.
Ang benchmark na SafetyBench ay bukas para sa komunidad[2]: ang datos nito at mga metodolohikal na materyales ay inilagay sa libreng access[2], at sa espesyal na likhang platform ay pinapanatili ang online na leaderboard ng mga resulta ng iba't ibang modelo[2]. Iniiimbitahan ng mga mananaliksik ang mga developer na subukan ang kanilang mga bagong modelo sa hanay na ito at ilathala ang mga resulta, na magtataguyod ng transparent na paghahambing ng mga sistema at pagsubaybay sa pag-unlad sa pagpapataas ng kaligtasan ng AI.
Sa huli, binibigyang-diin ng mga may-akda na ang layunin ng SafetyBench ay pasiglahin ang pagpapabuti ng mga modelo[1], at hindi lamang lumikha ng isa pang rangking[1]. Hinihikayat nila ang mga developer na huwag limitahan ang sarili sa mga pagtatangka na "i-fit" ang modelo sa pagsubok, kundi sistematikong alisin ang mga natukoy na problemang bahagi[1]. Habang ang mga bagong bersyon ng mga modelo ay sinasamahan ng mas maraming data, na may mas kumplikadong mga teknik ng alignment fine-tuning, inaasahan ang paglago ng kanilang mga marka sa SafetyBench[1]. Sa hinaharap, ang benchmark na ito ay maaaring maging karaniwang instrumento para sa pagsusuri ng pagsunod ng mga language model sa mga kinakailangan ng kaligtasan, at ang metodolohiya nito ay maaaring maging batayan para sa pagbuo ng mas advanced na mga hanay ng pagsubok sa larangan ng responsableng AI.
Mga Sanggunian
- Orihinal na artikulo ng SafetyBench (arXiv)
- Repository ng SafetyBench sa GitHub
- Pahina ng dataset ng SafetyBench sa Hugging Face
- Artikulo ng SafetyBench sa ACL Anthology
Panitikan
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Mga Tala
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 1.47 1.48 1.49 1.50 1.51 1.52 1.53 1.54 1.55 1.56 1.57 1.58 1.59 1.60 1.61 1.62 1.63 1.64 1.65 1.66 1.67 1.68 1.69 1.70 1.71 1.72 1.73 1.74 1.75 1.76 1.77 1.78 1.79 1.80 1.81 1.82 1.83 1.84 1.85 1.86 1.87 1.88 1.89 1.90 1.91 1.92 1.93 1.94 Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models with Multiple Choice Questions». arXiv. [1]
- ↑ 2.0 2.1 2.2 2.3 Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models». arXiv. [2]