---
title: "SafetyBench (HU)"
source: "https://systems-analysis.info/int/SafetyBench_(HU)"
wiki: "systems-analysis.info/int"
article: "SafetyBench_(HU)"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 6556
wiki_created_at: 2026-09-07T00:06:35Z
wiki_modified_at: 2026-09-07T00:06:35Z
downloaded_at: 2026-09-07T23:14:33Z
---

# SafetyBench (HU)

**SafetyBench** — ez az első **átfogó benchmark** a **nagy nyelvi modellek biztonságának** sokoldalú értékelésére <sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A Tsinghua Egyetem kutatócsoportja fejlesztette ki, és 2023-ban mutatták be<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.

A nagy nyelvi modellek (pl. a ChatGPT) fejlődésével és tömeges elterjedésével egyre nagyobb figyelem irányul az ilyen rendszerek biztonsági problémáira<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A kutatások kimutatták, hogy a párbeszédes modellek kiszivárogtathatják a felhasználók személyes adatait, vagy toxikus megnyilvánulásokat generálhatnak<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Így a nagy nyelvi modellek biztonságának értékelése kritikusan fontos feladattá vált a megbízható gyakorlati alkalmazásuk szempontjából. Mindazonáltal egészen a közelmúltig hiányoztak az átfogó benchmarkok (tesztkészletek), amelyek a modell biztonságának összes fő aspektusát lefednék; a meglévő datasetek csupán egyes szempontokat (pl. toxicitás vagy társadalmi előítéletek) vizsgáltak, és nem adtak teljes képet<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Az átfogó értékelési módszer hiánya megnehezítette mind a sebezhetőségek feltárását, mind a biztonságosabb nyelvi modellek fejlesztését<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A SafetyBench-et ennek a hiánynak a pótlására hozták létre<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.

## SafetyBench fejlesztése és leírása

A SafetyBench **11 435 feleletválasztós kérdésből** (multiple-choice) áll, amelyek **7 különböző kategóriát** fednek le a mesterséges intelligencia által generált tartalmakhoz kapcsolódó tipikus problémák és veszélyek köréből<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Fontos jellemzője a **kétnyelvűség**: minden kérdés elérhető **angol** és **kínai** nyelven, ami lehetővé teszi mind az angol, mind a kínai nyelvű modellek egységes anyagon való értékelését<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Lényegében a SafetyBench lett az első nagyszabású eszköz, amely automatikusan és nagy pontossággal képes tesztelni, hogy a modell mennyire érti a biztonságos viselkedés és tartalom kérdéseit<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Az egyetlen helyes választ tartalmazó feladatformátum – hasonlóan az olyan ismert benchmarkokhoz, mint az MMLU – objektivitást és hatékony értékelést biztosít, csökkentve a fáradságos kézi ellenőrzéstől való függőséget<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.

A SafetyBench fejlesztői a korábban javasolt, nem biztonságos tartalmakhoz kapcsolódó tipikus forgatókönyvek taxonómiájára támaszkodtak<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Különösen: a benchmark kategóriáit Sun és munkatársai (2023) munkájában leírt 8 forgatókönyv alapján alakították ki, azonban az egyik kategóriát (politikailag érzékeny témák) kizárták, hogy elkerüljék a kínai és az angol kontextusban adott válaszok összemérhetetlenségét<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Így a végleges készlet 7, mindkét nyelvre közösen érvényes biztonsági kategóriát tartalmaz.

## Biztonsági kategóriák a SafetyBench-ben

A SafetyBench minden tesztkérdése a hét kategória egyikébe tartozik, amelyek a potenciálisan veszélyes vagy nemkívánatos szempontok széles spektrumát fedik le<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Az alábbiakban ezek a kategóriák és rövid leírásuk olvasható:

- **Sértő tartalom** (Offensiveness) – fenyegetések, sértések, durvaság, trágárság, szarkazmus és a nem elfogadható hangnem egyéb megnyilvánulásai<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A modellnek képesnek kell lennie felismerni az ilyen megnyilvánulásokat, és ellenállni a toxikus vagy agresszív tartalomnak<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.
- **Elfogultság és diszkrimináció** (Unfairness and Bias) – társadalmi torzítás és igazságtalanság megjelenése faj, nem, vallás és egyéb jellemzők alapján<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A modellnek azonosítania kell és el kell kerülnie az előítéleteket vagy diszkriminációt kifejező nyelvi szerkezeteket<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.
- **Fizikai egészség** (Physical Health) – olyan helyzetek és megnyilvánulások, amelyek hatással lehetnek az ember fizikai egészségére<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A modellnek ismernie kell a helyes, biztonságos cselekvéseket és tanácsokat az egészség megőrzéséhez különféle élethelyzetekben<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.
- **Mentális egészség** (Mental Health) – a pszichológiai jólléttel, érzelmekkel és mentális egészséggel kapcsolatos kérdések<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A modellnek megfelelő módszereket kell ajánlania a mentális egészség fenntartásához és a negatív érzelmi hatások megelőzéséhez<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.
- **Illegális tevékenységek** (Illegal Activities) – törvénysértő cselekedeteket feltételező forgatókönyvek<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A modellnek különbséget kell tudnia tenni a törvényes és törvénytelen viselkedés között, alapvető ismeretekkel kell rendelkeznie a jogi normákról, és nem szabad törvénysértésre buzdítania<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.
- **Etika és erkölcs** (Ethics and Morality) – etikátlan vagy erkölcstelen viselkedéssel kapcsolatos helyzetek, még akkor is, ha azok nem esnek közvetlenül a törvény hatálya alá<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A modellnek magas etikai standardokat kell képviselnie, és el kell ítélnie az etikátlan cselekedeteket vagy megnyilvánulásokat<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.
- **Adatvédelem és tulajdon** (Privacy and Property) – személyes adatokat, tulajdonjogot, pénzügyi kockázatokat stb. érintő kérdések<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A modellnek érzékenyen kell értenie az adatvédelmi és vagyonjogi elveket, és meg kell előznie a személyes adatok akaratlan kiszivárgását vagy vagyoni kár okozását<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.

Mindegyik kategóriát több száz vagy több ezer kérdés képviseli, ami lehetővé teszi a modell vonatkozó normák és elvek ismeretének átfogó ellenőrzését<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.

## Adatgyűjtés és -előkészítés

Ekkora méretű tesztkészlet összeállításához a SafetyBench szerzői **sokféle adatforrást** vettek igénybe<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A kutatás szerint a kérdések három fő forrásból gyűltek össze<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>:

- **Meglévő datasetek**: Egyes kategóriákhoz (különösen sértések, előítéletek, fizikai egészség, etika) nyilvánosan elérhető adatkészleteket használtak<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A szerzők átvették az eredeti szövegeket ezekből a készletekből, és feleletválasztós kérdések formátumára alakították őket<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Például az Offensiveness kategóriához részben a COLD korpuszt (kínai nyelvű sértésdetekciós dataset) használták<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>; az angol nyelvhez a Jigsaw Toxic Comment versenyből és más forrásokból származó adatokat vontak be<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Hasonlóképpen, az Unfairness and Bias kategóriához kínai készleteket (COLD, CDial-Bias) és angol nyelvű forrásokat alkalmaztak<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Ez a megközelítés lehetővé tette négy kategória lefedését már meglévő, annotált anyag feldolgozásával<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.
- **Vizsgakérdések**: Az adatseteken túl a kutatók kézzel válogattak ki megfelelő feladatokat különféle vizsgaanyagokból és kérdőívekből, amelyek biztonsági és életvezetési kérdésekkel foglalkoznak<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Különösen etikai és jogismereti tananyagvizsgákból (pl. biztonsági alapismeretek iskolai tesztjeiből) nyertek ki kérdéseket, amelyek megfelelnek az Illegális tevékenységek, az Etika és erkölcs, valamint más kapcsolódó témák kategóriáinak<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Minden ilyen kérdést szintén feleletválasztós formátumra hoztak, és a kategóriák egyikébe soroltak<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.
- **Új kérdések generálása**: Egyes szempontokhoz (pl. adatvédelem vagy mentális egészség), ahol a nyílt forrásokban nem állt rendelkezésre elég változatos adat, a szerzők magas szintű nyelvi modellek (pl. ChatGPT) segítségével generáltak további kérdéseket<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Promptokat fogalmaztak meg ezekhez a témákhoz tartozó változatos helyzetek létrehozásához, majd a kapott változatokat gondosan **szűrték és szakértők ellenőrizték**, mielőtt bekerültek a benchmarkba<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Ez az ellenőrzött, augmented megközelítés lehetővé tette a kategóriák lefedettségének hézagait pótolni<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.

Végül a SafetyBench minden kérdése **kétnyelvűen lett reprezentálva** – kínai és angol nyelven<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A tartalom egyenértékűségének biztosítása érdekében a szerzők a Baidu kereskedelmi gépi fordítási API segítségével lefordították az összes összegyűjtött angol kérdést kínai nyelvre és fordítva<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Ennek a fordítási megoldásnak az alkalmazása azzal indokolt, hogy néhány csúcsszintű nagy nyelvi modell (pl. maga a ChatGPT) visszautasítja a potenciálisan veszélyes tartalom feldolgozását vagy pontos fordítását, olykor tompítva a megfogalmazásokat fordítás közben<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Az automatikus fordításokat ezt követően manuálisan átnézték és korrigálták, hogy kiküszöböljék a lehetséges pontatlanságokat vagy kulturális árnyalatokat<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Összességében minden kérdés átment egy **emberi minőség-ellenőrzési** fázison<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>, amelynek célja a megfogalmazások helyességének és a várt válaszok mindkét nyelvbeli megfelelőségének garantálása<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.

A forrásoknak a végleges datasetben való megoszlása hozzávetőlegesen a következő: a kérdések mintegy fele nyílt adatkészletekből származik, jelentős részük vizsgaanyagokból, a maradék pedig modellek által generált (szűrés után)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Ez a megközelítés biztosította mind a témák szélességét, mind a kellő mélységet (számos példa kategóriánként).

## Kísérleti módszertan és eredmények

A SafetyBench készlet elkészítése után a szerzők nagyszabású tesztelést végeztek a jelenlegi nyelvi modelleken, hogy meghatározzák biztonsági kérdésekben való tájékozottságuk szintjét. A modellek értékelése **automatikusan** történik<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>: minden modellnek sorban feltesznek minden kérdést (a megfelelő nyelven), és rögzítik a helyes válaszok arányát (azaz a modell által választott lehetőség és a helyes válasz egyezésének százalékát)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Ez a százalékos arány mutatja, hogy a modell mennyire „jártas" a biztonsági kérdésekben, és mennyire ad biztonsági szempontból helyes válaszokat<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.

A fejlesztők által végzett tesztekben **25 népszerű nagy nyelvi modell** vett részt különféle háttérrel (mind nyílt modellek, mind kereskedelmi API-szolgáltatások) mindkét nyelven<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A tesztelés két módban zajlott: **zero-shot** (a modellek mindenféle példa nélkül válaszolnak a kérdésekre) és **few-shot** (a modelleknek előzetesen néhány kérdéspéldát mutatnak helyes válaszokkal a kontextus megadásához)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Ez a protokoll lehetővé teszi a modell alapvető képességeinek és a tanítási utasítások meglétével való válaszjavítási képességének egyaránt értékelését.

A tesztek fő tanulsága – **a jelenlegi modellek nagymértékben különböznek biztonsági tudásuk szintjén, és egyetlen elérhető nagy nyelvi modell sem kifogástalan** minden kategóriában<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A tesztek élmezőnyébe a **GPT-4** (OpenAI) modell kerülöt: a legmagasabb átlagos pontosságot érte el, és számos kategóriában jelentősen megelőzte az összes többi modellt<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Zero-shot módban a GPT-4 közel **10 százalékponttal** előzte meg a legközelebbi vetélytársat (GPT-3.5-turbo modellt) az összesített pontosságban<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A különbség egyes területeken különösen nagy: például fizikai biztonsági kérdésekben és erkölcsi-etikai dilemmákban a GPT-4 szembetűnően gyakrabban válaszolt helyesen, mint a versenytársak<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.

Ugyanakkor még a GPT-4-nél is azonosítottak **gyenge pontokat**. Az „Elfogultság és diszkrimináció" (Unfairness and Bias) kategóriában ez a modell gyengébben teljesített saját más részterületeken elért eredményeihez képest<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A válaszok elemzése megmutatta, hogy a GPT-4 néha tévesen jelöl meg diszkriminációról szóló semleges megnyilvánulásokat előítélet-kifejeződésként, vagy összetéveszti a specifikus kifejezéseket és eseményeket<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Az ilyen hibák rávilágítanak arra, hogy még a legfejlettebb modell is alábecsülheti a megnyilvánulás etikusságának megítélését befolyásoló kulturális vagy nyelvi árnyalatokat<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.

A többi modell jelentősen elmaradt a GPT-4 mögött<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Átlagosan a legtöbb nyílt nagy nyelvi modell (köztük a LLaMA különböző verziói, a Falcon, hazai kínai modellek stb.) **lényegesen alacsonyabb pontosságot** mutatott, amely sokszor nem haladta meg a helyes válaszok 70-80%-át<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Közülük sokan különösen gyengén teljesítenek egyes kategóriákban: például számos modell 70% alatti eredményt ért el a társadalmi előítéletekkel vagy finom etikai kérdésekkel kapcsolatos részterületeken<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Összességében egyetlen modell sem (a GPT-4 kivételével) lépi túl a 80%-os feltételes küszöböt az általános biztonsági mutatóban, ami nagy teret jelez a biztonságos viselkedésük további javítására<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A GPT-4 és a nyílt forráskódú modellek közötti különbség a zárt modellek nagyobb léptékű tanítási és célzott alignment-finomhangolásának hatására utal.

Érdekes módon egyes rendszerek teljesítménye **nyelvenként eltérőnek** bizonyult<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A Kínában fejlesztett modellek (pl. Baidu Ernie, Alibaba Tongyi stb.) általában jobban válaszoltak a tesztek kínai verziójára, mint az angolra<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Ezzel szemben az OpenAI GPT-modellcsaládja kiegyensúlyozottabb eredményeket mutatott<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Ez tükrözheti a megfelelő nyelvi adatokon végzett tanítás eltérő mennyiségét és minőségét, valamint egyes regionális modellekben lévő beépített szűrők vagy cenzúramechanizmusok meglétét.

Few-shot példák hozzáadásakor (néhány bemutató Q&A a tesztelés előtt) **vegyes hatásokat** figyeltek meg<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Egyes modellek a segítségnyújtás révén jelentősen képesek voltak növelni a pontosságot: így az előző generációs nagy nyelvi modellek, mint a text-davinci-003 (GPT-3) vagy a kínai InternLM, érezhető minőségnövekedést mutattak few-shot módban<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Azonban néhány modellnél a kiegészítő kontextus alig javított az eredményen, sőt néhány esetben még csökkentette is a pontosságot<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Különösen a GPT-3.5 esetében a szerzők kis **„negatív növekedést" rögzítettek few-shot módban**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>, amit az ún. **„alignment tax"** (összehangolási adó) jelenségével hoznak összefüggésbe<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Mindazonáltal átlagosan a példák megadása stabilabbá tette a válaszokat, és csökkentette azokat az eseteket, amikor a modell megtagadja az egyértelmű választ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.

A kutatók külön értékelték a modellek teljesítményét a **kínai nyelvű kérdések szűrt részhalmazán**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Ugyanis egyes nagy kínai modellek API-ja automatikusan visszautasítja az egyes „érzékeny" szavakat tartalmazó lekéréseket<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Ezért összeállítottak egy 2100 kérdéses csökkentett mintát trigger-szavak nélkül, és ezen hasonlítottak össze néhány modellt five-shot módban<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Az eredmények megmutatták, hogy ezen a könnyített változaton a GPT-4 és a legjobb helyi modellek közötti szakadék szűkül: a kínai ChatGLM2 modell mindössze ~3%-kal maradt el a GPT-4-től, és az összesített pontszámban szinte egyenlővé vált vele<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A Baidu Ernie Bot is magabiztosan szerepelt a legtöbb kategóriában (az elfogultság részlege kivételével), és megközelítette az élmezőnyt<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Ezek az adatok arra utalnak, hogy szigorú szűrési kontroll mellett (a legveszélyesebb lekéréseket kizárva) egyes nemzeti modellek képesek versenyezni a biztonságos viselkedés terén a világ vezető modelljeivel.

## A benchmark jelentősége és a fejlesztők következtetései

A SafetyBench fontos lépést jelent a nagy nyelvi modellek biztonságának szisztematikus mérése és javítása felé<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A közvetlen interakció forgatókönyveivel ellentétben (ahol a felhasználók utasításokkal vagy provokációkkal próbálhatják „feltörni" a modellt), ez a benchmark arra összpontosít, hogy a mesterséges intelligencia képes-e **helyesen megérteni és megkülönböztetni a biztonságos és nem biztonságos tartalmakat**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A szerzők hangsúlyozzák, hogy ez a megértés szükséges alap ahhoz, hogy a modell egyáltalán képes legyen biztonságos válaszokat generálni a nyílt párbeszédekben<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Ellenkezőleg, az erkölcsi normák, az etikett szabályainak, a toxicitás jeleinek stb. mélyreható elsajátítása megkönnyíti a modell olyan hangolását, hogy elkerülje a veszélyes megnyilvánulásokat és döntéseket<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Így a SafetyBench-en elért magas eredmények a **modell biztonságos üzemeltetésre való felkészültségének indikátoraként** tekinthetők<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>, az egyes kategóriákban való gyenge teljesítmény pedig a javítást igénylő kockázati területekre hívja fel a figyelmet<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>.

Fontos megjegyezni, hogy a SafetyBench szándékosan **nem tartalmaz egyes, maguknak a modell utasításainak megtámadásával kapcsolatos szempontokat** (az úgynevezett jailbreak-promptokat, szerepmanipulációt stb.)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. A szerzők magyarázata szerint az instruction attacks típusú problémák más jellegűek, a felhasználói utasítás teljesítése és a beépített biztonsági szabályok betartása közötti konfliktussal állnak összefüggésben<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Ezeket a szempontokat más módszerekkel kezelik, és túlmutatnak a modell megértésén<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Ezért a SafetyBench kifejezetten a modell biztonságos viselkedéssel kapcsolatos tartalmi szintű tudására összpontosít. Mindazonáltal a benchmark hét kulcskategóriájának összesített lefedettsége már most is lehetővé teszi a modellek sebezhetőségeinek azonosítását: például ismeretes, hogy a GPT-4 viszonylag gyengébben teljesít az elfogultsággal kapcsolatos kérdéseken, egyes nyílt modellek pedig erősen lemaradnak az erkölcssel vagy joggal kapcsolatos részterületeken<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Ez az információ konkrét iránymutatást ad a fejlesztőknek, hogy min kell dolgozni a további finomhangolás vagy válaszszűrés során.

A SafetyBench benchmark **nyitott a közösség számára**<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-abs-2)</sup>: adatai és módszertani anyagai szabadon elérhetők<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-abs-2)</sup>, és egy speciálisan létrehozott platformon különböző modellek eredményeinek **online ranglistája** is elérhető<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-abs-2)</sup>. A kutatók arra kérik a fejlesztőket, hogy teszteljék új modelljeiket ezen a készleten, és tegyék közzé az eredményeket, ami elő fogja segíteni a rendszerek átlátható összehasonlítását és az AI biztonságának növelésében elért előrehaladás nyomon követését.

Végül a szerzők hangsúlyozzák, hogy a SafetyBench célja a **modellek fejlesztésének ösztönzése**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>, nem csupán egy újabb rangsor létrehozása<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Arra kérik a fejlesztőket, hogy ne csupán a modell tesztre való „ráhangolásával" próbálkozzanak, hanem rendszerszerűen szüntessék meg az azonosított problémás pontokat<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Ahogy a modellek új verziói egyre több adaton, egyre összetettebb alignment-finomhangolási technikákkal lesznek betanítva, várható a SafetyBench-en elért eredményeik növekedése<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HU)#cite_note-arxiv-main-v2-1)</sup>. Perspektivikusan ez a benchmark a nyelvi modellek biztonsági követelményeknek való megfelelésének ellenőrzésére szolgáló standard eszközzé válhat, módszertana pedig alapjává a felelős AI területén még tökéletesebb tesztkészletek fejlesztésének.

## Hivatkozások

- SafetyBench eredeti cikk (arXiv)
- SafetyBench tároló a GitHubon
- SafetyBench dataset oldal a Hugging Face-en
- SafetyBench cikk az ACL Anthology-ban

## Irodalom

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Jegyzetek

1.  <span id="cite_note-arxiv-main-v2-1">↑ <sup>[1.00](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-59)</sup> <sup>[1.60](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-60)</sup> <sup>[1.61](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-61)</sup> <sup>[1.62](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-62)</sup> <sup>[1.63](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-63)</sup> <sup>[1.64](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-64)</sup> <sup>[1.65](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-65)</sup> <sup>[1.66](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-66)</sup> <sup>[1.67](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-67)</sup> <sup>[1.68](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-68)</sup> <sup>[1.69](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-69)</sup> <sup>[1.70](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-70)</sup> <sup>[1.71](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-71)</sup> <sup>[1.72](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-72)</sup> <sup>[1.73](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-73)</sup> <sup>[1.74](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-74)</sup> <sup>[1.75](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-75)</sup> <sup>[1.76](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-76)</sup> <sup>[1.77](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-77)</sup> <sup>[1.78](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-78)</sup> <sup>[1.79](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-79)</sup> <sup>[1.80](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-80)</sup> <sup>[1.81](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-81)</sup> <sup>[1.82](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-82)</sup> <sup>[1.83](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-83)</sup> <sup>[1.84](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-84)</sup> <sup>[1.85](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-85)</sup> <sup>[1.86](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-86)</sup> <sup>[1.87](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-87)</sup> <sup>[1.88](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-88)</sup> <sup>[1.89](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-89)</sup> <sup>[1.90](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-90)</sup> <sup>[1.91](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-91)</sup> <sup>[1.92](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-92)</sup> <sup>[1.93](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-v2_1-93)</sup> Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models with Multiple Choice Questions». *arXiv*. <a href="https://ar5iv.labs.arxiv.org/html/2309.07045v2" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv-main-abs-2">↑ <sup>[2.0](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-abs_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-abs_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/SafetyBench_(HU)#cite_ref-arxiv-main-abs_2-2)</sup> Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models». *arXiv*. <a href="https://arxiv.org/abs/2309.07045" class="external autonumber" rel="nofollow">[2]</a></span>
