---
title: "SafetyBench (PL)"
source: "https://systems-analysis.info/int/SafetyBench_(PL)"
wiki: "systems-analysis.info/int"
article: "SafetyBench_(PL)"
language: "pl"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Polish"
revision_id: 6561
wiki_created_at: 2026-09-07T00:06:41Z
wiki_modified_at: 2026-09-07T00:06:41Z
downloaded_at: 2026-09-07T23:14:35Z
---

# SafetyBench (PL)

**SafetyBench** — to pierwszy **kompleksowy benchmark** do wszechstronnej oceny **bezpieczeństwa dużych modeli językowych** <sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Został opracowany przez grupę badaczy z Uniwersytetu Tsinghua i zaprezentowany w 2023 roku<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.

Wraz z rozwojem dużych modeli językowych (np. pojawieniem się ChatGPT) i ich masowym wdrożeniem wzrosło zainteresowanie problemami bezpieczeństwa takich systemów<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Badania wykazały, że modele konwersacyjne mogą dopuszczać do wycieków prywatnych informacji użytkowników lub generować toksyczne wypowiedzi<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Tym samym ocena bezpieczeństwa dużych modeli językowych stała się krytycznie ważnym zadaniem dla ich niezawodnego zastosowania w praktyce. Jednak do niedawna brakowało kompleksowych benchmarków (zestawów testów) obejmujących wszystkie główne aspekty bezpieczeństwa modeli; dostępne datasety sprawdzały jedynie wybrane aspekty (np. toksyczność lub uprzedzenia społeczne) i nie dawały pełnego obrazu<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Brak wszechstronnej metody oceny utrudniał zarówno wykrywanie podatności, jak i opracowywanie bezpieczniejszych modeli językowych<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. SafetyBench powstał, aby wypełnić tę lukę<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.

## Opracowanie i opis SafetyBench

SafetyBench stanowi zbiór **11 435 pytań wielokrotnego wyboru** (multiple-choice), obejmujących **7 różnych kategorii** typowych problemów lub zagrożeń związanych z treściami generowanymi przez AI<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Ważną cechą jest **dwujęzyczność**: każde pytanie dostępne jest w języku **angielskim** i **chińskim**, co pozwala oceniać zarówno modele anglojęzyczne, jak i chińskie na jednolitym materiale<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. SafetyBench stał się w istocie pierwszym narzędziem na dużą skalę, umożliwiającym automatyczne i precyzyjne testowanie rozumienia przez model kwestii bezpiecznego zachowania i treści<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Format zadań z jedną poprawną odpowiedzią, analogiczny do znanych benchmarków takich jak MMLU, zapewnia obiektywność i efektywność oceny, zmniejszając zależność od pracochłonnej ręcznej weryfikacji odpowiedzi modelu<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.

Twórcy SafetyBench oparli się na wcześniej zaproponowanej taksonomii typowych scenariuszy związanych z niebezpiecznymi treściami<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. W szczególności kategorie benchmarku zostały wyodrębnione na podstawie 8 scenariuszy opisanych w pracy Sun i in. (2023), jednak jedna z kategorii (tematy politycznie wrażliwe) została wykluczona, aby uniknąć nieporównywalności odpowiedzi w kontekście chińskim i angielskim<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. W ten sposób ostateczny zestaw obejmuje 7 kategorii bezpieczeństwa wspólnych dla obu języków.

## Kategorie bezpieczeństwa w SafetyBench

Każde pytanie testowe w SafetyBench należy do jednej z siedmiu kategorii, obejmujących szeroki zakres potencjalnie niebezpiecznych lub niepożądanych aspektów<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Poniżej przedstawiono te kategorie wraz z krótkim opisem:

- **Treści obraźliwe** (Offensiveness) – groźby, obelgi, wulgaryzmy, przekleństwa, sarkazm i inne przejawy niedopuszczalnego tonu<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Model powinien umieć rozpoznawać takie zachowania i przeciwstawiać się toksycznym lub agresywnym treściom<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.
- **Stronniczość i dyskryminacja** (Unfairness and Bias) – przejawy uprzedzeń społecznych i niesprawiedliwości ze względu na rasę, płeć, religię itp.<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup> Model powinien identyfikować i unikać konstrukcji językowych wyrażających uprzedzenia lub dyskryminację<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.
- **Zdrowie fizyczne** (Physical Health) – sytuacje i wypowiedzi mogące wpłynąć na zdrowie fizyczne człowieka<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Model powinien znać właściwe, bezpieczne działania i porady dotyczące dbania o zdrowie w różnych okolicznościach życiowych<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.
- **Zdrowie psychiczne** (Mental Health) – kwestie związane z dobrostaniem psychologicznym, emocjami i zdrowiem mentalnym<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Model powinien proponować właściwe sposoby dbania o zdrowie psychiczne i zapobiegania negatywnym oddziaływaniom emocjonalnym<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.
- **Działalność nielegalna** (Illegal Activities) – scenariusze zakładające zachowania niezgodne z prawem<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Model powinien odróżniać zachowania legalne od nielegalnych, posiadać podstawową wiedzę o normach prawnych i nie nakłaniać do łamania prawa<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.
- **Etyka i moralność** (Ethics and Morality) – sytuacje związane z nieetycznym lub niemoralnym zachowaniem, nawet jeśli nie podpada ono bezpośrednio pod przepisy prawa<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Model powinien demonstrować wysokie standardy etyczne i potępiać nieetyczne czyny lub wypowiedzi<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.
- **Prywatność i własność** (Privacy and Property) – kwestie dotyczące prywatnych informacji, prawa własności, ryzyk finansowych itp.<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup> Model powinien dobrze rozumieć zasady poufności i praw majątkowych oraz zapobiegać niezamierzonemu ujawnieniu danych osobowych lub wyrządzeniu szkody majątkowej<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.

Każda kategoria reprezentowana jest przez setki lub tysiące pytań, co pozwala wszechstronnie sprawdzić znajomość przez model odpowiednich norm i zasad<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.

## Zbieranie i przygotowanie danych

Aby stworzyć tak obszerny zestaw testowy, autorzy SafetyBench skorzystali z **różnorodnych źródeł danych**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. W badaniu wskazano, że pytania zbierano z trzech głównych źródeł<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>:

- **Istniejące datasety**: Dla części kategorii (w szczególności obraźliwości, uprzedzeń, zdrowia fizycznego, etyki) wykorzystano publicznie dostępne zbiory danych<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Autorzy pobrali oryginalne teksty z tych zbiorów i przekształcili je w format pytań z wariantami odpowiedzi<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Na przykład dla kategorii Offensiveness częściowo wykorzystano korpus COLD (dataset do wykrywania obraźliwości w języku chińskim)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>; dla języka angielskiego wykorzystano dane z konkursu Jigsaw Toxic Comment i in.<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Analogicznie, dla kategorii Unfairness and Bias wykorzystano chińskie zbiory (COLD, CDial-Bias) oraz zasoby anglojęzyczne<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Takie podejście pozwoliło pokryć od razu cztery kategorie dzięki przetworzeniu już otagowanego materiału<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.
- **Pytania egzaminacyjne**: Oprócz datasetów badacze ręcznie wyselekcjonowali odpowiednie zadania z różnych materiałów egzaminacyjnych i kwestionariuszy poświęconych kwestiom bezpieczeństwa i umiejętności życiowych<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. W szczególności wyodrębniono pytania z egzaminów szkolnych z etyki i wiedzy prawnej (np. szkolne testy z podstaw bezpieczeństwa), odpowiadające kategoriom Illegal Activities, Ethics and Morality i innym pokrewnym tematom<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Każde takie pytanie zostało również dostosowane do formatu wielokrotnego wyboru i przypisane do jednej z kategorii<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.
- **Generowanie nowych pytań**: Dla niektórych aspektów (np. prywatności lub zdrowia psychicznego), gdzie w otwartych źródłach brakowało wystarczająco różnorodnych danych, autorzy sięgnęli po generowanie dodatkowych pytań za pomocą samych zaawansowanych modeli językowych (takich jak ChatGPT)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Sformułowano prompty do tworzenia różnorodnych sytuacji z tych tematów, po czym uzyskane warianty zostały starannie **przefiltrowane i zweryfikowane przez ekspertów** przed włączeniem do benchmarku<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Takie kontrolowane podejście z augmentacją pozwoliło wypełnić luki w pokryciu kategorii<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.

Ostatecznie każde pytanie SafetyBench zostało **dwujęzycznie przedstawione** — w języku chińskim i angielskim<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Aby zapewnić równoważność treści, autorzy przetłumaczyli wszystkie zebrane pytania angielskie na chiński i odwrotnie, korzystając z komercyjnego API tłumaczenia maszynowego Baidu<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Wybór tego narzędzia podyktowany był tym, że niektóre zaawansowane duże modele językowe (np. sam ChatGPT) odmawiały przetwarzania lub dokładnego tłumaczenia potencjalnie niebezpiecznych treści, niekiedy łagodząc sformułowania przy tłumaczeniu<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Automatyczne tłumaczenia zostały następnie ręcznie sprawdzone i poprawione w celu wyeliminowania ewentualnych nieścisłości lub niuansów kulturowych<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Ogólnie wszystkie pytania przeszły etap **ręcznej kontroli jakości**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>, co ma gwarantować poprawność sformułowań i zgodność oczekiwanych odpowiedzi w obu językach<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.

Rozkład źródeł w ostatecznym datasecie jest mniej więcej następujący: około połowa pytań pochodzi z otwartych datasetów, znaczna część — z materiałów egzaminacyjnych, a pozostała część została wygenerowana przez modele (po selekcji)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Takie podejście zapewniło zarówno szerokość pokrycia tematów, jak i wystarczającą głębokość (wiele przykładów na każdą kategorię).

## Metodyka eksperymentów i wyniki

Po przygotowaniu zestawu SafetyBench autorzy przeprowadzili szeroko zakrojone testy współczesnych modeli językowych, aby określić poziom ich rozumienia kwestii bezpieczeństwa. Ocena modeli odbywa się **automatycznie**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>: każdemu modelowi zadawane są kolejno wszystkie pytania (w odpowiednim języku) i rejestrowany jest odsetek poprawnych odpowiedzi (tj. procent zgodności wybranego przez model wariantu z odpowiedzią prawidłową)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Taki odsetek służy jako wskaźnik tego, jak dobrze model „rozumie" problematykę bezpieczeństwa i udziela odpowiedzi poprawnych z punktu widzenia bezpieczeństwa<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.

W testach przeprowadzonych przez twórców wzięły udział **25 popularnych dużych modeli językowych** różnego pochodzenia (zarówno modele otwarte, jak i własnościowe usługi API) w obu językach<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Testowanie przeprowadzano w dwóch trybach: **zero-shot** (modele odpowiadają na pytania bez żadnych przykładów) i **few-shot** (modelom wcześniej pokazuje się kilka przykładowych pytań z poprawnymi odpowiedziami, aby nadać kontekst)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Taki protokół pozwala ocenić zarówno podstawowe możliwości modelu, jak i zdolność do poprawy odpowiedzi przy dostępności przykładów.

Główny wniosek z testów — **współczesne modele znacznie różnią się poziomem wiedzy o bezpieczeństwie i żaden z dostępnych dużych modeli językowych nie jest jeszcze doskonały** we wszystkich kategoriach<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Liderem wyników okazał się model **GPT-4** (OpenAI): osiągnął najwyższą średnią dokładność i znacznie wyprzedził wszystkie pozostałe modele w wielu kategoriach<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. W trybie zero-shot GPT-4 przewyższył najbliższego rywala (model GPT-3.5-turbo) o prawie **10 punktów procentowych** pod względem ogólnej dokładności<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Różnica jest szczególnie duża w niektórych obszarach — na przykład w kwestiach bezpieczeństwa fizycznego i dylematów moralno-etycznych GPT-4 odpowiadał poprawnie zauważalnie częściej niż konkurenci<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.

Jednocześnie nawet u GPT-4 ujawniono **słabe punkty**. W kategorii „Stronniczość i dyskryminacja" (Unfairness and Bias) model ten wypadł słabiej w porównaniu z własnymi wynikami w innych sekcjach<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Analiza odpowiedzi wykazała, że GPT-4 niekiedy błędnie oznacza neutralne wypowiedzi o dyskryminacji jako przejaw uprzedzenia lub myli się w specyficznych wyrażeniach i zdarzeniach<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Takie błędy podkreślają, że nawet najbardziej zaawansowany model może niedoszacowywać niuansów kulturowych lub językowych wpływających na ocenę etyczności wypowiedzi<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.

Pozostałe modele znacznie odbiegały od GPT-4<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Średnio większość otwartych dużych modeli językowych (w tym różne wersje LLaMA, Falcon, rodzime chińskie modele itp.) wykazała **istotnie niższą dokładność**, często nie przekraczającą 70-80% poprawnych odpowiedzi<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Wiele z nich szczególnie słabo radzi sobie z poszczególnymi kategoriami: na przykład część modeli uzyskała mniej niż 70% w sekcjach dotyczących uprzedzeń społecznych lub subtelnych kwestii etycznych<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Łącznie żaden model (poza GPT-4) nie przekroczył umownego progu 80% w ogólnym wskaźniku bezpieczeństwa, co świadczy o dużym polu do dalszego doskonalenia bezpiecznego zachowania modeli<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Taka różnica między GPT-4 a modelami open-source wskazuje na efekt szerszego treningu i ukierunkowanego fine-tuningu pod kątem alignment w modelach zamkniętych.

Interesujące jest to, że wydajność niektórych systemów okazała się **zależna od języka**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Modele tworzone w Chinach (np. Baidu Ernie, Alibaba Tongyi i in.) z reguły lepiej odpowiadały na chińskiej wersji testów niż na angielskiej<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Natomiast rodzina modeli GPT od OpenAI wykazała bardziej zrównoważone wyniki<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Może to odzwierciedlać różną ilość i jakość danych treningowych w odpowiednich językach, a także obecność wbudowanych filtrów lub mechanizmów cenzury w niektórych modelach regionalnych.

Po dodaniu przykładów few-shot (kilku demonstracyjnych pytań i odpowiedzi przed testowaniem) zaobserwowano **zróżnicowane efekty**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Niektóre modele zdołały wyraźnie poprawić dokładność dzięki podpowiedziom: na przykład duże modele językowe poprzedniej generacji, takie jak text-davinci-003 (GPT-3) czy chiński InternLM, odnotowały odczuwalny przyrost jakości w trybie five-shot<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Jednak u części modeli dodatkowy kontekst prawie nie poprawił wyniku, a w niektórych przypadkach nawet obniżył dokładność<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. W szczególności dla GPT-3.5 autorzy odnotowali niewielki **„ujemny przyrost" w trybie few-shot**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>, co wiążą ze zjawiskiem **„podatku wyrównania"** (alignment tax)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Niemniej jednak średnio dostarczenie przykładów ustabilizowało odpowiedzi i zmniejszyło odsetek przypadków, gdy model odmawia udzielenia jednoznacznej odpowiedzi<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.

Osobno badacze ocenili wydajność modeli na **przefiltrowanym podzbiorze pytań** dotyczących języka chińskiego<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. API niektórych dużych chińskich modeli automatycznie odrzucają zapytania zawierające pewne „wrażliwe" słowa<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Dlatego utworzono skróconą próbkę 2100 pytań bez słów-wyzwalaczy i na jej podstawie porównano część modeli w trybie five-shot<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Wyniki pokazały, że na tej uproszczonej wersji różnica między GPT-4 a najlepszymi lokalnymi modelami zmniejsza się: chiński model ChatGLM2 uzyskał zaledwie o ~3% mniej niż GPT-4, praktycznie dorównując mu w łącznym wyniku<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Również Ernie Bot od Baidu pewnie wypadł w większości kategorii (z wyjątkiem sekcji dotyczącej stronniczości) i zbliżył się do liderów<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Dane te sugerują, że pod ścisłą kontrolą filtrującą (po wykluczeniu najbardziej niebezpiecznych zapytań) niektóre modele krajowe są w stanie konkurować ze światowymi liderami pod względem bezpiecznego zachowania.

## Znaczenie benchmarku i wnioski twórców

SafetyBench stanowi ważny krok w kierunku systematycznego mierzenia i poprawy bezpieczeństwa dużych modeli językowych<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. W odróżnieniu od scenariuszy bezpośredniej interakcji (gdzie użytkownicy mogą próbować „złamać" model za pomocą instrukcji lub prowokacji), niniejszy benchmark koncentruje się na zdolności AI do **prawidłowego rozumienia i rozróżniania bezpiecznych i niebezpiecznych treści**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Autorzy podkreślają, że takie rozumienie jest niezbędnym fundamentem, aby model w ogóle był w stanie generować bezpieczne odpowiedzi w otwartych dialogach<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Natomiast głębokie przyswojenie norm moralnych, zasad etykiety, cech toksyczności itp. ułatwia dostrojenie modelu tak, aby unikał niebezpiecznych wypowiedzi i decyzji<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Tym samym wysokie wyniki w SafetyBench można traktować jako **wskaźnik gotowości modelu do bezpiecznego wdrożenia**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>, a słabe wyniki w określonych kategoriach sygnalizują obszary ryzyka wymagające dalszej pracy<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>.

Ważne jest, że SafetyBench celowo **nie obejmuje niektórych aspektów związanych z atakami na same instrukcje modelu** (tzw. jailbreak-prompty, manipulowanie rolami itp.)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Autorzy wyjaśniają, że problemy typu instruction attacks mają inną naturę, związaną z konfliktem między wykonywaniem polecenia użytkownika a przestrzeganiem wbudowanych zasad bezpieczeństwa<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Te aspekty są rozwiązywane innymi metodami i wykraczają poza rozumienie modelu<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Dlatego SafetyBench koncentruje się właśnie na merytorycznym poziomie wiedzy modelu o bezpiecznym zachowaniu. Niemniej łączne pokrycie siedmiu kluczowych kategorii w benchmarku już teraz pozwala wykrywać podatności modeli: wiadomo na przykład, że GPT-4 wykazuje stosunkowo słabszy wynik w pytaniach o stronniczość, a niektóre otwarte modele mocno odstają w sekcjach związanych z moralnością lub prawem<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Takie informacje dostarczają twórcom konkretnych wskazówek, nad czym należy pracować podczas dalszego fine-tuningu lub filtrowania odpowiedzi.

Benchmark SafetyBench jest **otwarty dla społeczności**<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-abs-2)</sup>: jego dane i materiały metodyczne zostały udostępnione publicznie<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-abs-2)</sup>, a na specjalnie stworzonym portalu prowadzony jest **online'owy leaderboard** wyników różnych modeli<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-abs-2)</sup>. Badacze zapraszają twórców do testowania swoich nowych modeli na tym zestawie i publikowania wyników, co będzie sprzyjać przejrzystemu porównywaniu systemów i śledzeniu postępów w poprawie bezpieczeństwa AI.

Wreszcie autorzy podkreślają, że celem SafetyBench jest **stymulowanie doskonalenia modeli**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>, a nie jedynie tworzenie kolejnego rankingu<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. Wzywają twórców, by nie ograniczali się do prób „dopasowania" modelu do testu, lecz systematycznie usuwali zidentyfikowane problematyczne obszary<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. W miarę jak nowe wersje modeli będą trenowane na większych ilościach danych z bardziej zaawansowanymi technikami alignment, oczekuje się wzrostu ich wyników również w SafetyBench<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(PL)#cite_note-arxiv-main-v2-1)</sup>. W perspektywie benchmark ten może stać się standardowym narzędziem do weryfikacji zgodności modeli językowych z wymogami bezpieczeństwa, a jego metodologia — podstawą do opracowania jeszcze doskonalszych zestawów testowych w obszarze odpowiedzialnej AI.

## Odnośniki

- Oryginalna artykuł SafetyBench (arXiv)
- Repozytorium SafetyBench na GitHub
- Strona datasetu SafetyBench na Hugging Face
- Artykuł SafetyBench na ACL Anthology

## Literatura

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Przypisy

1.  <span id="cite_note-arxiv-main-v2-1">↑ <sup>[1.00](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-59)</sup> <sup>[1.60](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-60)</sup> <sup>[1.61](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-61)</sup> <sup>[1.62](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-62)</sup> <sup>[1.63](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-63)</sup> <sup>[1.64](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-64)</sup> <sup>[1.65](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-65)</sup> <sup>[1.66](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-66)</sup> <sup>[1.67](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-67)</sup> <sup>[1.68](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-68)</sup> <sup>[1.69](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-69)</sup> <sup>[1.70](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-70)</sup> <sup>[1.71](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-71)</sup> <sup>[1.72](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-72)</sup> <sup>[1.73](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-73)</sup> <sup>[1.74](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-74)</sup> <sup>[1.75](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-75)</sup> <sup>[1.76](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-76)</sup> <sup>[1.77](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-77)</sup> <sup>[1.78](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-78)</sup> <sup>[1.79](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-79)</sup> <sup>[1.80](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-80)</sup> <sup>[1.81](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-81)</sup> <sup>[1.82](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-82)</sup> <sup>[1.83](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-83)</sup> <sup>[1.84](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-84)</sup> <sup>[1.85](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-85)</sup> <sup>[1.86](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-86)</sup> <sup>[1.87](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-87)</sup> <sup>[1.88](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-88)</sup> <sup>[1.89](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-89)</sup> <sup>[1.90](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-90)</sup> <sup>[1.91](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-91)</sup> <sup>[1.92](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-92)</sup> <sup>[1.93](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-v2_1-93)</sup> Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models with Multiple Choice Questions». *arXiv*. <a href="https://ar5iv.labs.arxiv.org/html/2309.07045v2" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv-main-abs-2">↑ <sup>[2.0](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-abs_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-abs_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/SafetyBench_(PL)#cite_ref-arxiv-main-abs_2-2)</sup> Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models». *arXiv*. <a href="https://arxiv.org/abs/2309.07045" class="external autonumber" rel="nofollow">[2]</a></span>
