---
title: "SafetyBench (SV)"
source: "https://systems-analysis.info/int/SafetyBench_(SV)"
wiki: "systems-analysis.info/int"
article: "SafetyBench_(SV)"
language: "sv"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Swedish"
revision_id: 6564
wiki_created_at: 2026-09-07T00:06:45Z
wiki_modified_at: 2026-09-07T00:06:45Z
downloaded_at: 2026-09-07T23:14:37Z
---

# SafetyBench (SV)

**SafetyBench** — är det första **omfattande benchmark** för en allsidig bedömning av **säkerheten hos stora språkmodeller** <sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Det utvecklades av en grupp forskare från Tsinghua University och presenterades år 2023<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.

I takt med att stora språkmodeller (t.ex. ChatGPT) utvecklades och implementerades i stor skala ökade uppmärksamheten kring säkerhetsproblem i sådana system<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Forskning har visat att dialogmodeller kan läcka privat användarinformation eller generera toxiska yttranden<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Därmed har säkerhetsutvärdering av stora språkmodeller blivit en kritiskt viktig uppgift för deras tillförlitliga användning i praktiken. Fram till nyligen saknades dock heltäckande benchmark (testsviter) som täcker alla viktiga aspekter av modellsäkerhet; befintliga dataset kontrollerade bara enskilda sidor (t.ex. toxicitet eller sociala fördomar) och gav ingen helhetsbild<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Avsaknaden av en övergripande utvärderingsmetod försvårade både identifieringen av sårbarheter och utvecklingen av säkrare språkmodeller<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. SafetyBench skapades för att fylla detta gap<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.

## Utveckling och beskrivning av SafetyBench

SafetyBench består av en uppsättning med **11 435 flervalsfrågor** (multiple-choice) som täcker **7 olika kategorier** av typiska problem eller hot relaterade till AI-genererat innehåll<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. En viktig egenskap är **tvåspråkigheten**: varje fråga finns tillgänglig på **engelska** och **kinesiska**, vilket gör det möjligt att utvärdera både engelskspråkiga och kinesiska modeller på enhetligt material<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. I praktiken blev SafetyBench det första storskaliga verktyget som gör det möjligt att automatiskt och med hög precision testa en modells förståelse för frågor om säkert beteende och innehåll<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Uppgiftsformatet med ett enda korrekt svar, liknande välkända benchmark som MMLU, säkerställer objektivitet och effektivitet i utvärderingen och minskar beroendet av tidskrävande manuell granskning av modellsvar<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.

Utvecklarna av SafetyBench utgick från en tidigare föreslagen taxonomi över typiska scenarier kopplade till osäkert innehåll<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Kategorier i benchmark valdes utifrån 8 scenarier beskrivna i arbetet av Sun m.fl. (2023), men en av kategorierna (politiskt känsliga ämnen) uteslöts för att undvika ojämförbarhet i svar mellan kinesiska och engelska kontexter<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Det slutliga datasetet inkluderar således 7 säkerhetskategorier som är gemensamma för båda språken.

## Säkerhetskategorier i SafetyBench

Varje testfråga i SafetyBench tillhör en av sju kategorier som täcker ett brett spektrum av potentiellt farliga eller oönskade aspekter<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Nedan presenteras dessa kategorier och deras korta beskrivning:

- **Stötande innehåll** (Offensiveness) – hot, förolämpningar, grovhet, oanständig svordomar, sarkasm och andra uttryck för oacceptabelt tonläge<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Modellen måste kunna känna igen sådana angrepp och motstå toxiskt eller aggressivt innehåll<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.
- **Fördomsfullhet och diskriminering** (Unfairness and Bias) – uttryck för social bias och orättvisa på grundval av ras, kön, religion m.m.<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup> Modellen måste identifiera och undvika språkliga konstruktioner som uttrycker fördomar eller diskriminering<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.
- **Fysisk hälsa** (Physical Health) – situationer och yttranden som kan påverka en persons fysiska hälsa<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Modellen bör känna till korrekta, säkra handlingar och råd för att upprätthålla hälsan i olika livssituationer<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.
- **Psykisk hälsa** (Mental Health) – frågor kopplade till psykologiskt välbefinnande, känslor och mental hälsa<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Modellen bör föreslå korrekta sätt att upprätthålla psykisk hälsa och förebygga negativa emotionella påverkningar<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.
- **Olaglig verksamhet** (Illegal Activities) – scenarier som inbegriper olagliga handlingar<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Modellen måste skilja på lagligt och olagligt beteende, ha grundläggande kunskaper om rättsliga normer och inte uppmuntra till lagbrott<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.
- **Etik och moral** (Ethics and Morality) – situationer kopplade till oetiskt eller omoraliskt beteende, även när det inte direkt omfattas av lag<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Modellen bör uppvisa höga etiska standarder och fördöma oetiska handlingar eller yttranden<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.
- **Integritet och egendom** (Privacy and Property) – frågor som rör privat information, äganderätt, finansiella risker m.m.<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup> Modellen bör ha lyhörd förståelse för principerna om integritet och äganderätt och förebygga oavsiktligt röjande av personuppgifter eller orsakande av egendomsskada<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.

Varje kategori representeras av hundratals eller tusentals frågor, vilket möjliggör en allsidig kontroll av modellens kunskap om relevanta normer och principer<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.

## Insamling och förberedelse av data

För att skapa en sådan storskalig testsvit använde SafetyBenchs upphovsmän **varierade datakällor**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. I studien anges att frågorna samlades in från tre huvudkällor<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>:

- **Befintliga dataset**: För ett antal kategorier (bl.a. stötande innehåll, fördomar, fysisk hälsa, etik) användes publikt tillgängliga dataset<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Författarna tog ursprungliga texter från sådana dataset och omvandlade dem till flervalsfrågor<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Till exempel användes delvis COLD-korpusen (ett dataset för detektering av stötande innehåll på kinesiska) för kategorin Offensiveness<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>; för engelska drogs data från Jigsaw Toxic Comment-tävlingen m.fl.<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. På liknande sätt användes kinesiska dataset (COLD, CDial-Bias) och engelskspråkiga resurser för Unfairness and Bias<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Detta tillvägagångssätt möjliggjorde täckning av fyra kategorier direkt genom bearbetning av redan annoterat material<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.
- **Tentamensfrågor**: Utöver dataset valde forskarna manuellt ut lämpliga uppgifter från olika tentamensmaterial och enkäter tillägnade säkerhets- och livsfärdighetsfrågor<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Specifikt extraherades frågor från utbildningstentamina i etik och juridik (t.ex. skoltest i säkerhetsgrunder) som motsvarar kategorierna Olaglig verksamhet, Etik och moral samt andra besläktade ämnen<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Varje sådan fråga anpassades också till flervalssformatet och hänfördes till en av kategorierna<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.
- **Generering av nya frågor**: För vissa aspekter (t.ex. integritet eller psykisk hälsa) där tillräckligt varierade data saknades i öppna källor tog författarna till sig generering av ytterligare frågor med hjälp av avancerade språkmodeller (såsom ChatGPT)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Promptar formulerades för att skapa varierade situationer kring dessa ämnen, varefter de erhållna alternativen noggrant **filtrerades och granskades av experter** innan de inkluderades i benchmark<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Detta kontrollerade augmented-tillvägagångssätt gjorde det möjligt att fylla luckorna i kategoritäckningen<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.

Slutligen var varje fråga i SafetyBench **tvåspråkigt representerad** — på kinesiska och engelska<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. För att säkerställa innehållsekvivalens översatte författarna alla insamlade engelska frågor till kinesiska och vice versa med hjälp av Baidus kommersiella maskinöversättnings-API<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Användningen av denna översättning motiveras av att vissa avancerade stora språkmodeller (t.ex. ChatGPT) vägrade att behandla eller korrekt översätta potentiellt farligt innehåll, och ibland mjukade upp formuleringar vid översättning<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. De automatiska översättningarna korrekturlästes och korrigerades sedan manuellt för att eliminera möjliga inexaktheter eller kulturella nyanser<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Sammantaget genomgick alla frågor ett steg av **mänsklig kvalitetskontroll**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>, vilket syftar till att garantera korrektheten i formuleringar och de förväntade svaren på båda språken<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.

Fördelningen av källor i det slutliga datasetet är ungefär följande: ungefär hälften av frågorna härrör från öppna dataset, en betydande andel från tentamensmaterial, och den återstående delen genererades av modeller (efter urval)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Detta tillvägagångssätt säkerställde både bred ämnestäckning och tillräckligt djup (många exempel per kategori).

## Experimentmetodik och resultat

Efter förberedelsen av SafetyBench genomförde författarna storskalig testning av moderna språkmodeller för att fastställa deras nivå av förståelse för säkerhetsfrågor. Utvärdering av modeller sker **automatiskt**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>: varje modell ställs inför alla frågor i tur och ordning (på respektive språk), och andelen korrekta svar registreras (d.v.s. procentandelen träff när modellen väljer det korrekta alternativet)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Denna procentandel tjänar som ett mått på hur väl modellen "förstår" säkerhetsproblem och ger korrekta svar ur ett säkerhetsperspektiv<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.

I testerna genomförda av utvecklarna deltog **25 populära stora språkmodeller** av olika ursprung (både öppna modeller och proprietära API-tjänster) på båda språken<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Testningen genomfördes i två lägen: **zero-shot** (modeller svarar på frågor utan några exempel) och **few-shot** (modeller visas i förväg ett fåtal exempelfrågor med rätta svar för att etablera kontext)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Detta protokoll gör det möjligt att utvärdera både modellens basförmågor och dess förmåga att förbättra svar när ledtrådar ges.

Huvudresultatet av testerna är att **moderna modeller varierar kraftigt i säkerhetskunskap, och ingen av de tillgängliga stora språkmodellerna är ännu felfri** i alla kategorier<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Ledaren i resultaten blev modellen **GPT-4** (OpenAI): den uppvisade den högsta genomsnittliga precision och distanserade sig avsevärt från alla övriga modeller i en mängd kategorier<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. I zero-shot-läge översteg GPT-4 sin närmaste konkurrent (modellen GPT-3.5-turbo) med nästan **10 procentenheter** i total precision<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Klyftan är särskilt stor inom enskilda områden, t.ex. svarade GPT-4 märkbart oftare rätt än konkurrenterna på frågor om fysisk säkerhet och moralisk-etiska dilemman<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.

Samtidigt identifierades **svagheter** även hos GPT-4. I kategorin \\Fördomsfullhet och diskriminering\\ (Unfairness and Bias) presterade denna modell sämre relativt sina egna resultat i andra avsnitt<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Analys av svaren visade att GPT-4 ibland felaktigt markerar neutrala yttranden om diskriminering som uttryck för fördomar eller förvirras av specifika uttryck och händelser<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Sådana fel understryker att även den mest avancerade modellen kan underskatta kulturella eller språkliga nyanser som påverkar bedömningen av ett yttrandes etiska lämplighet<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.

Övriga modeller hamnade avsevärt efter GPT-4<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. I genomsnitt uppvisade de flesta öppna stora språkmodeller (inklusive olika versioner av LLaMA, Falcon, inhemska kinesiska modeller m.fl.) **avsevärt lägre precision**, och översteg ofta inte 70–80 % korrekta svar<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Många av dem klarar sig särskilt svagt inom enskilda kategorier: exempelvis fick ett antal modeller under 70 % i avsnitt kopplade till sociala fördomar eller subtila etiska frågor<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Sammantaget översteg ingen modell (förutom GPT-4) den villkorliga tröskeln på 80 % i den totala säkerhetsindikatorn, vilket tyder på ett stort utrymme för ytterligare förbättring av deras säkra beteende<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Denna skillnad mellan GPT-4 och modeller med öppen källkod pekar på effekten av mer storskalig träning och riktad alignment-finjustering hos slutna modeller.

Intressant nog visade sig prestandan hos vissa system vara **språkberoende**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Modeller skapade i Kina (t.ex. Baidu Ernie, Alibaba Tongyi m.fl.) tenderade att svara bättre på den kinesiska versionen av testerna än på den engelska<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Å andra sidan uppvisade GPT-modellsfamiljen från OpenAI mer balanserade resultat<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Detta kan återspegla olika volymer och kvalitet av träning på respektive språkdata, samt förekomsten av inbyggda filter eller censurmekanismer i vissa regionala modeller.

När few-shot-exempel lades till (ett fåtal demonstrations-Q&A innan testning) observerades **riktningsvarierande effekter**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Vissa modeller lyckades märkbart förbättra sin precision tack vare ledtrådar: så fick stora språkmodeller från föregående generation som text-davinci-003 (GPT-3) eller den kinesiska InternLM en påtaglig kvalitetsökning i few-shot-läge<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Men för ett antal modeller förbättrade det extra sammanhanget nästan inte resultatet, och i vissa fall sänkte det till och med precisionen<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Specifikt registrerade författarna en liten **\\negativ förstärkning\\ vid few-shot** för GPT-3.5<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>, vilket de kopplar till fenomenet **\\alignment tax\\**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. I genomsnitt gjorde tillhandahållandet av exempel ändå svaren mer stabila och minskade andelen fall där modellen vägrar att ge ett tydligt svar<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.

Separat utvärderade forskarna modellprestandan på ett **filtrerat deldataset med frågor** relaterade till det kinesiska språket<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Saken är den att API:et för vissa stora kinesiska modeller automatiskt avvisar förfrågningar med vissa \\känsliga\\ ord<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Därför formades ett reducerat urval av 2 100 frågor utan triggerord, och ett antal modeller jämfördes på detta i few-shot-läge<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Resultaten visade att i denna förenklade version minskar klyftan mellan GPT-4 och de bästa lokala modellerna: den kinesiska modellen ChatGLM2 fick bara ~3 % lägre än GPT-4 och närmade sig i princip dess totala poäng<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Ernie Bot från Baidu presterade också säkert i de flesta kategorier (förutom fördomsavsnittet) och närmade sig ledarna<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Dessa data tyder på att under strikt filtreringskontroll (med de mest riskfyllda förfrågningarna uteslutna) kan vissa nationella modeller konkurrera med världsledarna vad gäller säkert beteende.

## Benchmarkens betydelse och utvecklarnas slutsatser

SafetyBench utgör ett viktigt steg mot systematisk mätning och förbättring av säkerheten hos stora språkmodeller<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Till skillnad från scenarier med direktinteraktion (där användare kan försöka \\hacka\\ modellen med instruktioner eller provokationer) fokuserar detta benchmark på AI:s förmåga att **korrekt förstå och skilja på säkert och osäkert innehåll**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Författarna betonar att sådan förståelse är en nödvändig grund för att modellen överhuvudtaget ska kunna generera säkra svar i öppna dialoger<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Tvärtom underlättar djup assimilering av moraliska normer, etikettregler, tecken på toxicitet m.m. finjustering av modellen så att den undviker farliga yttranden och beslut<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Höga poäng på SafetyBench kan således betraktas som en **indikator på modellens beredskap för säker drift**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>, medan misslyckanden i vissa kategorier signalerar riskzoner som kräver åtgärder<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>.

Det är viktigt att notera att SafetyBench avsiktligt **inte inkluderar vissa aspekter kopplade till angrepp på modellens egna instruktioner** (s.k. jailbreak-promptar, rollmanipulation m.m.)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Författarna förklarar att problem av typen instruction attacks har en annan natur, kopplad till konflikten mellan att utföra användarens order och att följa inbyggda säkerhetsregler<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Dessa aspekter hanteras med andra metoder och faller utanför modellförståelsens räckvidd<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Därför är SafetyBench koncentrerat just på den innehållsmässiga kunskapsnivån hos modellen om säkert beteende. Ändå gör den sammantagna täckningen av sju nyckelkategorier i benchmark det redan nu möjligt att identifiera modellsårbarheter: det är till exempel känt att GPT-4 uppvisar ett relativt svagare resultat på frågor om fördomar, och att vissa öppna modeller ligger långt efter i avsnitt kopplade till moral eller lag<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. Sådan information ger utvecklarna konkreta riktmärken för vad man behöver arbeta med vid ytterligare finjustering eller filtrering av svar.

SafetyBench är **öppet för gemenskapen**<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-abs-2)</sup>: dess data och metodmaterial är fritt tillgängliga<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-abs-2)</sup>, och på en specialskapad plattform upprätthålls ett **online-leaderboard** med resultat för olika modeller<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-abs-2)</sup>. Forskare bjuder in utvecklare att testa sina nya modeller på detta dataset och publicera resultaten, vilket bidrar till transparent jämförelse av system och uppföljning av framstegen inom förbättring av AI-säkerhet.

Slutligen betonar författarna att målet med SafetyBench är att **stimulera förbättring av modeller**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>, inte bara att skapa ytterligare ett rankingsystem<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. De uppmanar utvecklare att inte begränsa sig till att \\anpassa\\ modellen till testet, utan att systematiskt åtgärda de identifierade problemområdena<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. I takt med att nya modellversioner tränas på större datamängder med mer avancerade alignment-finjusteringstekniker förväntas deras poäng på SafetyBench också öka<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(SV)#cite_note-arxiv-main-v2-1)</sup>. På sikt kan detta benchmark bli ett standardverktyg för att kontrollera språkmodellers överensstämmelse med säkerhetskrav, och dess metodik kan utgöra grunden för utvecklingen av ännu mer sofistikerade testsviter inom ansvarsfull AI.

## Externa länkar

- Originalartikeln SafetyBench (arXiv)
- SafetyBench-repositoriet på GitHub
- SafetyBench datasetsida på Hugging Face
- SafetyBench-artikel på ACL Anthology

## Litteratur

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Noter

1.  <span id="cite_note-arxiv-main-v2-1">↑ <sup>[1.00](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-59)</sup> <sup>[1.60](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-60)</sup> <sup>[1.61](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-61)</sup> <sup>[1.62](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-62)</sup> <sup>[1.63](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-63)</sup> <sup>[1.64](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-64)</sup> <sup>[1.65](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-65)</sup> <sup>[1.66](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-66)</sup> <sup>[1.67](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-67)</sup> <sup>[1.68](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-68)</sup> <sup>[1.69](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-69)</sup> <sup>[1.70](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-70)</sup> <sup>[1.71](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-71)</sup> <sup>[1.72](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-72)</sup> <sup>[1.73](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-73)</sup> <sup>[1.74](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-74)</sup> <sup>[1.75](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-75)</sup> <sup>[1.76](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-76)</sup> <sup>[1.77](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-77)</sup> <sup>[1.78](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-78)</sup> <sup>[1.79](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-79)</sup> <sup>[1.80](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-80)</sup> <sup>[1.81](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-81)</sup> <sup>[1.82](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-82)</sup> <sup>[1.83](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-83)</sup> <sup>[1.84](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-84)</sup> <sup>[1.85](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-85)</sup> <sup>[1.86](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-86)</sup> <sup>[1.87](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-87)</sup> <sup>[1.88](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-88)</sup> <sup>[1.89](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-89)</sup> <sup>[1.90](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-90)</sup> <sup>[1.91](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-91)</sup> <sup>[1.92](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-92)</sup> <sup>[1.93](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-v2_1-93)</sup> Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models with Multiple Choice Questions». *arXiv*. <a href="https://ar5iv.labs.arxiv.org/html/2309.07045v2" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv-main-abs-2">↑ <sup>[2.0](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-abs_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-abs_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/SafetyBench_(SV)#cite_ref-arxiv-main-abs_2-2)</sup> Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models». *arXiv*. <a href="https://arxiv.org/abs/2309.07045" class="external autonumber" rel="nofollow">[2]</a></span>
