---
title: "Qualitätsmetriken für LLMs"
source: "https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs"
wiki: "systems-analysis.info/int"
article: "Qualitätsmetriken_für_LLMs"
language: "de"
categories:
  - "Category:German"
  - "Category:Large language models"
  - "Category:LLM evaluation"
  - "Category:Machine learning"
revision_id: 6081
wiki_created_at: 2026-09-06T23:58:03Z
wiki_modified_at: 2026-09-06T23:58:03Z
downloaded_at: 2026-09-07T23:11:52Z
---

# Qualitätsmetriken für LLMs

**Qualitätsmetriken für große Sprachmodelle (LLMs)** sind ein systematischer Ansatz und eine Reihe standardisierter Instrumente zur Messung verschiedener Aspekte der Leistung von Sprachmodellen, einschließlich Genauigkeit, Sicherheit, Fairness und Zuverlässigkeit<sup>[\[1\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-perplexity-overview-1)</sup>. Da [LLMs](https://systems-analysis.info/int/Gro%C3%9Fe_Sprachmodelle "Große Sprachmodelle") zunehmend in kritischen Bereichen wie dem Gesundheitswesen, dem Finanzwesen und der Bildung eingesetzt werden, besteht ein dringender Bedarf an ihrer umfassenden und objektiven Bewertung<sup>[\[2\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-perplexity-security-2)</sup>.

Metriken und Benchmarks erfüllen mehrere Schlüsselfunktionen: Sie ermöglichen einen objektiven Vergleich verschiedener Modelle, die Verfolgung von Entwicklungsfortschritten, die Identifizierung von Schwachstellen und die Gewährleistung der Transparenz der Ergebnisse für Forscher und Praktiker<sup>[\[1\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-perplexity-overview-1)</sup>.

## Kategorien von Metriken

Metriken zur Bewertung von LLMs lassen sich in mehrere Hauptkategorien einteilen: automatische Metriken, menschliche Bewertung und spezialisierte Metriken zur Bewertung von Sicherheit und Zuverlässigkeit.

### Automatische Metriken

Diese Metriken ermöglichen eine schnelle und skalierbare Bewertung ohne menschliches Zutun.

#### N-Gramm-basierte Metriken

Traditionelle Metriken, die die lexikalische Übereinstimmung zwischen dem generierten und dem Referenztext messen.

- **BLEU** (Bilingual Evaluation Understudy): Ursprünglich für die Bewertung der Qualität maschineller Übersetzungen entwickelt. Misst die Präzision der Übereinstimmung von N-Grammen (Sequenzen von n Wörtern) und wendet eine Strafe für zu kurze generierte Texte an<sup>[\[3\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-ngram-metrics-3)</sup>.
- **ROUGE** (Recall-Oriented Understudy for Gisting Evaluation): Fokussiert auf den Recall (Vollständigkeit) und misst, wie gut die N-Gramme aus dem Referenztext im generierten Text repräsentiert sind. Besonders effektiv für die Bewertung von Zusammenfassungsaufgaben<sup>[\[3\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-ngram-metrics-3)</sup>.
- **METEOR**: Erweitert die Fähigkeiten von BLEU, indem es Synonyme, Wortstämme und morphologische Varianten berücksichtigt, was eine bessere Korrelation mit menschlichen Bewertungen ermöglicht<sup>[\[3\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-ngram-metrics-3)</sup>.

#### Semantische Metriken

Diese Metriken verwenden kontextuelle Embeddings, um die semantische Nähe anstelle von nur lexikalischer Übereinstimmung zu bewerten.

- **BERTScore**: Berechnet die semantische Ähnlichkeit zwischen den Tokens des generierten und des Referenztextes unter Verwendung von Embeddings aus dem BERT-Modell. Dies ermöglicht die Erkennung semantischer Äquivalenz auch bei unterschiedlichen Formulierungen<sup>[\[4\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-semantic-metrics-4)</sup>.
- **MAUVE**: Misst die Divergenz zwischen den Verteilungen von maschinellem und menschlichem Text im Embedding-Raum. Besonders effektiv für die Bewertung der offenen Textgenerierung, bei der es keinen festen Referenztext gibt<sup>[\[5\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-distribution-metrics-5)</sup>.

#### Interne Metriken der Sprachmodellierung

- **[Perplexität](https://systems-analysis.info/int/Perplexit%C3%A4t "Perplexität")** (Perplexity): Eine fundamentale Metrik, die misst, wie gut ein Sprachmodell eine Textsequenz vorhersagt. Sie spiegelt die Unsicherheit des Modells bei der Vorhersage des nächsten Tokens wider. Niedrigere Perplexitätswerte deuten auf eine bessere Leistung hin<sup>[\[6\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-intrinsic-metrics-6)</sup>.
- **Genauigkeit und F1-Score**: Werden häufig bei Klassifizierungsaufgaben und Frage-Antwort-Systemen eingesetzt. Der F1-Score ist das harmonische Mittel aus Precision und Recall und bietet eine ausgewogene Bewertung<sup>[\[6\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-intrinsic-metrics-6)</sup>.

### Menschliche Bewertung

Die menschliche Bewertung bleibt der „Goldstandard“, da automatische Metriken oft nicht in der Lage sind, subtile Qualitätsaspekte wie Kohärenz, Kreativität und Relevanz zu erfassen<sup>[\[7\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-human-eval-7)</sup>.

- **Direkte Bewertung**: Experten oder Crowdsourcer bewerten die Qualität der generierten Texte auf einer vorgegebenen Skala (z. B. von 1 bis 5) nach Kriterien wie Flüssigkeit und Kohärenz.
- **Vergleichende Bewertung**: Die Bewerter werden gebeten, die Ausgaben von zwei oder mehr Modellen zu vergleichen und die beste auszuwählen (Paarvergleich) oder sie vom besten zum schlechtesten zu ordnen.

Nachteile der menschlichen Bewertung sind die hohen Kosten, die schwierige Skalierbarkeit und die Subjektivität<sup>[\[7\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-human-eval-7)</sup>.

### Bewertung durch LLMs (LLM-as-a-Judge)

Ein neuer Ansatz, bei dem ein (in der Regel leistungsfähigeres) Sprachmodell zur Bewertung der Antworten eines anderen verwendet wird. Beispielsweise kann GPT-4 die Ausgaben von Modellen nach vorgegebenen Kriterien bewerten. Diese Methode bietet eine skalierbare Alternative zur menschlichen Bewertung, hat aber auch ihre eigenen Herausforderungen, wie z. B. die Empfindlichkeit gegenüber dem Stil der Prompts und potenzielle Voreingenommenheit<sup>[\[8\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-llm-as-judge-8)</sup>.

## Spezialisierte Metriken und Benchmarks

Zur Bewertung spezifischer Aspekte der Leistung und Zuverlässigkeit von LLMs werden spezialisierte Metriken und Benchmarks verwendet.

### Faktentreue

Bewertet die Fähigkeit des Modells, wahrheitsgemäße Informationen zu generieren und nicht zu halluzinieren.

- **TruthfulQA**: Ein Benchmark, der speziell entwickelt wurde, um die Neigung von Modellen zu messen, Antworten zu generieren, die auf verbreiteten Mythen und Missverständnissen basieren. Das Modell muss faktisch korrekte und nicht nur populäre Antworten geben<sup>[\[9\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-security-metrics-9)</sup>.

### Sicherheit und Ethik

- **Bewertung der Toxizität**: Misst das Vorhandensein von beleidigenden oder schädlichen Inhalten. Hierfür werden spezialisierte Klassifikatoren und APIs wie die **Perspective API** verwendet<sup>[\[9\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-security-metrics-9)</sup>.
- **Bewertung von Voreingenommenheit und Fairness**: Bewertet, ob ein Modell diskriminierendes Verhalten gegenüber verschiedenen demografischen Gruppen zeigt. Studien zeigen, dass LLMs soziale Stereotypen aus den Trainingsdaten beibehalten und verstärken können<sup>[\[10\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-bias-metrics-10)</sup>.
- **SafetyBench**: Ein umfassender Benchmark zur Sicherheitsbewertung, der die Robustheit gegenüber Adversarial Attacks und die Fähigkeit, die Generierung schädlicher Inhalte zu vermeiden, überprüft<sup>[\[11\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-safety-bench-11)</sup>.

### Umfassende Benchmarks

- **MMLU** (Massive Multitask Language Understanding): Einer der am weitesten verbreiteten Benchmarks, der Multiple-Choice-Fragen zu 57 Themen umfasst, von elementarer Mathematik bis hin zu internationalem Recht. Er bewertet die Breite und Tiefe des Wissens eines Modells<sup>[\[12\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-comprehensive-benchmarks-12)</sup>.
- **BIG-bench** (Beyond the Imitation Game): Enthält über 204 Aufgaben, die entwickelt wurden, um Fähigkeiten zu bewerten, die über die Möglichkeiten herkömmlicher Sprachmodelle hinausgehen, einschließlich Aufgaben vom Schachspielen bis zum Erraten von Emojis<sup>[\[12\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-comprehensive-benchmarks-12)</sup>.

## Herausforderungen und Grenzen

- **Korrelationsproblem**: Traditionelle automatische Metriken wie BLEU und ROUGE korrelieren oft schlecht mit menschlichen Bewertungen, insbesondere bei kreativen Aufgaben<sup>[\[13\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-challenges-correlation-13)</sup>.
- **Datenkontamination (Data Contamination)**: Es besteht das Risiko, dass Testdaten eines Benchmarks in den Trainingsdatensatz des Modells gelangt sind, was zu überhöhten und unzuverlässigen Bewertungen führt<sup>[\[14\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-challenges-contamination-14)</sup>.
- **Mehrsprachige Bewertung**: Die meisten bestehenden Metriken und Benchmarks konzentrieren sich auf die englische Sprache, was ihre Anwendbarkeit zur Bewertung der mehrsprachigen Fähigkeiten von LLMs einschränkt<sup>[\[15\]](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_note-challenges-multilingual-15)</sup>.

## Weblinks

- <a href="https://www.ibm.com/think/topics/llm-benchmarks" class="external text" rel="nofollow">What Are LLM Benchmarks?</a> – ein Übersichtsartikel von IBM
- <a href="https://www.evidentlyai.com/llm-guide/llm-benchmarks" class="external text" rel="nofollow">20 LLM evaluation benchmarks and how they work</a> – ein Leitfaden zu Benchmarks von Evidently AI

## Literatur

- Papineni, K. et al. (2002). *Bleu: a Method for Automatic Evaluation of Machine Translation*. <a href="https://aclanthology.org/P02-1040/" class="external text" rel="nofollow">ACL:P02-1040</a>.
- Lin, C.-Y. (2004). *ROUGE: A Package for Automatic Evaluation of Summaries*. <a href="https://aclanthology.org/W04-1013/" class="external text" rel="nofollow">ACL:W04-1013</a>.
- Banerjee, S.; Lavie, A. (2005). *METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments*. <a href="https://aclanthology.org/W05-0909/" class="external text" rel="nofollow">ACL:W05-0909</a>.
- Zhang, T. et al. (2019). *BERTScore: Evaluating Text Generation with BERT*. <a href="https://arxiv.org/abs/1904.09675" class="external text" rel="nofollow">arXiv:1904.09675</a>.
- Pillutla, K. et al. (2021). *MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers*. <a href="https://arxiv.org/abs/2102.01454" class="external text" rel="nofollow">arXiv:2102.01454</a>.
- Lin, S. et al. (2021). *TruthfulQA: Measuring How Models Mimic Human Falsehoods*. <a href="https://arxiv.org/abs/2109.07958" class="external text" rel="nofollow">arXiv:2109.07958</a>.
- Parrish, A. et al. (2021). *BBQ: A Hand-Built Bias Benchmark for Question Answering*. <a href="https://arxiv.org/abs/2110.08193" class="external text" rel="nofollow">arXiv:2110.08193</a>.
- Dhamala, J. et al. (2021). *BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation*. <a href="https://arxiv.org/abs/2101.11718" class="external text" rel="nofollow">arXiv:2101.11718</a>.
- Hendrycks, D. et al. (2020). *Measuring Massive Multitask Language Understanding*. <a href="https://arxiv.org/abs/2009.03300" class="external text" rel="nofollow">arXiv:2009.03300</a>.
- Srivastava, A. et al. (2022). *Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models*. <a href="https://arxiv.org/abs/2206.04615" class="external text" rel="nofollow">arXiv:2206.04615</a>.
- Zhang, Z. et al. (2023). *SafetyBench: Evaluating the Safety of Large Language Models*. <a href="https://arxiv.org/abs/2309.07045" class="external text" rel="nofollow">arXiv:2309.07045</a>.
- Huang, H. et al. (2024). *An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-Tuned Judge Model is not a General Substitute for GPT-4*. <a href="https://arxiv.org/abs/2403.02839" class="external text" rel="nofollow">arXiv:2403.02839</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Gu, J. et al. (2024). *A Survey on LLM-as-a-Judge*. <a href="https://arxiv.org/abs/2411.15594" class="external text" rel="nofollow">arXiv:2411.15594</a>.
- Li, S. et al. (2025). *LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge*. <a href="https://arxiv.org/abs/2506.09443" class="external text" rel="nofollow">arXiv:2506.09443</a>.

## Einzelnachweise

1.  <span id="cite_note-perplexity-overview-1">↑ <sup>[1.0](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-perplexity-overview_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-perplexity-overview_1-1)</sup> „Qualitätsmetriken für LLMs“. *Perplexity AI*.</span>
2.  <span id="cite_note-perplexity-security-2">[↑](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-perplexity-security_2-0) „Spezialisierte Sicherheitsmetriken“. *Perplexity AI*.</span>
3.  <span id="cite_note-ngram-metrics-3">↑ <sup>[3.0](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-ngram-metrics_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-ngram-metrics_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-ngram-metrics_3-2)</sup> „Traditionelle Metriken zur Textbewertung“. *Perplexity AI*.</span>
4.  <span id="cite_note-semantic-metrics-4">[↑](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-semantic-metrics_4-0) „Semantische Metriken“. *Perplexity AI*.</span>
5.  <span id="cite_note-distribution-metrics-5">[↑](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-distribution-metrics_5-0) „Verteilungsbasierte Metriken“. *Perplexity AI*.</span>
6.  <span id="cite_note-intrinsic-metrics-6">↑ <sup>[6.0](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-intrinsic-metrics_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-intrinsic-metrics_6-1)</sup> „Intrinsische Metriken“. *Perplexity AI*.</span>
7.  <span id="cite_note-human-eval-7">↑ <sup>[7.0](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-human-eval_7-0)</sup> <sup>[7.1](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-human-eval_7-1)</sup> „Menschliche Bewertung“. *Perplexity AI*.</span>
8.  <span id="cite_note-llm-as-judge-8">[↑](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-llm-as-judge_8-0) „LLM-as-a-Judge“. *Perplexity AI*.</span>
9.  <span id="cite_note-security-metrics-9">↑ <sup>[9.0](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-security-metrics_9-0)</sup> <sup>[9.1](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-security-metrics_9-1)</sup> „Spezialisierte Sicherheitsmetriken“. *Perplexity AI*.</span>
10. <span id="cite_note-bias-metrics-10">[↑](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-bias-metrics_10-0) „Voreingenommenheit und Fairness“. *Perplexity AI*.</span>
11. <span id="cite_note-safety-bench-11">[↑](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-safety-bench_11-0) „Sicherheits-Benchmarks“. *Perplexity AI*.</span>
12. <span id="cite_note-comprehensive-benchmarks-12">↑ <sup>[12.0](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-comprehensive-benchmarks_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-comprehensive-benchmarks_12-1)</sup> „Umfassende Bewertung“. *Perplexity AI*.</span>
13. <span id="cite_note-challenges-correlation-13">[↑](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-challenges-correlation_13-0) „Korrelationsprobleme“. *Perplexity AI*.</span>
14. <span id="cite_note-challenges-contamination-14">[↑](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-challenges-contamination_14-0) „Datenkontamination“. *Perplexity AI*.</span>
15. <span id="cite_note-challenges-multilingual-15">[↑](https://systems-analysis.info/int/Qualit%C3%A4tsmetriken_f%C3%BCr_LLMs#cite_ref-challenges-multilingual_15-0) „Mehrsprachige Bewertung“. *Perplexity AI*.</span>
