Metrik Kualitas LLM
Metrik kualitas model bahasa besar (LLM) — adalah pendekatan sistematis dan seperangkat alat terstandarisasi untuk mengukur berbagai aspek kinerja model bahasa, termasuk akurasi, keamanan, keadilan, dan keandalan[1]. Seiring dengan semakin luasnya penerapan LLM di bidang-bidang kritis seperti kesehatan, keuangan, dan pendidikan, muncul kebutuhan mendesak akan evaluasi yang komprehensif dan objektif terhadap model-model tersebut[2].
Metrik dan benchmark melayani beberapa fungsi utama: memungkinkan perbandingan objektif antar model yang berbeda, memantau kemajuan pengembangannya, mengidentifikasi kelemahan, serta memastikan transparansi hasil bagi para peneliti dan praktisi[1].
Kategori Metrik
Metrik untuk mengevaluasi LLM dapat dibagi menjadi beberapa kategori utama: metrik otomatis, evaluasi dengan partisipasi manusia, dan metrik khusus untuk menilai keamanan serta keandalan.
Metrik Otomatis
Metrik ini memungkinkan evaluasi yang cepat dan skalabel tanpa keterlibatan manusia.
Metrik Berbasis N-gram
Metrik tradisional yang mengukur kesesuaian leksikal antara teks yang dihasilkan dan teks referensi.
- BLEU (Bilingual Evaluation Understudy): Awalnya dikembangkan untuk menilai kualitas penerjemahan mesin. Mengukur presisi kesesuaian n-gram (urutan n kata) dan menerapkan penalti untuk teks yang dihasilkan terlalu pendek[3].
- ROUGE (Recall-Oriented Understudy for Gisting Evaluation): Berfokus pada kelengkapan, mengukur seberapa baik n-gram dari teks referensi terwakili dalam teks yang dihasilkan. Sangat efektif untuk mengevaluasi tugas sumarisasi[3].
- METEOR: Memperluas kemampuan BLEU dengan mempertimbangkan sinonim, kata berakar sama, dan variasi morfologis, yang memungkinkan korelasi lebih baik dengan penilaian manusia[3].
Metrik Semantik
Metrik ini menggunakan embedding kontekstual untuk menilai kedekatan semantik, bukan sekadar kesesuaian leksikal.
- BERTScore: Menghitung kesamaan semantik antara token teks yang dihasilkan dan teks referensi menggunakan embedding dari model BERT. Hal ini memungkinkan pengenalan kesetaraan semantik bahkan dengan formulasi yang berbeda[4].
- MAUVE: Mengukur divergensi antara distribusi teks mesin dan teks manusia dalam ruang embedding. Sangat efektif untuk mengevaluasi generasi terbuka, di mana tidak ada teks referensi yang tetap[5].
Metrik Internal Pemodelan Bahasa
- Perplexity (Perpleksitas): Metrik fundamental yang mengukur seberapa baik model bahasa memprediksi urutan teks. Metrik ini mencerminkan ketidakpastian model dalam memprediksi token berikutnya. Nilai perplexity yang lebih rendah menunjukkan kinerja yang lebih baik[6].
- Akurasi dan F1-score: Banyak digunakan dalam tugas klasifikasi dan sistem tanya jawab. F1-score merupakan rata-rata harmonik antara presisi dan recall, memberikan evaluasi yang seimbang[6].
Evaluasi dengan Partisipasi Manusia
Evaluasi manusia tetap menjadi "standar emas", karena metrik otomatis sering kali tidak mampu menangkap aspek-aspek halus dari kualitas, seperti koherensi, kreativitas, dan relevansi[7].
- Penilaian langsung: Para ahli atau crowdsourcer menilai kualitas generasi berdasarkan skala tertentu (misalnya, dari 1 hingga 5) menurut kriteria seperti kelancaran dan koherensi.
- Penilaian komparatif: Para penilai diminta membandingkan keluaran dari dua model atau lebih dan memilih yang terbaik (perbandingan berpasangan) atau mengurutkannya dari yang terbaik hingga yang terburuk.
Kelemahan evaluasi manusia adalah biaya yang tinggi, sulitnya penskalaan, dan subjektivitas[7].
Evaluasi dengan LLM (LLM-as-a-Judge)
Pendekatan baru di mana satu model bahasa (biasanya yang lebih kuat) digunakan untuk mengevaluasi jawaban model lain. Misalnya, GPT-4 dapat meranking keluaran model berdasarkan kriteria yang ditentukan. Metode ini menyediakan alternatif yang skalabel dibandingkan evaluasi manusia, meskipun memiliki tantangan tersendiri, seperti sensitivitas terhadap gaya prompt dan potensi bias[8].
Metrik dan Benchmark Khusus
Untuk mengevaluasi aspek-aspek tertentu dari kinerja dan keandalan LLM, digunakan metrik dan benchmark khusus.
Keandalan Faktual
Menilai kemampuan model untuk menghasilkan informasi yang benar dan menghindari halusinasi.
- TruthfulQA: Benchmark yang dirancang khusus untuk mengukur kecenderungan model menghasilkan jawaban berdasarkan mitos dan kesalahpahaman yang umum. Model dituntut untuk memberikan jawaban yang faktual, bukan sekadar jawaban yang populer[9].
Keamanan dan Etika
- Evaluasi toksisitas: Mengukur keberadaan konten yang menyinggung atau berbahaya. Untuk tujuan ini digunakan classifier khusus dan API, misalnya, Perspective API[9].
- Evaluasi bias dan keadilan: Menilai apakah model menunjukkan perilaku diskriminatif terhadap berbagai kelompok demografis. Penelitian menunjukkan bahwa LLM dapat mempertahankan dan memperkuat stereotip sosial dari data pelatihan[10].
- SafetyBench: Benchmark keamanan komprehensif yang mencakup pengujian ketahanan terhadap serangan adversarial dan kemampuan menghindari pembuatan konten berbahaya[11].
Benchmark Komprehensif
- MMLU (Massive Multitask Language Understanding): Salah satu benchmark yang paling banyak digunakan, mencakup pertanyaan pilihan ganda dalam 57 mata pelajaran, mulai dari matematika dasar hingga hukum internasional. Benchmark ini menilai keluasan dan kedalaman pengetahuan model[12].
- BIG-bench (Beyond the Imitation Game): Berisi lebih dari 204 tugas yang dirancang untuk mengevaluasi kemampuan yang melampaui batas model bahasa standar, termasuk tugas-tugas mulai dari bermain catur hingga menebak emoji[12].
Tantangan dan Keterbatasan
- Masalah korelasi: Metrik otomatis tradisional seperti BLEU dan ROUGE sering kali berkorelasi buruk dengan penilaian manusia, terutama pada tugas-tugas kreatif[13].
- Kontaminasi data (Data Contamination): Terdapat risiko bahwa data uji benchmark mungkin telah masuk ke dalam set pelatihan model, yang mengakibatkan penilaian yang terlalu tinggi dan tidak dapat diandalkan[14].
- Evaluasi multibahasa: Sebagian besar metrik dan benchmark yang ada berfokus pada bahasa Inggris, yang membatasi penerapannya untuk mengevaluasi kemampuan multibahasa LLM[15].
Tautan
- What Are LLM Benchmarks? — artikel tinjauan dari IBM
- 20 LLM evaluation benchmarks and how they work — panduan benchmark dari Evidently AI
Daftar Pustaka
- Papineni, K. et al. (2002). Bleu: a Method for Automatic Evaluation of Machine Translation. ACL:P02-1040.
- Lin, C.-Y. (2004). ROUGE: A Package for Automatic Evaluation of Summaries. ACL:W04-1013.
- Banerjee, S.; Lavie, A. (2005). METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments. ACL:W05-0909.
- Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
- Pillutla, K. et al. (2021). MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. arXiv:2102.01454.
- Lin, S. et al. (2021). TruthfulQA: Measuring How Models Mimic Human Falsehoods. arXiv:2109.07958.
- Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
- Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
- Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
- Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
- Zhang, Z. et al. (2023). SafetyBench: Evaluating the Safety of Large Language Models. arXiv:2309.07045.
- Huang, H. et al. (2024). An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-Tuned Judge Model is not a General Substitute for GPT-4. arXiv:2403.02839.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Gu, J. et al. (2024). A Survey on LLM-as-a-Judge. arXiv:2411.15594.
- Li, S. et al. (2025). LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge. arXiv:2506.09443.
Catatan
- ↑ 1.0 1.1 «Метрики качества LLM». Perplexity AI.
- ↑ «Специализированные метрики безопасности». Perplexity AI.
- ↑ 3.0 3.1 3.2 «Традиционные метрики оценки текста». Perplexity AI.
- ↑ «Семантические метрики». Perplexity AI.
- ↑ «Метрики на основе распределений». Perplexity AI.
- ↑ 6.0 6.1 «Intrinsic метрики». Perplexity AI.
- ↑ 7.0 7.1 «Оценка с участием человека». Perplexity AI.
- ↑ «LLM-as-a-Judge». Perplexity AI.
- ↑ 9.0 9.1 «Специализированные метрики безопасности». Perplexity AI.
- ↑ «Предвзятость и справедливость». Perplexity AI.
- ↑ «Benchmark'ы безопасности». Perplexity AI.
- ↑ 12.0 12.1 «Comprehensive оценка». Perplexity AI.
- ↑ «Проблемы корреляции». Perplexity AI.
- ↑ «Загрязнение данных». Perplexity AI.
- ↑ «Многоязычная оценка». Perplexity AI.