LLM quality metrics (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

Mga sukatan ng kalidad ng malalaking language model (LLM) — ito ay isang sistematikong pamamaraan at isang hanay ng mga standardisadong kasangkapan para sa pagsukat ng iba't ibang aspeto ng pagganap ng mga language model, kabilang ang katumpakan, kaligtasan, katarungan, at pagiging maaasahan[1]. Habang ang mga LLM ay nagiging lalong malawak na ginagamit sa mga kritikal na larangan tulad ng pangangalagang pangkalusugan, pananalapi, at edukasyon, lumilitaw ang matinding pangangailangan para sa kanilang komprehensibo at obhetibong pagsusuri[2].

Ang mga sukatan at benchmark ay nagsisilbi sa ilang mahahalagang tungkulin: nagbibigay-daan ang mga ito sa obhetibong paghahambing ng iba't ibang modelo, pagsubaybay sa pag-unlad ng kanilang pagpapaunlad, pagtukoy ng mga kahinaan, at pagtitiyak ng transparency ng mga resulta para sa mga mananaliksik at practitioner[1].

Mga Kategorya ng Sukatan

Ang mga sukatan para sa pagsusuri ng LLM ay maaaring hatiin sa ilang pangunahing kategorya: mga awtomatikong sukatan, pagsusuri na may kalahok na tao, at mga espesyalisadong sukatan para sa pagsusuri ng kaligtasan at pagiging maaasahan.

Mga Awtomatikong Sukatan

Ang mga sukatang ito ay nagbibigay-daan sa mabilis at nasusukat na pagsusuri nang walang pakikilahok ng tao.

Mga Sukatan Batay sa n-gram

Mga tradisyonal na sukatan na sumusukat ng leksikal na pagkakatugma sa pagitan ng nabuong teksto at ng sangguniang teksto.

  • BLEU (Bilingual Evaluation Understudy): Orihinal na binuo para sa pagsusuri ng kalidad ng machine translation. Sinusukat ang katumpakan ng pagkakatugma ng n-gram (mga sunud-sunod na n na salita) at naglalapat ng parusa para sa labis na maikling nabuong mga teksto[3].
  • ROUGE (Recall-Oriented Understudy for Gisting Evaluation): Nakatutok sa pagkakumpleto, sinusukat kung gaano kahusay na kinakatawan ang mga n-gram mula sa sangguniang teksto sa nabuong teksto. Partikular na epektibo para sa pagsusuri ng mga gawaing summarization[3].
  • METEOR: Pininalawak ang mga kakayahan ng BLEU sa pamamagitan ng pagsasaalang-alang ng mga kasingkahulugan, mga salitang magkaparehong ugat, at mga morphological na variant, na nagbibigay-daan sa mas mahusay na ugnayan sa mga pagtatasa ng tao[3].

Mga Semantic na Sukatan

Ginamit ng mga sukatang ito ang mga contextual embedding para sa pagsusuri ng semantic na pagkakatulad, hindi lamang leksikal na pagkakatugma.

  • BERTScore: Kinakalkula ang semantic na pagkakatulad sa pagitan ng mga token ng nabuong teksto at ng sangguniang teksto, gamit ang mga embedding mula sa modelo ng BERT. Nagbibigay-daan ito sa pagkilala ng semantic na katumbas kahit sa iba't ibang paraan ng pagpapahayag[4].
  • MAUVE: Sinusukat ang pagkakaiba sa pagitan ng mga distribusyon ng makina at ng teksto ng tao sa espasyo ng embedding. Partikular na epektibo para sa pagsusuri ng bukas na generation, kung saan walang nakapirming sangguniang teksto[5].

Mga Panloob na Sukatan ng Language Modeling

  • Perplexity (Perplexity): Isang pundamental na sukatan na sumusukat kung gaano kahusay na hinuhulaan ng isang language model ang isang sunud-sunod na teksto. Sumasalamin ito sa kawalan ng katiyakan ng modelo sa paghula ng susunod na token. Ang mas mababang halaga ng perplexity ay nagpapahiwatig ng mas mahusay na pagganap[6].
  • Katumpakan at F1-measure: Malawakang ginagamit sa mga gawaing classification at question-answering system. Ang F1-measure ay kumakatawan sa harmonic mean ng katumpakan at pagkakumpleto, na nagbibigay ng balanseng pagsusuri[6].

Pagsusuri na may Kalahok na Tao

Ang pagsusuri ng tao ay nananatiling "pamantayang ginto", dahil ang mga awtomatikong sukatan ay madalas na hindi kayang makuha ang mga pinong aspeto ng kalidad, tulad ng koherensya, pagkamalikhain, at kaugnayan[7].

  • Direktang pagsusuri: Ang mga eksperto o crowdsourcer ay sinusuri ang kalidad ng generation ayon sa isang ibinigay na sukat (halimbawa, mula 1 hanggang 5) batay sa mga pamantayan tulad ng pagkabihasa at koherensya.
  • Paghahambing na pagsusuri: Ang mga tagapagsuri ay inaalok na ihambing ang mga output ng dalawa o higit pang modelo at piliin ang pinakamahusay (pairwise comparison) o i-rank ang mga ito mula pinakamahusay hanggang pinakamasamâ.

Ang mga kakulangan ng pagsusuri ng tao ay kinabibilangan ng mataas na gastos, kahirapan ng pag-scale, at subjectivity[7].

Pagsusuri gamit ang LLM (LLM-as-a-Judge)

Isang bagong pamamaraan kung saan ang isang (karaniwang mas makapangyarihang) language model ay ginagamit para suriin ang mga sagot ng isa pa. Halimbawa, ang GPT-4 ay maaaring mag-rank ng mga output ng modelo batay sa mga ibinigay na pamantayan. Ang pamamaraang ito ay nagbibigay ng nasusukat na alternatibo sa pagsusuri ng tao, bagaman mayroon ding sariling mga hamon, tulad ng sensitivity sa estilo ng mga prompt at potensyal na bias[8].

Mga Espesyalisadong Sukatan at Benchmark

Para sa pagsusuri ng mga tiyak na aspeto ng pagganap at pagiging maaasahan ng LLM, ginagamit ang mga espesyalisadong sukatan at benchmark.

Katotohanan at Pagiging Maaasahan

Sinusuri ang kakayahan ng modelo na makabuo ng totoong impormasyon at umiwas sa mga hallucination.

  • TruthfulQA: Isang benchmark na espesyal na binuo para sukatin ang tendensya ng mga modelo na makabuo ng mga sagot batay sa mga karaniwang mito at maling kaalaman. Kailangan ng modelo na magbigay ng mga factually na tamang sagot, hindi lamang mga sikat na sagot[9].

Kaligtasan at Etika

  • Pagsusuri ng toxicity: Sinusukat ang presensya ng nakakasakit o mapanganib na nilalaman. Para dito, ginagamit ang mga espesyalisadong classifier at API, halimbawa, ang Perspective API[9].
  • Pagsusuri ng bias at katarungan: Sinusuri kung nagpapakita ba ang modelo ng diskriminatoryong pag-uugali patungkol sa iba't ibang grupo ng populasyon. Ipinapakita ng mga pananaliksik na maaaring mapanatili at mapalakas ng LLM ang mga panlipunang stereotipo mula sa datos ng pagsasanay[10].
  • SafetyBench: Isang komprehensibong benchmark para sa pagsusuri ng kaligtasan, na kinabibilangan ng pagsubok ng katatagan laban sa mga adversarial na pag-atake at kakayahang umiwas sa pagbuo ng mapanganib na nilalaman[11].

Mga Komprehensibong Benchmark

  • MMLU (Massive Multitask Language Understanding): Isa sa pinaka-malawakang ginagamit na benchmark, na kinabibilangan ng mga tanong na may maraming pagpipilian sa 57 paksa, mula sa elementaryang matematika hanggang sa internasyonal na batas. Sinusuri nito ang lawak at lalim ng kaalaman ng modelo[12].
  • BIG-bench (Beyond the Imitation Game): Naglalaman ng higit sa 204 na gawain na binuo para suriin ang mga kakayahang lumalagpas sa mga hangganan ng mga karaniwang language model, kabilang ang mga gawain mula sa paglalaro ng chess hanggang sa paghula ng emoji[12].

Mga Hamon at Limitasyon

  • Problema sa ugnayan: Ang mga tradisyonal na awtomatikong sukatan tulad ng BLEU at ROUGE ay madalas na may mahinang ugnayan sa mga pagtatasa ng tao, lalo na sa mga malikhaing gawain[13].
  • Polusyon ng datos (Data Contamination): May panganib na ang mga test data ng benchmark ay maaaring napasama sa training set ng modelo, na nagdudulot ng mga pinalaki at hindi mapagkakatiwalaang pagsusuri[14].
  • Multilingual na pagsusuri: Ang karamihan sa mga umiiral na sukatan at benchmark ay nakatuon sa wikang Ingles, na naglilimita sa kanilang pagiging angkop para sa pagsusuri ng multilingual na kakayahan ng LLM[15].

Mga Sanggunian

  • What Are LLM Benchmarks? — pangkalahatang artikulo mula sa IBM
  • 20 LLM evaluation benchmarks and how they work — gabay sa mga benchmark mula sa Evidently AI

Panitikan

  • Papineni, K. et al. (2002). Bleu: a Method for Automatic Evaluation of Machine Translation. ACL:P02-1040.
  • Lin, C.-Y. (2004). ROUGE: A Package for Automatic Evaluation of Summaries. ACL:W04-1013.
  • Banerjee, S.; Lavie, A. (2005). METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments. ACL:W05-0909.
  • Zhang, T. et al. (2019). BERTScore: Evaluating Text Generation with BERT. arXiv:1904.09675.
  • Pillutla, K. et al. (2021). MAUVE: Measuring the Gap Between Neural Text and Human Text using Divergence Frontiers. arXiv:2102.01454.
  • Lin, S. et al. (2021). TruthfulQA: Measuring How Models Mimic Human Falsehoods. arXiv:2109.07958.
  • Parrish, A. et al. (2021). BBQ: A Hand-Built Bias Benchmark for Question Answering. arXiv:2110.08193.
  • Dhamala, J. et al. (2021). BOLD: Dataset and Metrics for Measuring Biases in Open-Ended Language Generation. arXiv:2101.11718.
  • Hendrycks, D. et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
  • Srivastava, A. et al. (2022). Beyond the Imitation Game: Quantifying and Extrapolating the Capabilities of Language Models. arXiv:2206.04615.
  • Zhang, Z. et al. (2023). SafetyBench: Evaluating the Safety of Large Language Models. arXiv:2309.07045.
  • Huang, H. et al. (2024). An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-Tuned Judge Model is not a General Substitute for GPT-4. arXiv:2403.02839.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Gu, J. et al. (2024). A Survey on LLM-as-a-Judge. arXiv:2411.15594.
  • Li, S. et al. (2025). LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge. arXiv:2506.09443.

Mga Tala

  1. 1.0 1.1 «Метрики качества LLM». Perplexity AI.
  2. «Специализированные метрики безопасности». Perplexity AI.
  3. 3.0 3.1 3.2 «Традиционные метрики оценки текста». Perplexity AI.
  4. «Семантические метрики». Perplexity AI.
  5. «Метрики на основе распределений». Perplexity AI.
  6. 6.0 6.1 «Intrinsic метрики». Perplexity AI.
  7. 7.0 7.1 «Оценка с участием человека». Perplexity AI.
  8. «LLM-as-a-Judge». Perplexity AI.
  9. 9.0 9.1 «Специализированные метрики безопасности». Perplexity AI.
  10. «Предвзятость и справедливость». Perplexity AI.
  11. «Benchmark'ы безопасности». Perplexity AI.
  12. 12.0 12.1 «Comprehensive оценка». Perplexity AI.
  13. «Проблемы корреляции». Perplexity AI.
  14. «Загрязнение данных». Perplexity AI.
  15. «Многоязычная оценка». Perplexity AI.