LLM Kıyaslama Testleri

From Systems analysis Wiki
Jump to navigation Jump to search

Büyük dil modellerinin benchmark'ları — büyük dil modellerinin (LLM) kalitesini ve yeteneklerini ölçmek, karşılaştırmak ve değerlendirmek amacıyla tasarlanmış standartlaştırılmış test kümeleridir[1]. Genellikle her benchmark, doğru yanıtların ya da değerlendirme ölçütlerinin önceden belirlendiği sabit bir görevler kümesinden (örneğin sorular, metinler veya talimatlar) oluşur. Bu yaklaşım, farklı modellerin aynı koşullarda nesnel biçimde karşılaştırılmasını sağlayarak alandaki ilerlemenin izlenmesine ve modellerin güçlü ile zayıf yönlerinin belirlenmesine olanak tanır[2].

Benchmark'ların düzenli kullanımı, LLM'lerin gelişiminde kilit bir rol oynamakta; geliştiricileri modelleri iyileştirmeye teşvik etmekte ve bilim topluluğunda sonuçların şeffaflığını ile karşılaştırılabilirliğini sağlamaktadır. Benchmark'ların evrimi, LLM'lerin gelişimini yansıtmaktadır: basit dil anlama görevlerinden çok adımlı akıl yürütmeyi, sağduyuyu, etiği ve güvenliği sınayan kapsamlı testlere uzanmaktadır[3].

Temel Kategoriler ve Örnekler

LLM benchmark'ları çeşitli becerileri ve uygulama alanlarını kapsamaktadır. Aşağıda temel kategoriler ve her birindeki en bilinen görev kümeleri ele alınmaktadır.

Genel Dil Anlama

Bu kategori, modelin doğal dili anlama ve yorumlama konusundaki temel yeteneklerini değerlendirir.

  • GLUE (General Language Understanding Evaluation, 2019) — duygu tespitinden metinler arası mantıksal tutarlılığın değerlendirilmesine kadar çeşitli görevleri içeren ilk kapsamlı benchmark'lardan biridir. Tüm görevlerdeki sonuçlar tek bir puana toplanmakta, bu da erken dönem modellerin genel etkinliklerinin karşılaştırılmasına olanak sağlamaktadır[4].
  • SuperGLUE (2019) — modellerin üzerinde insan düzeyine yakın performansa hızla ulaşması üzerine geliştirilen GLUE'nun "güçlendirilmiş" halefidir. SuperGLUE, derin bağlam anlama ve çıkarım yapma becerisi gerektiren daha zorlu görevler içermektedir[5].
  • WinoGrande (2019) — Winograd Schema testinin genişletilmiş bir çeşididir. Doğru yorumu seçmek için sağduyu gerektiren, cümle içindeki belirsiz zamirlerin çözümlenmesine yönelik 44 bin görev içermektedir[6].

Çoklu Görev ve Kapsamlı Benchmark'lar

Bu kümeler, modelleri yalnızca dilbilimsel görevlerin ötesinde geniş bir bilgi ve beceri yelpazesinde sınamaktadır.

  • MMLU (Massive Multitask Language Understanding, 2020) — okul derslerinden uzmanlaşmış mesleki bilgilere (hukuk, tıp) kadar 57 konu alanını kapsayan, quiz biçiminde görevlerden oluşan bir derlemedir. MMLU, modelin genel bilgi genişliğini ölçmektedir[7].
  • BIG-bench (Beyond the Imitation Game Benchmark, 2022) — oluşturulduğu dönemde en büyük iş birliğine dayalı benchmark olup 400'den fazla yazar tarafından geliştirilmiştir. Dilbilimden fiziğe kadar çeşitli konularda 200'den fazla görev içererek modelleri kalıp eşleştirmenin ötesinde sınamakta ve alışılmışın dışındaki durumlardaki sınırlarını ortaya koymaktadır[8].

Sağduyu ve Doğruluk

Bu benchmark'lar, modelin günlük yaşam durumları hakkında mantıklı çıkarımlar yapma ve yanlış bilgi yaymaktan kaçınma becerisini değerlendirmektedir.

  • HellaSwag (2019) — bir durumun tanımı için en olası devamı seçme görevi aracılığıyla sağduyuyu test eder. Benchmark'ın ayırt edici özelliği "tuzak" içermesidir: yanlış yanıtlar otomatik olarak üretilmiş ve son derece inandırıcı görünmektedir; bu da modelin bağlamı derinlemesine anlamasını gerektirmektedir[9].
  • TruthfulQA (2021) — modelin yaygın mitleri ve yanılgıları yayma eğilimini ölçmektedir. İnternette yaygın yanıtın yanlış olduğu soruları içermektedir (örneğin "Aşılar otizme yol açar mı?"). Modelin yanlış kalıp yargılara kapılmadan olgusal olarak doğru bir yanıt vermesi beklenmektedir[10].

Matematik Problemleri

  • GSM8K (2021) — ilkokul düzeyinde binlerce sözel matematik problemi içermektedir. Her problem, yanıta ulaşmak için 2–8 aritmetik adımdan oluşan bir dizi gerektirmekte; bu da modelin çok adımlı akıl yürütme becerisini sınamaktadır[11].
  • MATH (2021) — matematik olimpiyatları ve yarışmalarından derlenen problemlerden oluşan daha zorlu bir kümedir. Cebir, geometri ve sayılar teorisi bölümlerini içererek modelin alışılmamış çözüm yöntemlerine hâkim olmasını gerektirmektedir[12].

Kod Üretimi

  • HumanEval (2021) — LLM'lerin kod yazma becerisini değerlendirmeye yönelik standart bir testtir. Modelin verilen bir açıklamaya göre Python'da doğru kod üretmesi gereken 164 programlama görevi içermektedir. Doğruluk, birim testleriyle değerlendirilmektedir[13].
  • SWE-bench (2023) — GitHub'dan gerçek sorunların (issues) açıklamalarını derleyen daha gerçekçi bir benchmark'tır. Modelin sorunu gideren bir yama (kod parçası) üretmesi gerekmektedir. Bu, büyük miktarda başkasına ait kodu anlama ve karmaşık adım adım akıl yürütme gerektirmektedir[14].

Diyalog Modellerinin Değerlendirilmesi

  • Chatbot Arena (2024) — iki anonim modelin kullanıcıyla ikili diyaloğa katıldığı açık bir çevrimiçi platformdur. Diyalog sonrasında kullanıcı hangi yanıtın daha iyi olduğunu oylamaktadır. Binlerce bu tür "düello"dan yola çıkılarak, modellerin canlı iletişimdeki kalitesini yansıtan kullanıcı tercihlerine dayalı bir Elo derecelendirmesi oluşturulmaktadır[15].
  • MT-Bench (2023) — diyalog becerilerini stres testi için otomatik bir benchmark'tır. Çok turlu diyalogları taklit eden 80 soru çifti içermektedir. Modellerin yanıtları, önceden belirlenmiş bir ölçeğe göre daha güçlü başka bir LLM tarafından değerlendirilmektedir ("LLM-as-a-judge", örneğin GPT-4)[16].

Güvenlik ve Güvenilirlik

  • AgentHarm (2024) — LLM ajanlarının tehlikeli talimatları yerine getirme eğilimini değerlendiren bir benchmark'tır. Dolandırıcılıktan siber suçlara kadar kötü niyetli görevleri temsil eden 110 senaryo içermektedir. İyi bir modelin bu tür talepleri reddetmesi beklenmektedir[17].
  • SafetyBench (2023) — modelin kabul edilemez içerik ve zararlı tavsiyeler üretmekten ne ölçüde tutarlı biçimde kaçındığını, kışkırtıcı talepler de dahil olmak üzere sınayan 11 binden fazla sorudan oluşan kapsamlı bir kümedir[18].

Sınırlılıklar ve Güncel Sorunlar

  • Veri kontaminasyonu: Değerlendirmenin güvenilirliğine yönelik en büyük tehdit, test verilerinin eğitim kümelerine sızmasıdır. Model yanıtları ezberleyebilir; bu da sonuçları yapay olarak şişirir[2].
  • Benchmark doygunluğu: Modeller geliştikçe eski benchmark'lardaki (GLUE gibi) performansları tavana ulaşmakta ve test, yeni ve daha güçlü modelleri birbirinden ayırt etmek için yararlı olmaktan çıkmaktadır. Bu durum, sürekli olarak daha zorlu referans ölçütlerinin geliştirilmesini gerektirmektedir[2].
  • Gerçeklikle uçurum: Benchmark'larda elde edilen yüksek sonuçlar, modelin gerçek ve yapılandırılmamış senaryolarda güvenilir biçimde çalışacağını her zaman garanti etmemektedir. Gerçek ortam çoğu zaman herhangi bir sabit görev kümesinden çok daha zengin ve tahmin edilemez olmaktadır[1].

Dış bağlantılar

  • Open LLM Leaderboard — Hugging Face topluluğunun açık model sıralaması
  • Chatbot Arena Leaderboard — insan tercihlerine dayalı sohbet modeli sıralaması

Notlar

  1. 1.0 1.1 «What Are LLM Benchmarks?». IBM. [1]
  2. 2.0 2.1 2.2 «20 LLM evaluation benchmarks and how they work». Evidently AI. [2]
  3. Wang, Alex; Singh, Amanpreet; Michael, Julian; et al. «GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding». arXiv. [4]
  4. Wang, Alex; Pruksachatkun, Yada; Nangia, Nikita; et al. «SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems». arXiv. [5]
  5. Sakaguchi, Keisuke; Le Bras, Ronan; Bhagavatula, Chandra; Choi, Yejin. «WinoGrande: An Adversarial Winograd Schema Challenge at Scale». arXiv. [6]
  6. Hendrycks, Dan; Burns, Collin; Basart, Steven; et al. «Measuring Massive Multitask Language Understanding». arXiv. [7]
  7. Srivastava, Aarohi; et al. «Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models». arXiv. [8]
  8. Zellers, Rowan; Holtzman, Ari; Bisk, Yonatan; et al. «HellaSwag: Can a Machine Really Finish Your Sentence?». arXiv. [9]
  9. Lin, Stephanie; Hilton, Jacob; Evans, Owain. «TruthfulQA: Measuring How Models Mimic Human Falsehoods». arXiv. [10]
  10. Cobbe, Karl; Kosaraju, Vineet; Bavarian, Mohammad; et al. «Training Verifiers to Solve Math Word Problems». arXiv. [11]
  11. Hendrycks, Dan; Burns, Collin; Saund, Saurav; et al. «Measuring Mathematical Problem Solving With the MATH Dataset». arXiv. [12]
  12. Chen, Mark; Tworek, Jerry; Jun, Heewoo; et al. «Evaluating Large Language Models Trained on Code». arXiv. [13]
  13. Jimenez, Carlos E.; et al. «SWE-bench: Can Language Models Resolve Real-World GitHub Issues?». arXiv. [14]
  14. Chiang, Wei-Lin; et al. «Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preferences». lmsys.org. [15]
  15. Zheng, Lianmin; et al. «Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena». arXiv. [16]
  16. Andriushchenko, Maksym; et al. «AgentHarm: A Benchmark for Asessing Agentic AI Harm». arXiv. [17]
  17. Zhang, Zhexin; et al. «SafetyBench: A Comprehensive Benchmark for Evaluating the Safety of Large Language Models». arXiv. [18]