Humanity's Last Exam (benchmark) (TR)
Humanity's Last Exam (HLE, Türkçe: "İnsanlığın Son Sınavı") — en iyi insan uzmanlarıyla kıyaslanabilir düzeyde bilgi ve akıl yürütme becerisi gerektiren görevlerde gelişmiş yapay zeka (YZ) sistemlerinin yeteneklerini değerlendirmek amacıyla tasarlanmış kapsamlı bir test benchmark'ıdır. Benchmark, 2024–2025 yılları arasında kar amacı gütmeyen kuruluş Center for AI Safety (CAIS) tarafından Scale AI şirketiyle iş birliği içinde geliştirilmiştir[1].
HLE projesi, YZ modelleri için bir "son akademik sınav" olarak tasarlanmıştır; bu son derece zorlu sınav, günümüz modellerinin uzman düzeyine yaklaşıp yaklaşmadığını ve yeteneklerindeki boşluğun nerede kaldığını belirlemeyi amaçlamaktadır[1]. Benchmark, yüzden fazla farklı disiplini kapsayan 2500 son derece güç sorudan oluşmaktadır[2].
Tarihçe
2020'li yılların ortasına gelindiğinde GPT-4 ve Claude gibi büyük dil modelleri, MMLU gibi popüler test setlerinde o denli yüksek sonuçlar sergiledi ki pek çok benchmark artık ilerlemenin güvenilir bir ölçütü olmaktan çıktı. Lisans düzeyindeki standart sınavlar modeller tarafından fiilen "ezildi" ve bu durum sonraki iyileştirmelerin nesnel biçimde değerlendirilmesini olanaksız kıldı[3].
Bu ortamda CAIS direktörü ve tanınmış YZ araştırmacısı Dan Hendrycks, "İnsanlığın Son Sınavı" kavramını önerdi: YZ yeteneklerini gerçek bir uzman düzeyinden ayırt edebilecek, azami güçlükte sorulardan oluşan bir set. Bu fikrin ortaya çıkmasında, mevcut testlerin çok kolaylaştığını dile getiren girişimci Elon Musk ile yapılan bir konuşma belirleyici oldu[2].
Fikri hayata geçirmek için CAIS, Scale AI ile güçlerini birleştirdi. 15 Eylül 2024'te gelecekteki sınav için en zor soruların küresel ölçekte toplanması resmen duyuruldu. Organizatörler, dünyanın dört bir yanındaki bilim insanlarını ve uzmanları, en gelişmiş YZ modellerini bile çıkmaza sokabilecek sorular göndermeye davet etti. Katılımcıları teşvik etmek amacıyla 500.000 dolarlık bir ödül fonu oluşturuldu[3].
Soruların seçimi birkaç aşamada gerçekleşti. İlk olarak gönderilen sorular gelişmiş YZ modelleri aracılığıyla bir filtreden geçirildi; algoritmalar bir soruyu güvenle çözebiliyorsa, o soru yetersiz derecede zor sayılarak eleniyordu. YZ'nin başaramadığı sorular ise doğruluklarını ve tek bir kesin yanıt içerip içermediklerini değerlendirmek üzere uzman incelemesine tabi tutuldu. Sonuç olarak, set oluşturma sürecine 500'den fazla akademik ve eğitim kurumundan yaklaşık 1000 uzman katıldı[4].
2500 sorudan oluşan benchmark'ın nihai versiyonu 2025 yılının başında tanıtıldı. Soruların bir kısmı, modellerin sabit bir sete göre ayarlanmasını önlemek ve kontrol testleri yapılabilmesi amacıyla kapalı bir rezervde tutulmaktadır[2].
Benchmark'ın Yapısı ve İçeriği
HLE soru seti, akademik bilginin son derece geniş bir disiplin yelpazesini kapsamaktadır. Sorular konularına göre şu şekilde dağılmaktadır:
- Matematik: ~%41
- Biyoloji ve Tıp: ~%11
- Bilgisayar Bilimi ve YZ: ~%10
- Fizik: ~%9
- İnsani ve Sosyal Bilimler: ~%9
- Kimya: ~%7
- Mühendislik Bilimleri: ~%4
- Diğer alanlar: ~%9
Tüm soruların yaklaşık %14ü çok modlludur; yani çözümleri için görüntü (şekil, diyagram, yazı) analizi gerekmektedir[2]. Soruların büyük çoğunluğu (yaklaşık 3/4'ü) kısa yanıtlı açık uçlu sorulardır; modelin bir sayı, terim veya isim gibi kesin bir yanıtı bağımsız olarak üretmesi beklenir. Geri kalanlar ise çoktan seçmeli sorulardır.
HLE'deki tüm sorular ortak özelliklere sahiptir:
- Son derece yüksek güçlük: Her soru, ilgili alanda nitelikli bir uzmanın bilgi ve becerisine eşdeğer bir düzey gerektirmektedir[5].
- Doğrulanabilir yanıt: Her sorunun belirli ve kanıtlanabilir doğru bir yanıtı vardır.
- Aramaya karşı direnç: Sorular, yanıtın basit bir arama sorgusuyla bulunamayacağı şekilde seçilmiştir; başarı için konunun derin kavranması ve akıl yürütme gerekmektedir[1].
Model Test Sonuçları
Humanity's Last Exam, son derece zorlu bir sınav olarak ününü hemen doğruladı: günümüz YZ modellerinin hiçbiri insana yakın bir sonuç elde edemedi. 2025 itibarıyla en iyi dil modelleri çok düşük doğruluk oranları sergiledi.
- OpenAI'ın çeşitli GPT-4 versiyonları ve Anthropic'in Claude modeli %10'un altında sonuç gösterdi[4].
- Standart LLM'ler arasında en yüksek sonuç, yaklaşık %21,6 doğruluk oranıyla Google DeepMind'ın Gemini 2.5 Pro modeline ait oldu[4].
- En iyi modeller bile HLE sorularının yaklaşık 4/5'ini yanıtsız bıraktı; bu durum, mevcut YZ yetenekleri ile insan uzmanı düzeyi arasındaki uçurumun büyüklüğünü gözler önüne sermektedir[1].
Özellikle dikkat çekici olan sonuç, otomatik arama sorguları yapmasına izin verilen OpenAI'ın deneysel ajanı ChatGPT Deep Research'e aittir. Bir araştırmacının çalışma biçimini taklit eden bu ajan, soruların %26,6sını doğru yanıtlamayı başardı; bu sonuç, araç kullanmayan herhangi bir modelin iki katından fazladır, ancak yine de geçme notundan çok uzaktır[6].
Önemi ve Beklentiler
HLE'nin ortaya çıkması, benchmark'ın YZ ilerleme düzeyine yönelik yeni ve daha zorlu bir ölçüt ihtiyacını karşılaması nedeniyle YZ topluluğunda önemli bir olay olarak değerlendirildi.
- Ortak bir referans noktası. HLE, araştırmacılara ve politika yapıcılara YZ yeteneklerini değerlendirmek için nesnel bir araç sunarak iyileşme dinamiklerini izlemeyi ve makinelerin insan düzeyine ne ölçüde yaklaştığını anlamayı mümkün kılmaktadır.
- Politika bilgilendirme aracı. Böyle bir referans testin varlığı, YZ'nin gelişim yönleri, potansiyel riskler ve gerekli düzenleyici önlemler konusundaki tartışmaların daha somut bir zemine oturmasına katkı sağlamaktadır.
- Akademik sınavların son sınırı. "Son Sınav" adının kendisi, bu soru setinin YZ değerlendirmesi için son kapalı sınav olabileceği fikrini yansıtmaktadır. HLE'nin güvenle geçilmesi, makinenin biçimsel bilgi ve sıkı biçimde denetlenebilir akıl yürütme becerileri açısından en iyi insan uzmanlarının düzeyine ulaştığı anlamına gelecektir[4].
Belirtmek gerekir ki HLE'nin tamamlanması, test yaratıcı yetenekleri, inisiyatif almayı veya yeni bilimsel sorular ortaya koyabilmeyi ölçmediğinden, genel yapay zekanın (AGI) elde edildiği anlamına gelmeyecektir[4].
Hızlı ilerleme göz önünde bulundurulduğunda, araştırmacılar modellerin 2025 yılı sonuna kadar HLE'de %50 doğruluğu aşabileceğini öngörmektedir. Bu, makinelerin dar ama önemli bir akademik bilgi ölçütünde insan düzeyine yakından eriştiği anlamına gelecektir[4].
Dış bağlantılar
- Humanity's Last Exam resmi sitesi
- Benchmark'ı tanıtan bilimsel makale
Kaynakça
- Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
- Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
- Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
- Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
- Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
- Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
- Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
- Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
- Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
- Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.
Notlar
- ↑ 1.0 1.1 1.2 1.3 Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». arXiv:2501.14249, 2025. [1]
- ↑ 2.0 2.1 2.2 2.3 «Humanity's Last Exam». In Wikipedia. [2]
- ↑ 3.0 3.1 Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». Reuters, 2024. [3]
- ↑ 4.0 4.1 4.2 4.3 4.4 4.5 «Humanity's Last Exam». Center for AI Safety. [4]
- ↑ «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». TechRadar. [5]
- ↑ «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». Hindustan Times. [6]