Humanity's Last Exam (benchmark) (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

Humanity's Last Exam (HLE, Fil. «Huling Pagsusulit ng Sangkatauhan») — ito ay isang komprehensibong benchmark na dinisenyo para sa pagtatasa ng mga kakayahan ng mga advanced na sistema ng artificial intelligence (AI) sa mga gawaing nangangailangan ng antas ng kaalaman at kasanayang makatuwiran na maihahambing sa pinakamahuhusay na mga eksperto sa tao. Ang benchmark ay binuo noong 2024–2025 ng non-profit na organisasyong Center for AI Safety (CAIS) kasama ang kumpanyang Scale AI[1].

Ang proyektong HLE ay iniisip bilang «huling akademikong pagsusulit» para sa mga modelo ng AI — isang sukdulan na mahirap na pagsubok na magpapahintulot na matukoy kung ang mga modernong modelo ay nalalapit na sa antas ng eksperto at kung saan nananatili ang agwat sa kanilang mga kakayahan[1]. Ang benchmark ay naglalaman ng 2500 napakahirap na mga tanong na sumasaklaw sa mahigit isang daang iba't ibang disiplina[2].

Kasaysayan ng Paglikha

Sa kalagitnaan ng 2020s, ang malalaking language model tulad ng GPT-4 at Claude ay nagpakita ng napakataas na mga resulta sa mga popular na test set (halimbawa, MMLU), kaya't maraming benchmark ang tumigil na maging maaasahang sukatan ng pag-unlad. Ang mga karaniwang pagsusulit sa antas ng undergraduate ay halos «nilupig» ng mga modelo, na ginawang imposible ang layuning pagtatasa ng karagdagang mga pagpapabuti[3].

Sa sitwasyong ito, Dan Hendrycks (Dan Hendrycks), direktor ng CAIS at kilalang mananaliksik ng AI, ay nagmungkahi ng konsepto ng «Huling Pagsusulit ng Sangkatauhan» — isang hanay ng mga tanong na may pinakamataas na antas ng kahirapan na makakapagtukoy ng pagkakaiba sa pagitan ng mga kakayahan ng AI at antas ng tunay na eksperto. Ang impulsong nagbigay-daan dito ay isang pag-uusap sa negosyanteng si Elon Musk, na nagpahayag ng opinyon na ang mga umiiral na pagsusulit ay naging masyadong madali[2].

Para maisakatuparan ang ideya, inisa ng CAIS ang mga pagsisikap nito kasama ang Scale AI. Noong Setyembre 15, 2024, opisyal na inihayag ang pandaigdigang pangongolekta ng pinakamahirap na mga tanong para sa hinaharap na pagsusulit. Nag-imbitahan ang mga organisador sa mga siyentipiko at espesyalista sa buong mundo na magpadala ng mga gawain na makakapaglito kahit sa pinaka-advanced na mga modelo ng AI. Para sa motibasyon ng mga kalahok, isang prize fund na $500,000 ang itinatag[3].

Ang pagpili ng mga gawain ay nangyari sa ilang yugto. Una, ang mga natanggap na tanong ay pinasaan sa pamamagitan ng filter gamit ang mga advanced na modelo ng AI: kung ang mga algorithm ay may tiwala na nalutas ang gawain, ito ay itinakwil bilang hindi sapat na mahirap. Ang mga gawaing hindi kaya ng AI ay dumaan sa ekspertong pagsusuri para sa pagtatasa ng kawastuan at pagkakaroon ng iisang tamang sagot. Sa huli, halos 1000 eksperto mula sa mahigit 500 institusyong pang-agham at pang-edukasyon ang lumahok sa pagbuo ng hanay[4].

Ang panghuling bersyon ng benchmark, na naglalaman ng 2500 tanong, ay inihayag sa simula ng 2025. Ang bahagi ng mga gawain ay nanatili sa saradong reserba para sa kontroladong pagsubok at pag-iwas sa pag-aayos ng mga modelo para sa isang nakapirming hanay[2].

Estruktura at Nilalaman ng Benchmark

Ang hanay ng mga tanong ng HLE ay sumasaklaw sa pinakamalawak na espektro ng mga disiplina ng akademikong kaalaman. Ang mga gawain ay ibinahagi ayon sa paksa tulad ng sumusunod:

  • Matematika: ~41%
  • Biyolohiya at Medisina: ~11%
  • Agham Kompyuter at AI: ~10%
  • Pisika: ~9%
  • Humanidades at Agham Panlipunan: ~9%
  • Kimika: ~7%
  • Agham Inhinyeriya: ~4%
  • Iba pang larangan: ~9%

Maaaring 14% ng lahat ng gawain ay multimodal, ibig sabihin, ang paglutas sa mga ito ay nangangailangan ng pagsusuri ng mga larawan (mga guhit, diagram, inskripsiyon)[2]. Karamihan (halos 3/4) ng mga gawain ay mga bukas na tanong na may maikling sagot, kung saan ang modelo ay dapat na mag-generate ng tumpak na sagot nang mag-isa (numero, termino, pangalan). Ang natitira ay mga tanong na may maraming pagpipilian.

Lahat ng gawain sa HLE ay may mga karaniwang katangian:

  • Napakataas na kahirapan: Bawat problema ay nangangailangan ng antas ng kaalaman at kasanayan na maihahambing sa isang kwalipikadong espesyalista sa larangang iyon[5].
  • Nabe-beripika na sagot: Bawat tanong ay may tiyak at mapatutunayang tamang sagot.
  • Katatagan laban sa paghahanap: Ang mga gawain ay pinili upang ang sagot ay hindi mahanap sa simpleng paghahanap; ang tagumpay ay nangangailangan ng malalim na pag-unawa sa paksa at makatwirang pag-iisip[1].

Mga Resulta ng Pagsubok sa mga Modelo

Agad na kinumpirma ng Humanity's Last Exam ang reputasyon nito bilang napakahirap na pagsubok: wala ni isa sa mga kasalukuyang modelo ng AI ang nakakuha ng resultang malapit sa antas ng tao. Ang pinakamahuhusay na language model noong 2025 ay nagpakita ng napakababang katumpakan.

  • Ang iba't ibang bersyon ng GPT-4 mula sa OpenAI at Claude mula sa Anthropic ay nagpakita ng resulta na wala pang 10%[4].
  • Ang pinakamataas na resulta sa mga karaniwang LLM ay ang modelo ng Gemini 2.5 Pro (Google DeepMind) na may katumpakang humigit-kumulang 21.6%[4].
  • Kahit ang pinakamahuhusay na modelo ay nabigo sa humigit-kumulang 4/5 ng mga tanong ng HLE, na binibigyang-diin ang laki ng agwat sa pagitan ng kasalukuyang mga kakayahan ng AI at antas ng eksperto ng tao[1].

Partikular na kawili-wiling resulta ang nakita sa eksperimental na ahente ng ChatGPT Deep Research mula sa OpenAI, na pinahintulutang awtomatikong magsagawa ng mga paghahanap. Sa pamamagitan ng pagtulad sa gawain ng isang mananaliksik, ang ahenteng ito ay nakagawa ng tamang solusyon sa 26.6% ng mga gawain — isang resultang mahigit 2 beses na mas mataas kaysa sa anumang modelo na walang ganitong mga kagamitan, ngunit malayo pa rin sa pumapasang marka[6].

Kahalagahan at mga Pananaw

Ang paglitaw ng HLE ay naging makabuluhang kaganapan sa komunidad ng AI, dahil pinunan ng benchmark ang agarang pangangailangan para sa isang bago, mas kumplikadong sukatan ng pag-unlad.

  • Karaniwang puntos ng simula. Nag-aalok ang HLE sa mga mananaliksik at mga gumagawa ng patakaran ng isang layuning instrumento para sa pagtatasa ng mga kakayahan ng AI, na nagbibigay-daan sa pagsubaybay ng dinamika ng mga pagpapabuti at pag-unawa sa kung gaano nalalapit ang mga makina sa antas ng tao.
  • Instrumento para sa pagbibigay-alam sa patakaran. Ang pagkakaroon ng naturang benchmark na pagsusulit ay nagtataguyod ng mas substantibong mga talakayan tungkol sa mga direksyon ng pag-unlad ng AI, mga potensyal na panganib, at mga kinakailangang hakbang sa regulasyon.
  • Huling hangganan ng mga akademikong pagsubok. Ang mismong pangalang «Huling Pagsusulit» ay sumasalamin sa ideya na ang hanay ng mga gawaing ito ay maaaring maging huling saradong pagsusulit para sa pagtatasa ng AI. Ang matagumpay na pagpasa sa HLE ay mangahulugang, sa larangan ng pormal na kaalaman at mahigpit na nabe-beripikang mga kasanayan sa pag-iisip, ang makina ay umabot sa antas ng pinakamahuhusay na mga eksperto ng tao[4].

Mahalaga ring tandaan na kahit ang kumpletong pagpasa sa HLE ay hindi mangahulugang naabot na ang pangkalahatang artificial intelligence (AGI), dahil hindi sinusuri ng pagsubok ang mga malikhaing kakayahan, inisyatiba, o kakayahang magtanong ng mga bagong tanong sa agham[4].

Sa isinasaalang-alang ang mabilis na pag-unlad, ang mga mananaliksik ay nagmumungkahi na ang mga modelo ay maaaring lumampas sa 50% na katumpakan sa HLE bago matapos ang 2025. Ito ay mangahulugang ang mga makina ay malapit nang lumapit sa antas ng tao sa isang makitid ngunit mahalagang sukatan ng akademikong kaalaman[4].

Mga Sanggunian

  • Opisyal na website ng Humanity's Last Exam
  • Siyentipikong artikulo na nagpapakita ng benchmark

Panitikan

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

Mga Tala

  1. 1.0 1.1 1.2 1.3 Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». arXiv:2501.14249, 2025. [1]
  2. 2.0 2.1 2.2 2.3 «Humanity's Last Exam». In Wikipedia. [2]
  3. 3.0 3.1 Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». Reuters, 2024. [3]
  4. 4.0 4.1 4.2 4.3 4.4 4.5 «Humanity's Last Exam». Center for AI Safety. [4]
  5. «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». TechRadar. [5]
  6. «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». Hindustan Times. [6]