Humanity's Last Exam (benchmark) (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

Humanity's Last Exam (HLE, עבר. «הבחינה האחרונה של האנושות») — הוא benchmark בדיקה מקיף, המיועד להערכת יכולותיהן של מערכות בינה מלאכותית (AI) מתקדמות במשימות הדורשות רמת ידע וכישורי הסקה הדומה לאלו של המומחים האנושיים הטובים ביותר. ה-benchmark פותח בשנים 2024–2025 על ידי הארגון הללא-מטרות-רווח Center for AI Safety (CAIS) בשיתוף עם חברת Scale AI[1].

פרויקט HLE נתפס כ"בחינה האקדמית האחרונה" עבור מודלי AI — מבחן קשה במיוחד, שיאפשר לקבוע האם מודלים עכשוויים מתקרבים לרמת המומחים והיכן נותר הפער ביכולותיהם[1]. ה-benchmark כולל 2500 שאלות בעלות מורכבות יוצאת דופן, המקיפות למעלה ממאה תחומים שונים[2].

היסטוריית היצירה

באמצע שנות ה-2020, מודלי שפה גדולים כגון GPT-4 ו-Claude הציגו תוצאות כה גבוהות בערכות בדיקה פופולריות (למשל, MMLU), עד שמדדי benchmark רבים חדלו לשמש מדד מהימן לקידמה. בחינות סטנדרטיות ברמת תואר ראשון כמעט "נהרסו" על ידי המודלים, מה שהפך את ההערכה האובייקטיבית של שיפורים נוספים לבלתי אפשרית[3].

במצב זה, דן הנדריקס (Dan Hendrycks), מנהל CAIS וחוקר AI ידוע, הציע את הרעיון של "הבחינה האחרונה של האנושות" — אוסף שאלות ברמת קושי מרבית, שיוכל להבחין בין יכולות ה-AI לבין רמתו של מומחה אמיתי. הדחף לכך היה שיחה עם היזם אילון מאסק, שהביע את דעתו כי הבחינות הקיימות הפכו לקלות מדי[2].

למימוש הרעיון, CAIS איחד כוחות עם Scale AI. ב-15 בספטמבר 2024 הוכרז רשמית על איסוף גלובלי של השאלות הקשות ביותר עבור הבחינה העתידית. המארגנים פנו לחוקרים ומומחים ברחבי העולם עם הזמנה לשלוח בעיות שיכולות להביך אפילו את מודלי ה-AI המתקדמים ביותר. למען תמרוץ המשתתפים, הוקם קרן פרסים בסך $500,000[3].

מיון המשימות התבצע במספר שלבים. תחילה, השאלות שנשלחו עברו סינון באמצעות מודלי AI מתקדמים: אם האלגוריתמים פתרו משימה בביטחון, היא נפסלה כבלתי קשה מספיק. המשימות שה-AI לא הצליח לפתור עברו בדיקת מומחים להערכת נכונותן ולאישור קיומה של תשובה נכונה יחידה. בסופו של דבר, כמעט 1000 מומחים מלמעלה מ-500 מוסדות מדעיים וחינוכיים השתתפו בגיבוש האוסף[4].

הגרסה הסופית של ה-benchmark, הכוללת 2500 שאלות, הוצגה בתחילת 2025. חלק מהמשימות הושאר ברזרבה סגורה לצורך בדיקת ביקורת ומניעת התאמת מודלים לאוסף קבוע[2].

מבנה ותוכן ה-benchmark

אוסף השאלות של HLE מקיף מגוון רחב ביותר של תחומי ידע אקדמי. המשימות מחולקות לפי נושא באופן הבא:

  • מתמטיקה: ~41%
  • ביולוגיה ורפואה: ~11%
  • מדעי המחשב ו-AI: ~10%
  • פיזיקה: ~9%
  • מדעי הרוח והחברה: ~9%
  • כימיה: ~7%
  • מדעי ההנדסה: ~4%
  • תחומים אחרים: ~9%

כ-14% מכלל המשימות הן מולטימודליות, כלומר פתרונן מצריך ניתוח תמונות (ציורים, דיאגרמות, כיתובים)[2]. רוב המשימות (כשלושה רבעים) הן שאלות פתוחות עם תשובה קצרה, שבהן המודל נדרש לייצר בעצמו תשובה מדויקת (מספר, מונח, שם). השאר הן שאלות רב-ברירה.

כל הבעיות ב-HLE חולקות מאפיינים משותפים:

  • רמת קושי גבוהה במיוחד: כל בעיה דורשת רמת ידע וכישורים הדומה לזו של מומחה מוסמך בתחום[5].
  • תשובה הניתנת לאימות: לכל שאלה יש תשובה נכונה מוגדרת וניתנת להוכחה.
  • עמידות לחיפוש: המשימות נבחרו כך שלא יהיה ניתן למצוא את התשובה בחיפוש פשוט; להצלחה נדרשת הבנה עמוקה של הנושא והסקה[1].

תוצאות בדיקת המודלים

Humanity's Last Exam אישר מיד את המוניטין שלו כמבחן קשה ביותר: אף אחד מהמודלים העכשוויים של AI לא הצליח להציג בו תוצאה הקרובה לזו של בני אדם. מודלי השפה הטובים ביותר נכון ל-2025 הציגו דיוק נמוך מאוד.

  • גרסאות שונות של GPT-4 מ-OpenAI ו-Claude מ-Anthropic הציגו תוצאה נמוכה מ-10%[4].
  • התוצאה הגבוהה ביותר בקרב LLM סטנדרטיים הייתה של המודל Gemini 2.5 Pro (Google DeepMind) עם דיוק של כ-21.6%[4].
  • אפילו המודלים הטובים ביותר נכשלו בכ-4/5 מהשאלות של HLE, מה שמדגיש את גודל הפער בין יכולות ה-AI הנוכחיות לרמת המומחה האנושי[1].

עניין מיוחד מעורר תוצאתו של סוכן ניסיוני בשם ChatGPT Deep Research מ-OpenAI, שהורשה לבצע אוטומטית חיפושים ברשת. תוך חיקוי עבודתו של חוקר, סוכן זה הצליח לפתור נכונה 26.6% מהמשימות — תוצאה הגבוהה ביותר ביותר מפי 2 מכל מודל ללא כלים כאלה, אך עדיין רחוקה מאוד מציון עובר[6].

משמעות ופרספקטיבות

הופעת HLE הייתה אירוע משמעותי בקהילת ה-AI, שכן ה-benchmark מילא צורך דחוף במדד חדש ומורכב יותר לקידמה.

  • נקודת ייחוס משותפת. HLE מציע לחוקרים ולמעצבי מדיניות כלי אובייקטיבי להערכת יכולות ה-AI, המאפשר לעקוב אחר דינמיקת השיפורים ולהבין עד כמה המכונות מתקרבות לרמה האנושית.
  • כלי ליידוע מדיניות. קיומו של מבחן ייחוס כזה מסייע לדיונים ממוקדים יותר על כיווני פיתוח ה-AI, הסיכונים הפוטנציאליים והאמצעות הרגולטוריות הנדרשות.
  • קו הגבול הסופי של מבחני אקדמיה. השם עצמו, "הבחינה האחרונה", משקף את הרעיון שאוסף המשימות הזה עשוי להיות הבחינה הסגורה האחרונה להערכת AI. מעבר מוצלח של HLE יהווה אינדיקציה שמבחינת ידע פורמלי וכישורי הסקה הניתנים לאימות קפדני, המכונה הגיעה לרמתם של המומחים האנושיים הטובים ביותר[4].

חשוב לציין כי אפילו מעבר מלא של HLE לא יצביע על השגת בינה מלאכותית כללית (AGI), שכן המבחן אינו בוחן יכולות יצירתיות, יוזמה או כישרון לשאול שאלות מדעיות חדשות[4].

נוכח הקידמה המהירה, חוקרים משערים שמודלים עשויים לעלות על 50% דיוק ב-HLE עד סוף שנת 2025. פירוש הדבר יהיה שהמכונות התקרבו צמוד לרמה האנושית לפי מדד צר אך חשוב של ידע אקדמי[4].

קישורים

  • האתר הרשמי של Humanity's Last Exam
  • המאמר המדעי המציג את ה-benchmark

ספרות

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

הערות

  1. 1.0 1.1 1.2 1.3 Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». arXiv:2501.14249, 2025. [1]
  2. 2.0 2.1 2.2 2.3 «Humanity's Last Exam». In Wikipedia. [2]
  3. 3.0 3.1 Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». Reuters, 2024. [3]
  4. 4.0 4.1 4.2 4.3 4.4 4.5 «Humanity's Last Exam». Center for AI Safety. [4]
  5. «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». TechRadar. [5]
  6. «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». Hindustan Times. [6]