---
title: "Humanity's Last Exam (benchmark) (IT)"
source: "https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)"
wiki: "systems-analysis.info/int"
article: "Humanity's_Last_Exam_(benchmark)_(IT)"
language: "it"
categories:
  - "Category:Italian"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 3027
wiki_created_at: 2026-09-06T23:14:32Z
wiki_modified_at: 2026-09-06T23:14:32Z
downloaded_at: 2026-09-07T22:54:31Z
---

# Humanity's Last Exam (benchmark) (IT)

**Humanity's Last Exam** (**HLE**, ital. «L'Ultimo Esame dell'Umanità») — un benchmark di valutazione completo, progettato per misurare le capacità dei sistemi di intelligenza artificiale (IA) più avanzati su compiti che richiedono un livello di conoscenza e di ragionamento comparabile a quello dei migliori esperti umani. Il benchmark è stato sviluppato nel 2024–2025 dall'organizzazione no-profit Center for AI Safety (CAIS) in collaborazione con la società Scale AI<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_note-hle_paper-1)</sup>.

Il progetto HLE è concepito come «l'ultimo esame accademico» per i modelli di IA — una prova di difficoltà estrema che consente di determinare se i modelli attuali si avvicinino al livello degli esperti e dove permanga un divario nelle loro capacità<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_note-hle_paper-1)</sup>. Il benchmark comprende 2500 domande di straordinaria complessità, distribuite su più di cento discipline diverse<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_note-wiki_hle-2)</sup>.

## Storia della creazione

A metà degli anni 2020, i grandi modelli linguistici come GPT-4 e Claude avevano raggiunto risultati così elevati nei set di test più diffusi (ad esempio MMLU) che molti benchmark avevano cessato di costituire una misura affidabile del progresso. Gli esami standard di livello universitario erano stati praticamente «demoliti» dai modelli, rendendo impossibile una valutazione obiettiva dei miglioramenti successivi<sup>[\[3\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_note-reuters_stump-3)</sup>.

In questo contesto, **Dan Hendrycks** (*Dan Hendrycks*), direttore del CAIS e noto ricercatore nel campo dell'IA, propose il concetto di «Ultimo Esame dell'Umanità» — un insieme di domande di massima difficoltà, capace di distinguere le capacità dell'IA dal livello di un vero esperto. Lo spunto fu una conversazione con l'imprenditore Elon Musk, che aveva espresso l'opinione che i test esistenti fossero diventati troppo semplici<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_note-wiki_hle-2)</sup>.

Per realizzare l'idea, il CAIS unì le forze con Scale AI. Il 15 settembre 2024 fu ufficialmente annunciata una raccolta globale delle domande più difficili per il futuro esame. Gli organizzatori invitarono scienziati e specialisti di tutto il mondo a inviare quesiti in grado di mettere in difficoltà anche i modelli di IA più avanzati. Per incentivare la partecipazione fu istituito un montepremi di 500.000 dollari<sup>[\[3\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_note-reuters_stump-3)</sup>.

La selezione dei quesiti avvenne in più fasi. Dapprima le domande ricevute venivano filtrate tramite modelli di IA avanzati: se gli algoritmi risolvevano il quesito con sicurezza, esso veniva scartato in quanto non sufficientemente difficile. I quesiti che l'IA non riusciva a risolvere erano sottoposti a revisione da parte di esperti per valutarne la correttezza e l'unicità della risposta corretta. In totale, alla composizione del set parteciparono quasi 1000 esperti provenienti da più di 500 istituzioni scientifiche e accademiche<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_note-hle_site-4)</sup>.

La versione finale del benchmark, comprendente **2500 domande**, fu presentata all'inizio del 2025. Una parte dei quesiti è mantenuta in una riserva chiusa per i test di controllo e per prevenire l'adattamento dei modelli a un set fisso<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_note-wiki_hle-2)</sup>.

## Struttura e contenuto del benchmark

Il set di domande HLE copre un vastissimo spettro di discipline del sapere accademico. I quesiti sono distribuiti per argomento nel modo seguente:

- **Matematica**: ~41%
- **Biologia e medicina**: ~11%
- **Informatica e IA**: ~10%
- **Fisica**: ~9%
- **Scienze umanistiche e sociali**: ~9%
- **Chimica**: ~7%
- **Ingegneria**: ~4%
- **Altri ambiti**: ~9%

Circa il **14%** di tutti i quesiti è **multimodale**, ovvero per risolverli è necessaria l'analisi di immagini (disegni, diagrammi, didascalie)<sup>[\[2\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_note-wiki_hle-2)</sup>. La maggior parte (circa 3/4) dei quesiti sono **domande aperte a risposta breve**, in cui il modello deve generare autonomamente una risposta precisa (un numero, un termine, un nome). I restanti sono domande a scelta multipla.

Tutti i quesiti presenti in HLE condividono le seguenti caratteristiche:

- **Difficoltà estremamente elevata**: Ogni problema richiede un livello di conoscenza e competenza paragonabile a quello di uno specialista qualificato nel relativo campo<sup>[\[5\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_note-techradar_pass-5)</sup>.
- **Risposta verificabile**: Ogni domanda ha una risposta corretta definita e dimostrabile.
- **Resistenza alla ricerca**: I quesiti sono selezionati in modo tale che la risposta non possa essere trovata con una semplice ricerca; per avere successo sono necessarie una comprensione profonda della materia e capacità di ragionamento<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_note-hle_paper-1)</sup>.

## Risultati della valutazione dei modelli

Humanity's Last Exam ha subito confermato la propria reputazione di prova estremamente difficile: **nessuno dei modelli di IA attuali è riuscito a ottenere un risultato vicino a quello umano**. I migliori modelli linguistici del 2025 hanno mostrato un'accuratezza molto bassa.

- Le varie versioni di **GPT-4** di OpenAI e di **Claude** di Anthropic hanno ottenuto un risultato **inferiore al 10%**<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_note-hle_site-4)</sup>.
- Il risultato più alto tra i modelli LLM standard è stato raggiunto da **Gemini 2.5 Pro** (Google DeepMind) con un'accuratezza di circa il **21,6%**<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_note-hle_site-4)</sup>.
- Anche i modelli migliori hanno fallito circa 4/5 delle domande di HLE, il che sottolinea l'entità del divario tra le attuali capacità dell'IA e il livello dell'esperto umano<sup>[\[1\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_note-hle_paper-1)</sup>.

Particolare interesse suscita il risultato dell'agente sperimentale **ChatGPT Deep Research** di OpenAI, al quale era consentito eseguire automaticamente ricerche sul web. Simulando il lavoro di un ricercatore, questo agente è riuscito a risolvere correttamente il **26,6%** dei quesiti — un risultato più del doppio rispetto a qualsiasi modello privo di tali strumenti, ma ancora molto lontano dalla soglia di superamento<sup>[\[6\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_note-hindustan_times_26-6)</sup>.

## Importanza e prospettive

La comparsa di HLE è stata un evento significativo per la comunità dell'IA, poiché il benchmark ha colmato una concreta necessità di una misura di progresso nuova e più impegnativa.

- **Punto di riferimento comune**. HLE offre a ricercatori e responsabili politici uno strumento oggettivo per valutare le capacità dell'IA, consentendo di monitorare la dinamica dei miglioramenti e di comprendere quanto le macchine si avvicinino al livello umano.
- **Strumento per l'orientamento delle politiche**. La disponibilità di un tale test di riferimento favorisce discussioni più concrete sulle direzioni di sviluppo dell'IA, sui potenziali rischi e sulle misure di regolamentazione necessarie.
- **Limite finale delle prove accademiche**. Il nome stesso «Ultimo Esame» riflette l'idea che questo insieme di quesiti possa diventare l'ultimo esame chiuso per la valutazione dell'IA. Il superamento sicuro di HLE significherà che, in termini di conoscenze formali e di capacità di ragionamento strettamente verificabili, la macchina ha raggiunto il livello dei migliori esperti umani<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_note-hle_site-4)</sup>.

È importante sottolineare che anche il superamento completo di HLE non significherà il raggiungimento dell'intelligenza artificiale generale (AGI), poiché il test non valuta le capacità creative, l'iniziativa o la capacità di formulare nuove domande scientifiche<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_note-hle_site-4)</sup>.

In considerazione del rapido progresso, i ricercatori ipotizzano che i modelli possano superare il 50% di accuratezza su HLE entro la fine del 2025. Ciò significherebbe che le macchine si sono avvicinate notevolmente al livello umano secondo una metrica ristretta ma importante delle conoscenze accademiche<sup>[\[4\]](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_note-hle_site-4)</sup>.

## Collegamenti esterni

- Sito ufficiale di Humanity's Last Exam
- Articolo scientifico che presenta il benchmark

## Bibliografia

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Note

1.  <span id="cite_note-hle_paper-1">↑ <sup>[1.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_ref-hle_paper_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_ref-hle_paper_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_ref-hle_paper_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_ref-hle_paper_1-3)</sup> Fan, L. et al. «Humanity's Last Exam: A New Benchmark for AI Alignment». *arXiv:2501.14249*, 2025. <a href="https://arxiv.org/abs/2501.14249" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-wiki_hle-2">↑ <sup>[2.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_ref-wiki_hle_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_ref-wiki_hle_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_ref-wiki_hle_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_ref-wiki_hle_2-3)</sup> «Humanity's Last Exam». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/Humanity%27s_Last_Exam" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-reuters_stump-3">↑ <sup>[3.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_ref-reuters_stump_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_ref-reuters_stump_3-1)</sup> Dastin, J. & Paul, K. «AI experts ready 'Humanity's Last Exam' to stump powerful tech». *Reuters*, 2024. <a href="https://www.reuters.com/technology/artificial-intelligence/ai-experts-ready-humanitys-last-exam-stump-powerful-tech-2024-09-16/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-hle_site-4">↑ <sup>[4.0](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_ref-hle_site_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_ref-hle_site_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_ref-hle_site_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_ref-hle_site_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_ref-hle_site_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_ref-hle_site_4-5)</sup> «Humanity's Last Exam». *Center for AI Safety*. <a href="https://agi.safe.ai/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-techradar_pass-5">[↑](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_ref-techradar_pass_5-0) «Could you pass 'Humanity's Last Exam'? Probably not, but neither can AI». *TechRadar*. <a href="https://www.techradar.com/computing/artificial-intelligence/could-you-pass-humanitys-last-exam-probably-not-but-neither-can-ai" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-hindustan_times_26-6">[↑](https://systems-analysis.info/int/Humanity's_Last_Exam_(benchmark)_(IT)#cite_ref-hindustan_times_26_6-0) «OpenAI's deep research can complete 26% of 'Humanity's Last Exam': What is it and what does it mean?». *Hindustan Times*. <a href="https://www.hindustantimes.com/technology/openais-deep-research-can-complete-26-of-humanity-s-last-exam-what-is-it-and-what-does-it-mean-101739355881687.html" class="external autonumber" rel="nofollow">[6]</a></span>
