The 2024 AI Index Report (IT)
AI Index Report 2024 — settima edizione annuale del rapporto AI Index, redatta dallo Stanford Institute for Human-Centered Artificial Intelligence (Stanford HAI)[1]. Il rapporto del 2024 è il più completo nella storia della pubblicazione ed esce in un momento in cui l'impatto dell'IA sulla società è diventato senza precedenti. L'edizione include nuove stime sui costi di addestramento dei modelli, un'analisi dettagliata dell'IA responsabile e, per la prima volta, un capitolo dedicato all'impatto dell'IA sulla scienza e sulla medicina. Il rapporto traccia, sistematizza e visualizza i dati relativi all'intelligenza artificiale, fornendo informazioni obiettive e rigorosamente verificate a politici, ricercatori, dirigenti, giornalisti e al grande pubblico.
Struttura del rapporto
Il rapporto 2024 è composto da nove capitoli tematici[1]:
- Ricerca e sviluppo (Research and Development) — tendenze nelle pubblicazioni, nei brevetti, nei modelli di base e nei progetti open source.
- Prestazioni tecniche (Technical Performance) — benchmark, confronto con il livello umano, multimodalità.
- IA responsabile (Responsible AI) — incidenti, sicurezza, pregiudizi, riservatezza.
- Economia (Economy) — investimenti, mercato del lavoro, adozione aziendale, robotica.
- Scienza e medicina (Science and Medicine) — nuovo capitolo: progressi scientifici e applicazioni mediche dell'IA.
- Istruzione (Education) — formazione del personale, programmi educativi, ChatGPT nell'insegnamento.
- Politica e governance (Policy and Governance) — legislazione, regolamentazione, strategie nazionali.
- Diversità (Diversity) — diversità di genere ed etnica nel settore dell'IA.
- Opinione pubblica (Public Opinion) — atteggiamento della popolazione verso l'IA secondo sondaggi internazionali.
Conclusioni principali del rapporto (Top 10)
Gli autori del rapporto hanno individuato dieci tesi principali per il 2024[1]:
1. L'IA supera gli esseri umani in alcune attività, ma non in tutte
I sistemi di intelligenza artificiale hanno superato il livello umano su diversi benchmark, tra cui la classificazione delle immagini (ImageNet), il ragionamento visivo (VQA) e la comprensione dell'inglese (SuperGLUE). Al contempo, l'IA rimane ancora inferiore agli esseri umani in attività più complesse: matematica di livello olimpico (MATH), ragionamento visivo del senso comune e pianificazione[1].
2. L'industria domina la ricerca avanzata sull'IA
Nel 2023, l'industria ha prodotto 51 modelli di Machine Learning significativi, mentre il mondo accademico ne ha prodotti solo 15. Inoltre, 21 modelli sono stati il risultato di una collaborazione tra industria e accademia — un dato record[1].
3. Il costo di addestramento dei modelli avanzati cresce rapidamente
Secondo le stime di AI Index ed Epoch AI, il costo di addestramento di GPT-4 è stato di circa 78 milioni di dollari, mentre quello di Gemini Ultra di Google è stato di circa 191 milioni di dollari[2]. Per confronto: l'addestramento del modello Transformer originale nel 2017 costava circa 900 dollari, e quello di RoBERTa Large nel 2019 circa 160 mila dollari[1].
4. Gli USA guidano come fonte dei principali modelli IA
Nel 2023, 61 modelli IA significativi sono stati creati da organizzazioni statunitensi, distanziando nettamente l'UE (21 modelli) e la Cina (15 modelli)[1].
5. Le valutazioni standardizzate della responsabilità degli LLM sono gravemente in ritardo
La ricerca dell'AI Index ha evidenziato un significativo deficit di standardizzazione nella rendicontazione sull'IA responsabile. I principali sviluppatori — OpenAI, Google e Anthropic — testano i propri modelli su diversi benchmark di IA responsabile, rendendo difficile un confronto sistematico dei rischi[1].
6. Gli investimenti nell'IA generativa crescono rapidamente
Nonostante il calo generale degli investimenti privati nell'IA, i finanziamenti nell'IA generativa sono aumentati di quasi otto volte rispetto al 2022, raggiungendo 25,2 miliardi di dollari. Grandi round di raccolta fondi sono stati condotti da OpenAI, Anthropic, Hugging Face e Inflection[3].
7. L'IA aumenta la produttività e la qualità del lavoro
Numerosi studi del 2023 hanno dimostrato che l'IA aiuta i lavoratori a svolgere le attività più rapidamente e con una qualità superiore, riducendo anche il divario tra professionisti poco e altamente qualificati. Tuttavia, alcune ricerche avvertono che l'utilizzo dell'IA senza un adeguato controllo può portare a una riduzione della produttività[1].
8. Il progresso scientifico accelera grazie all'IA
Nel 2023 sono state presentate importanti applicazioni scientifiche dell'IA: AlphaDev (accelerazione degli algoritmi di ordinamento), GNoME (scoperta di nuovi materiali), GraphCast (previsione meteorologica) e altri[1].
9. Il numero di atti normativi sull'IA negli USA è aumentato drasticamente
Nel 2023 sono stati adottati 25 atti normativi relativi all'IA — un aumento del 56,3% rispetto all'anno precedente. Per confronto: nel 2016 era stato adottato un solo atto del genere[1].
10. Le persone sono sempre più consapevoli dell'impatto dell'IA — e sempre più preoccupate
Secondo Ipsos, la quota di intervistati che ritiene che l'IA influenzerà significativamente la propria vita nei prossimi 3–5 anni è cresciuta dal 60% al 66%. Inoltre, il 52% esprime nervosismo nei confronti dei prodotti e dei servizi IA — un aumento di 13 punti percentuali dal 2022. Negli USA, secondo Pew Research, il 52% degli americani dichiara di essere più preoccupato che entusiasta riguardo all'IA (37% nel 2022)[4][5].
Capitolo 1. Ricerca e sviluppo
Il capitolo analizza le tendenze nelle pubblicazioni, nei brevetti, nei sistemi IA avanzati, nei modelli di base (foundation models), nelle conferenze e nei progetti software open source[1].
Pubblicazioni
Il numero totale di pubblicazioni sull'IA continua a crescere: da circa 88.000 nel 2010 a oltre 240.000 nel 2022 (quasi triplicato). L'incremento nell'ultimo anno è stato dell'1,1%[1].
Brevetti
Il numero di brevetti concessi nel settore dell'IA a livello mondiale è aumentato drasticamente: dal 2021 al 2022 la crescita è stata del 62,7%, e dal 2010 di oltre 31 volte. La Cina domina nella brevettazione dell'IA: nel 2022 ha rappresentato il 61,1% delle domande di brevetto, mentre la quota degli USA è stata del 20,9% (in calo dal 54,1% nel 2010)[1].
Modelli avanzati
Nel 2023 l'industria ha continuato a dominare nella creazione di modelli avanzati. Sono stati rilasciati 149 modelli di base — il doppio rispetto al 2022. Di questi, il 65,7% era open source (rispetto al 44,4% nel 2022 e al 33,3% nel 2021)[1].
Costo di addestramento. La collaborazione tra AI Index ed Epoch AI ha permesso di ottenere stime più precise dei costi di addestramento dei modelli. La crescita delle spese è illustrata dalla seguente dinamica[2]:
| Modello | Anno | Stima del costo di addestramento (USD) |
|---|---|---|
| Transformer | 2017 | ~930 |
| BERT-Large | 2018 | ~3.300 |
| RoBERTa Large | 2019 | ~160.000 |
| GPT-3 175B | 2020 | ~4,3 mln |
| PaLM 540B | 2022 | ~12,4 mln |
| Llama 2 70B | 2023 | ~3,9 mln |
| GPT-4 | 2023 | ~78 mln |
| Gemini Ultra | 2023 | ~191 mln |
Provenienza nazionale. Nel 2023, 61 modelli significativi sono stati creati da organizzazioni statunitensi, 21 dall'UE, 15 dalla Cina. Ciò conferma il ruolo guida degli USA nello sviluppo di sistemi IA avanzati[1].
Software open source
Il numero di progetti IA su GitHub è in costante crescita: da 845 nel 2011 a circa 1,8 milioni nel 2023. Nel 2023 è stato registrato un aumento del 59,3%. Il numero totale di stelle per i progetti IA è triplicato: da 4,0 milioni nel 2022 a 12,2 milioni nel 2023[1].
Conferenze
La partecipazione alle principali conferenze sull'IA (NeurIPS, ICML, ICLR e altre) ha continuato a crescere, riflettendo il crescente interesse per il settore[1].
Capitolo 2. Prestazioni tecniche
Il capitolo analizza i progressi dei sistemi IA nei compiti di elaborazione del linguaggio, generazione di immagini, ragionamento, programmazione e comportamento agentivo[1].
Stato delle prestazioni dell'IA
Al 2023, l'IA supera il livello umano in diverse categorie di compiti: classificazione delle immagini (dal 2015), comprensione di base del testo (dal 2017), ragionamento visivo (dal 2020), inferenza nel linguaggio naturale (dal 2021). Tuttavia, in attività come la matematica olimpica (MATH) e la pianificazione, l'IA è ancora inferiore agli esseri umani[1].
Modelli linguistici
HELM. Il benchmark Holistic Evaluation of Language Models (HELM), sviluppato a Stanford, valuta gli LLM su dieci scenari, tra cui comprensione del testo, matematica e ragionamento giuridico. Al gennaio 2024, GPT-4 è in testa con un mean win rate di 0,96[6].
MMLU. Il benchmark Massive Multitask Language Understanding (MMLU) valuta i modelli su 57 aree disciplinari. Gemini Ultra di Google è stato il primo a superare il livello di riferimento umano (89,8%), ottenendo il 90,0% — un miglioramento di 14,8 punti percentuali rispetto al 2022 e di 57,6 punti percentuali dalla creazione del benchmark nel 2019[7].
Chatbot Arena. La piattaforma lanciata nel 2023 consente agli utenti di confrontare le generazioni di modelli anonimi. Al inizio del 2024, GPT-4 Turbo è stato riconosciuto come il modello più preferito sulla base di oltre 200.000 voti[1].
Multimodalità
Tradizionalmente, i sistemi IA erano limitati a una singola modalità. Tuttavia, nel 2023 sono emersi potenti modelli multimodali — Google Gemini e OpenAI GPT-4 — in grado di elaborare testo, immagini e, in alcuni casi, audio. Il benchmark MMMU (Massive Multi-discipline Multimodal Understanding) ha mostrato che Gemini Ultra è in testa con il 59,4%, ma ciò è significativamente inferiore al livello di un esperto umano (82,6%)[8].
Ragionamento
GPQA. Il benchmark Graduate-Level Google-Proof Q&A include 448 domande complesse su biologia, fisica e chimica, alle quali non è possibile rispondere con una semplice ricerca su Google. GPT-4 con ricerca ha ottenuto il 41,0%, inferiore al livello degli esperti (72,5%), ma superiore ai non esperti (30,5%)[9].
Teoria della mente (BigToM). I test sulla capacità degli LLM di modellare le credenze altrui hanno mostrato che GPT-4 si avvicina al livello umano nei compiti di inferenza diretta di credenze e azioni, sebbene sia ancora inferiore nei compiti di inferenza inversa delle credenze[10].
Programmazione
Il benchmark HumanEval valuta la generazione di codice. Nel 2023 i modelli hanno continuato a migliorare i propri punteggi, mentre SWE-bench — un nuovo benchmark per la valutazione della risoluzione di compiti reali di ingegneria del software — ha mostrato che anche i migliori modelli risolvono solo una piccola frazione dei compiti, evidenziando un significativo potenziale per ulteriori progressi[1].
Comportamento agentivo
I sistemi IA vengono sempre più testati in scenari agentivi. Voyager (Microsoft) ha dimostrato la capacità di apprendimento autonomo in un ambiente dinamico come Minecraft, raccogliendo 3,3 volte più oggetti unici, spostandosi 2,3 volte più lontano e raggiungendo le fasi chiave 15,3 volte più rapidamente rispetto ai modelli precedenti[11]. MLAgentBench ha mostrato che gli agenti IA per la ricerca scientifica sono promettenti, ma i risultati variano significativamente tra i compiti[1].
Proprietà degli LLM
Comportamento emergente. Uno studio del 2023 ha messo in discussione l'idea che l'emergere di capacità "emergenti" imprevedibili durante il ridimensionamento dei modelli sia inevitabile. Utilizzando metriche lineari e continue, tali capacità scompaiono in larga misura[12].
Degrado delle prestazioni. Uno studio di Stanford e Berkeley ha mostrato che le prestazioni di GPT-4 possono variare significativamente tra un aggiornamento e l'altro: la versione di giugno 2023 era peggiore del 42 punti percentuali rispetto alla versione di marzo nella generazione di codice e del 33 punti percentuali nei compiti matematici[13].
Auto-correzione. Ricercatori di DeepMind e dell'Università dell'Illinois hanno dimostrato che gli LLM faticano a correggere autonomamente il proprio ragionamento senza una guida esterna: le prestazioni di GPT-4 peggioravano su tutti i benchmark testati quando si tentava l'auto-correzione[1].
Capitolo 3. IA responsabile
Il capitolo è dedicato alle dimensioni chiave dell'IA responsabile: riservatezza, trasparenza, sicurezza ed equità[1].
Incidenti nel settore dell'IA
Il database AI Incident Database ha registrato 123 incidenti nel 2023 — un aumento del 32,3% rispetto al 2022. Dal 2013, il numero di incidenti è aumentato di oltre venti volte. La crescita è dovuta sia all'espansione dell'utilizzo dell'IA sia alla maggiore consapevolezza dei suoi rischi etici[14].
Standardizzazione dei benchmark per l'IA responsabile
L'analisi dei cinque principali sviluppatori (OpenAI, Meta, Anthropic, Google, Mistral AI) ha rivelato l'assenza di un insieme comune di benchmark per la valutazione dell'IA responsabile. Sebbene i benchmark comuni sulle capacità (MMLU, HellaSwag, ARC Challenge, HumanEval, GSM8K) siano ampiamente utilizzati, i benchmark sull'IA responsabile (TruthfulQA, RealToxicityPrompts, ToxiGen, BOLD, BBQ) vengono applicati in modo frammentato: TruthfulQA è usato da non più di tre sviluppatori su cinque, e uno sviluppatore non riferisce affatto di test su benchmark di IA responsabile[1].
IA e elezioni
Le ricerche del 2023 hanno mostrato che le persone identificano correttamente gli audio deepfake solo nel 73% dei casi. Si prevede che con lo sviluppo delle tecnologie di generazione audio la precisione del riconoscimento diminuirà. Ciò crea rischi di manipolazione delle campagne politiche e offre ai politici la possibilità di respingere come falsi i materiali audio compromettenti (il cosiddetto "dividendo del bugiardo")[15].
Le ricerche sugli LLM in merito ai pregiudizi politici hanno evidenziato una correlazione tra le risposte predefinite di ChatGPT e le posizioni del Partito Democratico e una correlazione negativa con le posizioni del Partito Repubblicano[16].
Capitolo 4. Economia
Il capitolo esamina le tendenze negli investimenti, nell'occupazione, nell'adozione aziendale dell'IA e nella robotica[1].
Investimenti
Tendenze generali. Gli investimenti aziendali complessivi nell'IA sono scesi a 189,2 miliardi di dollari nel 2023 (calo di circa il 20% rispetto al 2022). Tuttavia, nel corso del decennio il volume degli investimenti è aumentato di tredici volte. Gli investimenti privati sono diminuiti per il secondo anno consecutivo, sebbene il calo sia stato meno marcato rispetto al 2021–2022[3].
IA generativa. Gli investimenti nell'IA generativa hanno raggiunto 25,2 miliardi di dollari — quasi nove volte in più rispetto al 2022 e trenta volte in più rispetto al 2019. L'IA generativa ha rappresentato oltre un quarto di tutti gli investimenti privati nell'IA[3].
Distribuzione regionale. Gli USA, con investimenti pari a 67,2 miliardi di dollari, hanno superato la Cina (7,8 miliardi) di 8,7 volte e il Regno Unito (3,8 miliardi) di 17,8 volte. Al contempo, gli investimenti privati in Cina sono diminuiti del 44,2%, nell'UE e nel Regno Unito del 14,1%, mentre negli USA sono aumentati del 22,1%[3].
Startup. Il numero di nuove aziende IA che hanno ricevuto finanziamenti è cresciuto fino a 1.812 (aumento del 40,6%). Nel settore dell'IA generativa, 99 nuove startup hanno ricevuto finanziamenti (rispetto a 56 nel 2022)[3].
Mercato del lavoro
La quota di offerte di lavoro legate all'IA negli USA è scesa dal 2,0% nel 2022 all'1,6% nel 2023. Una tendenza analoga si osserva a livello globale. Il calo è spiegato dalla riduzione delle assunzioni da parte delle grandi aziende IA e dalla diminuzione della quota di posizioni tecniche[1].
La migrazione degli specialisti IA dall'accademia all'industria continua ad accelerare: nel 2022 il 70,7% dei nuovi dottori di ricerca in IA ha trovato impiego nell'industria (rispetto al 40,9% nel 2011), e solo il 20,0% nell'accademia (rispetto al 41,6%)[1].
Adozione aziendale
Secondo McKinsey, il 55% delle organizzazioni utilizza l'IA (inclusa l'IA generativa) in almeno un'unità aziendale — in crescita dal 50% nel 2022 e dal 20% nel 2017. Inoltre, il 42% delle organizzazioni riporta una riduzione dei costi e il 59% un aumento dei ricavi grazie all'IA[17].
Le menzioni dell'IA nelle relazioni sugli utili delle aziende Fortune 500 hanno raggiunto quota 394 (quasi l'80% di tutte le aziende) — un aumento notevole rispetto a 266 nel 2022. L'argomento più frequentemente citato (19,7% di tutte le chiamate) è stato l'IA generativa[1].
Robotica
Nel 2022 sono stati installati 553.000 robot industriali — un aumento del 5,1% rispetto al 2021 e di oltre tre volte rispetto al 2012. La Cina domina: dal 2013, quando ha superato il Giappone, la sua quota è cresciuta dal 20,8% al 52,4% delle installazioni mondiali nel 2022. La quota di robot collaborativi è aumentata dal 2,8% nel 2017 al 9,9% nel 2022[18].
Capitolo 5. Scienza e medicina
Il capitolo, incluso nel rapporto per la prima volta, illustra il ruolo dell'IA nelle scoperte scientifiche e nelle innovazioni mediche[1].
Risultati scientifici del 2023
AlphaDev (DeepMind) — sistema di Reinforcement Learning che ha scoperto algoritmi di ordinamento con un numero di istruzioni inferiore rispetto alle migliori implementazioni umane esistenti. Alcuni degli algoritmi trovati sono stati incorporati nella libreria standard di ordinamento C++ (LLVM) — il primo aggiornamento di questa parte della libreria in oltre dieci anni[19].
GraphCast (DeepMind) — sistema di previsione meteorologica basato su reti neurali a grafo, in grado di fornire previsioni a 10 giorni in meno di un minuto con una precisione superiore al principale sistema di modellazione HRES (Centro europeo per le previsioni meteorologiche a medio termine)[20].
GNoME (Google DeepMind) — modello che utilizza reti a grafo per accelerare la ricerca di nuovi materiali funzionali, cruciale per i progressi nella robotica e nell'industria dei semiconduttori[21].
Synbot — robot chimico guidato dall'IA per la sintesi autonoma di molecole organiche, che ha raggiunto rese di reazione comparabili o superiori ai valori di riferimento[22].
FlexiCubes (NVIDIA) — metodo di ottimizzazione di mesh 3D tramite IA per migliorare la qualità della generazione di oggetti 3D nella computer grafica[23].
IA in medicina
Conoscenze cliniche. Sul benchmark MedQA (valutazione delle conoscenze cliniche dell'IA), il modello GPT-4 Medprompt ha raggiunto una precisione del 90,2% — un aumento di 22,6 punti percentuali rispetto al miglior risultato del 2022. Dal momento della creazione del benchmark nel 2019, le prestazioni dell'IA su MedQA sono quasi triplicate. È degno di nota che GPT-4 Medprompt abbia utilizzato il prompt engineering invece del fine-tuning, superando i modelli medici specializzati[24].
MediTron-70B — LLM medico open source che ha ottenuto il 70,2% su MedQA — il miglior risultato tra i modelli open source, sebbene inferiore alle prestazioni dei modelli closed source GPT-4 Medprompt e Med-PaLM 2[25].
Innovazioni mediche. Tra i sistemi significativi del 2023: SynthSR (miglioramento della visualizzazione delle strutture cerebrali da scansioni MRI di bassa qualità), ImmunoSEIRA (sensori a infrarossi basati sull'IA per la diagnosi di malattie neurodegenerative), EVEscape (previsione dell'evoluzione virale per la prevenzione delle pandemie), AlphaMissense (classificazione delle mutazioni missenso)[1].
Approvazioni FDA. Nel 2022 la FDA ha approvato 139 dispositivi medici basati sull'IA — un aumento del 12,1% rispetto al 2021. Dal 2012, il numero di tali approvazioni è aumentato di oltre 45 volte[26].
Capitolo 6. Istruzione
Il capitolo esamina le tendenze nell'istruzione nel campo dell'informatica e dell'IA[1].
Istruzione superiore
Il numero di laureati triennali in informatica negli USA e in Canada continua a crescere. Il numero di laureati magistrali rimane relativamente stabile, mentre il numero di dottori di ricerca aumenta modestamente. Dal 2018 il numero di magistri e dottori in informatica è leggermente diminuito[1].
La quota di studenti internazionali è diminuita a tutti i livelli di istruzione, in modo particolarmente evidente nella laurea magistrale. A livello globale, il numero di programmi di istruzione in lingua inglese legati all'IA è triplicato dal 2017[1].
ChatGPT nell'istruzione
Secondo un sondaggio della Walton Foundation, l'88% degli insegnanti e il 79% degli studenti ritiene che ChatGPT abbia un impatto positivo sul processo educativo. Il 76% degli insegnanti e il 65% degli studenti ritiene importante integrare ChatGPT nell'insegnamento[27].
Capitolo 7. Politica e governance
Il capitolo analizza l'attività legislativa e regolatoria nel settore dell'IA a livello globale, statunitense ed europeo[1].
Tendenze globali
Le menzioni dell'IA nei processi legislativi in tutto il mondo hanno raggiunto livelli record. Si osserva uno spostamento da misure puramente incentivanti verso una legislazione restrittiva, il che testimonia la crescente attenzione dei regolatori ai potenziali rischi dell'IA[1].
Le tematiche delle leggi adottate nel 2023 si sono ampliate significativamente, coprendo le forze armate e la sicurezza nazionale, i diritti civili, il commercio, l'istruzione, le relazioni lavorative, la scienza e la tecnologia[1].
Regolamentazione negli USA
Il numero di atti normativi relativi all'IA ha raggiunto quota 25 nel 2023 (aumento del 56,3% rispetto al 2022). La tematica più frequente è stata il commercio estero e la finanza internazionale. La quota di atti normativi con elevata e media rilevanza per l'IA è cresciuta rispetto agli anni precedenti[1].
L'evento più significativo del 2023 è stato l'Executive Order on AI del Presidente Biden, volto, tra l'altro, alla creazione del National AI Research Resource per garantire pari opportunità tra industria e accademia[28].
Regolamentazione nell'UE
Nell'Unione Europea si osserva una tendenza analoga all'aumento del numero di atti normativi relativi all'IA. Un risultato significativo del 2023 è stato l'avanzamento dell'AI Act — la prima legge organica sull'IA al mondo[1].
Capitolo 8. Diversità
Il capitolo esamina la diversità di genere ed etnica tra gli specialisti IA. Nonostante alcuni progressi, le donne e i rappresentanti delle minoranze rimangono ancora significativamente sottorappresentati nel settore dell'IA, sia nell'industria che nell'accademia[1].
Capitolo 9. Opinione pubblica
Il capitolo analizza la percezione pubblica dell'IA sulla base di sondaggi internazionali e dati dei social media[1].
Sondaggi internazionali
Consapevolezza e preoccupazione. Secondo Ipsos, il 66% degli intervistati (in crescita dal 60%) ritiene che l'IA influenzerà significativamente la propria vita nei prossimi 3–5 anni. Inoltre, il 52% esprime nervosismo nei confronti dei prodotti IA (aumento di 13 punti percentuali dal 2022)[4].
Aspettative economiche. Solo il 37% degli intervistati ritiene che l'IA migliorerà il proprio lavoro, il 34% che migliorerà l'economia e il 32% che avrà un impatto positivo sul mercato del lavoro[4].
Differenze demografiche. Le generazioni più giovani sono significativamente più ottimiste: il 59% dei rappresentanti della generazione Z ritiene che l'IA migliorerà l'intrattenimento, contro il 40% dei baby boomer. Anche le persone con un reddito e un livello di istruzione più elevati sono più ottimiste[1].
Riconoscibilità di ChatGPT. Secondo un sondaggio internazionale dell'Università di Toronto, il 63% degli intervistati conosce ChatGPT, e di questi circa la metà lo utilizza almeno una volta alla settimana[29].
Dati dei social media
L'analisi Quid di oltre 7 milioni di post sui social media nel 2023 ha rilevato che i modelli GraphCast e Claude 2.1 hanno ottenuto il punteggio di sentiment positivo più elevato (net sentiment score). GPT-4 ha attirato la maggiore quota di attenzione nel primo trimestre, mentre verso la fine dell'anno il focus si è spostato su Gemini e Grok[1].
Modelli IA significativi del 2023
Il rapporto registra l'emergere di una serie di modelli chiave[1]:
| Modello | Sviluppatore | Tipo | Data | Rilevanza |
|---|---|---|---|---|
| GPT-4 | OpenAI | LLM, multimodale | Marzo 2023 | Uno degli LLM più potenti; leader HELM |
| PaLM 2 | LLM | Maggio 2023 | Capacità multilingue avanzate | |
| Llama 2 | Meta | LLM (aperto) | Luglio 2023 | Principale modello open source; versioni 7B/13B/70B |
| Claude 2 / 2.1 | Anthropic | LLM | Luglio / Novembre 2023 | Finestra di contesto fino a 200K token |
| Mistral 7B | Mistral AI | LLM (aperto) | Settembre 2023 | Modello compatto ad alte prestazioni |
| DALL-E 3 | OpenAI | Generazione di immagini | Ottobre 2023 | Qualità migliorata e aderenza ai prompt |
| Gemini / Gemini Ultra | LLM, multimodale | Dicembre 2023 | Primo LLM a superare l'essere umano su MMLU | |
| Mixtral 8×7B | Mistral AI | LLM (MoE, aperto) | Dicembre 2023 | Architettura Mixture-of-Experts |
| Midjourney v6 | Midjourney | Generazione di immagini | Dicembre 2023 | Qualità migliorata e prompt intuitivi |
| Whisper v3 | OpenAI | Riconoscimento vocale | Novembre 2023 | Maggiore precisione, supporto linguistico esteso |
Metodologia
Il rapporto utilizza dati provenienti da molteplici fonti[1]:
- Pubblicazioni e brevetti: OpenAlex, WIPO, USPTO, dati Epoch AI.
- Benchmark: Papers With Code, CRFM (HELM), leaderboard specializzate.
- Investimenti: Quid (Capital IQ, Crunchbase), dati su oltre 8 milioni di aziende.
- Mercato del lavoro: Lightcast, LinkedIn, Stack Overflow.
- Attività aziendale: McKinsey & Company, Seeking Alpha (earnings calls).
- Robotica: International Federation of Robotics (IFR).
- Regolamentazione: Federal Register (USA), EUR-Lex (UE), Govini.
- Opinione pubblica: Ipsos, Pew Research Center, University of Toronto (GPO-AI), Quid (social media).
- Istruzione: CRA Taulbee Survey, Informatics Europe, Studyportals, Code.org, Walton Foundation.
- Medicina: FDA, Papers With Code (MedQA).
Le stime dei costi di addestramento dei modelli sono state elaborate congiuntamente con Epoch AI sulla base dell'analisi del tipo e della quantità di hardware, della durata dell'addestramento e dei prezzi di noleggio cloud[2].
Gruppo di autori
Il rapporto è stato redatto sotto la guida dei co-direttori Ray Perrault e Jack Clark, con la partecipazione di un'ampia cerchia di ricercatori e organizzazioni partner. AI Index è un progetto dello Stanford HAI (Human-Centered Artificial Intelligence)[1].
Riferimenti
- Stanford HAI — AI Index Report 2024 (testo completo): https://aiindex.stanford.edu/report/
- Epoch AI — dati sui costi di addestramento e sulle tendenze computazionali: https://epochai.org/
- Papers With Code — benchmark e leaderboard: https://paperswithcode.com/
- CRFM HELM — Holistic Evaluation of Language Models: https://crfm.stanford.edu/helm/
- AI Incident Database: https://incidentdatabase.ai/
- International Federation of Robotics: https://ifr.org/
- McKinsey Global Survey on AI: https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
Bibliografia
- Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/
- Epoch AI (2023). AI Training Cost Estimates and Compute Trends. https://epochai.org/
- Liang, P. et al. (2022). Holistic Evaluation of Language Models. https://arxiv.org/abs/2211.09110
- Hendrycks, D. et al. (2021). Measuring Massive Multitask Language Understanding. https://arxiv.org/abs/2009.03300
- Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. https://arxiv.org/abs/2311.16502
- Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
- Gandhi, K. et al. (2023). Understanding Social Reasoning in Language Models with Language Models. https://arxiv.org/abs/2306.15448
- Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? https://arxiv.org/abs/2304.15004
- Chen, L. et al. (2023). How Is ChatGPT's Behavior Changing over Time? https://arxiv.org/abs/2307.09009
- Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. https://arxiv.org/abs/2305.16291
- Mankowitz, D. J. et al. (2023). Faster sorting algorithms discovered using deep reinforcement learning. Nature. https://doi.org/10.1038/s41586-023-06004-9
- Lam, R. et al. (2023). Learning skillful medium-range global weather forecasting. Science. https://doi.org/10.1126/science.adi2336
- Merchant, A. et al. (2023). Scaling deep learning for materials discovery. Nature. https://doi.org/10.1038/s41586-023-06735-9
- Ha, T. et al. (2023). AI-driven robotic chemist for autonomous synthesis of organic molecules. Science Advances. https://doi.org/10.1126/sciadv.adj0461
- Shen, T. et al. (2023). Flexible Isosurface Extraction for Gradient-Based Mesh Optimization. ACM Transactions on Graphics. https://doi.org/10.1145/3592430
- Nori, H. et al. (2023). Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine. https://arxiv.org/abs/2311.16452
- Chen, Z. et al. (2023). MEDITRON-70B: Scaling Medical Pretraining for Large Language Models. https://arxiv.org/abs/2311.16079
- Mai, K. T. et al. (2023). Warning: Humans Cannot Reliably Detect Speech Deepfakes. https://arxiv.org/abs/2301.07829
- Motoki, F. et al. (2023). More Human than Human: Measuring ChatGPT Political Bias. https://doi.org/10.1007/s11127-023-01097-2
- McKinsey & Company (2023). The State of AI in 2023: Generative AI's Breakout Year. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
- International Federation of Robotics (2023). World Robotics Report 2023. https://ifr.org/worldrobotics/
- The White House (2023). Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence. https://www.whitehouse.gov/briefing-room/presidential-actions/2023/10/30/executive-order-on-the-safe-secure-and-trustworthy-development-and-use-of-artificial-intelligence/
- Fleming, S. L. et al. (2023). MedAlign: A Clinician-Generated Dataset for Instruction Following With Electronic Medical Records. https://arxiv.org/abs/2308.14089
- Iglesias, J. E. et al. (2023). SynthSR: A public AI tool to turn heterogeneous clinical brain scans into high-resolution T1-weighted images for 3D morphometry. Science Advances. https://doi.org/10.1126/sciadv.add3607
- Cheng, J. et al. (2023). Accurate Proteome-Wide Missense Variant Effect Prediction With AlphaMissense. Science. https://doi.org/10.1126/science.adg7492
Note
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/
- ↑ 2.0 2.1 2.2 Epoch AI (2023). AI Training Cost Estimates. https://epochai.org/
- ↑ 3.0 3.1 3.2 3.3 3.4 Quid (2023). AI Investment Data. https://quid.com/
- ↑ 4.0 4.1 4.2 Ipsos (2023). Global Perceptions of AI Survey. https://www.ipsos.com/
- ↑ Pew Research Center (2023). Public Views on AI. https://www.pewresearch.org/
- ↑ Liang, P. et al. (2022). Holistic Evaluation of Language Models. https://arxiv.org/abs/2211.09110
- ↑ Hendrycks, D. et al. (2021). Measuring Massive Multitask Language Understanding. https://arxiv.org/abs/2009.03300
- ↑ Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. https://arxiv.org/abs/2311.16502
- ↑ Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
- ↑ Gandhi, K. et al. (2023). Understanding Social Reasoning in Language Models with Language Models. https://arxiv.org/abs/2306.15448
- ↑ Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. https://arxiv.org/abs/2305.16291
- ↑ Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? https://arxiv.org/abs/2304.15004
- ↑ Chen, L. et al. (2023). How Is ChatGPT's Behavior Changing over Time? https://arxiv.org/abs/2307.09009
- ↑ AI Incident Database (2023). https://incidentdatabase.ai/
- ↑ Mai, K. T. et al. (2023). Warning: Humans Cannot Reliably Detect Speech Deepfakes. https://arxiv.org/abs/2301.07829
- ↑ Motoki, F. et al. (2023). More Human than Human: Measuring ChatGPT Political Bias. https://doi.org/10.1007/s11127-023-01097-2
- ↑ McKinsey & Company (2023). The State of AI in 2023: Generative AI's Breakout Year. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
- ↑ International Federation of Robotics (2023). World Robotics Report 2023. https://ifr.org/worldrobotics/
- ↑ Mankowitz, D. J. et al. (2023). Faster sorting algorithms discovered using deep reinforcement learning. Nature. https://doi.org/10.1038/s41586-023-06004-9
- ↑ Lam, R. et al. (2023). Learning skillful medium-range global weather forecasting. Science. https://doi.org/10.1126/science.adi2336
- ↑ Merchant, A. et al. (2023). Scaling deep learning for materials discovery. Nature. https://doi.org/10.1038/s41586-023-06735-9
- ↑ Ha, T. et al. (2023). AI-driven robotic chemist for autonomous synthesis of organic molecules. Science Advances. https://doi.org/10.1126/sciadv.adj0461
- ↑ Shen, T. et al. (2023). Flexible Isosurface Extraction for Gradient-Based Mesh Optimization. ACM Transactions on Graphics. https://doi.org/10.1145/3592430
- ↑ Nori, H. et al. (2023). Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine. https://arxiv.org/abs/2311.16452
- ↑ Chen, Z. et al. (2023). MEDITRON-70B: Scaling Medical Pretraining for Large Language Models. https://arxiv.org/abs/2311.16079
- ↑ U.S. Food and Drug Administration (2023). Artificial Intelligence and Machine Learning (AI/ML)-Enabled Medical Devices. https://www.fda.gov/medical-devices/software-medical-device-samd/artificial-intelligence-and-machine-learning-aiml-enabled-medical-devices
- ↑ Impact Research / Walton Family Foundation (2023). ChatGPT and Education Survey. https://www.waltonfamilyfoundation.org/
- ↑ The White House (2023). Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence. https://www.whitehouse.gov/briefing-room/presidential-actions/2023/10/30/executive-order-on-the-safe-secure-and-trustworthy-development-and-use-of-artificial-intelligence/
- ↑ Global Public Opinion on AI Survey, University of Toronto (2023). https://www.mediatechdemocracy.com/