The 2024 AI Index Report (NL)
AI Index Report 2024 — het zevende jaarlijkse nummer van het AI Index-rapport, opgesteld door het Stanford Institute for Human-Centered Artificial Intelligence (Stanford HAI)[1]. Het rapport van 2024 is het meest uitgebreide in de geschiedenis van de publicatie en verschijnt op een moment waarop de invloed van AI op de samenleving ongekend zichtbaar wordt. De editie bevat nieuwe schattingen van de trainingskosten van modellen, een gedetailleerde analyse van verantwoorde AI en voor het eerst een afzonderlijk hoofdstuk gewijd aan de invloed van AI op wetenschap en geneeskunde. Het rapport volgt, systematiseert en visualiseert gegevens met betrekking tot kunstmatige intelligentie en biedt objectieve en zorgvuldig geverifieerde informatie aan beleidsmakers, onderzoekers, leidinggevenden, journalisten en het grote publiek.
Structuur van het rapport
Het rapport van 2024 bestaat uit negen thematische hoofdstukken[1]:
- Onderzoek en ontwikkeling (Research and Development) — trends in publicaties, patenten, basismodellen en open-sourceprojecten.
- Technische prestaties (Technical Performance) — benchmarks, vergelijking met het menselijk niveau, multimodaliteit.
- Verantwoorde AI (Responsible AI) — incidenten, veiligheid, vooringenomenheid, privacy.
- Economie (Economy) — investeringen, arbeidsmarkt, bedrijfsimplementatie, robotisering.
- Wetenschap en geneeskunde (Science and Medicine) — nieuw hoofdstuk: doorbraken in wetenschap en medische toepassingen van AI.
- Onderwijs (Education) — personeelsopleiding, onderwijsprogramma's, ChatGPT in het onderwijs.
- Beleid en bestuur (Policy and Governance) — wetgeving, regulering, nationale strategieën.
- Diversiteit (Diversity) — gender- en etnische diversiteit in de AI-sector.
- Publieke opinie (Public Opinion) — houding van de bevolking ten opzichte van AI op basis van internationale enquêtes.
Belangrijkste conclusies van het rapport (Top 10)
De auteurs van het rapport hebben tien belangrijkste stellingen voor 2024 geformuleerd[1]:
1. AI overtreft mensen op bepaalde taken, maar niet op alle
Kunstmatige-intelligentiesystemen hebben het menselijk niveau overtroffen op meerdere benchmarks, waaronder beeldclassificatie (ImageNet), visueel redeneren (VQA) en begrip van de Engelse taal (SuperGLUE). Tegelijkertijd blijft AI achter op mensen bij complexere taken: olympische wiskunde (MATH), visueel alledaags redeneren en planning[1].
2. De industrie domineert geavanceerd AI-onderzoek
In 2023 produceerde de industrie 51 significante Machine Learning-modellen, terwijl de academische wereld er slechts 15 voortbracht. Daarnaast zijn 21 modellen het resultaat van samenwerking tussen industrie en academie — een recordaantal[1].
3. De kosten voor het trainen van geavanceerde modellen stijgen sterk
Volgens schattingen van de AI Index en Epoch AI bedroegen de trainingskosten voor GPT-4 ongeveer 78 miljoen dollar, en voor Google Gemini Ultra ongeveer 191 miljoen dollar[2]. Ter vergelijking: het trainen van het oorspronkelijke Transformer-model in 2017 kostte ongeveer 900 dollar, en RoBERTa Large in 2019 ongeveer 160 duizend dollar[1].
4. De VS loopt voorop als bron van toonaangevende AI-modellen
In 2023 werden 61 significante AI-modellen gecreëerd door organisaties in de VS, wat de EU (21 modellen) en China (15 modellen) ruimschoots overtreft[1].
5. Gestandaardiseerde evaluaties van de verantwoordelijkheid van LLM's lopen ernstig achter
Onderzoek van de AI Index heeft een aanzienlijk gebrek aan standaardisering in de rapportage over verantwoorde AI aangetoond. Toonaangevende ontwikkelaars — OpenAI, Google en Anthropic — testen hun modellen op verschillende benchmarks voor verantwoorde AI, waardoor systematische risikovergelijking wordt bemoeilijkt[1].
6. Investeringen in generatieve AI groeien snel
Ondanks een algemene daling van privé-investeringen in AI is de financiering van generatieve AI bijna verachtievoudigd ten opzichte van 2022 en bereikte 25,2 miljard dollar. OpenAI, Anthropic, Hugging Face en Inflection hebben grote financieringsrondes afgerond[3].
7. AI verhoogt de productiviteit en werkkwaliteit
Talrijke onderzoeken uit 2023 hebben aangetoond dat AI werknemers helpt taken sneller en met hogere kwaliteit uit te voeren, en dat het de kloof tussen laag- en hoogopgeleide professionals verkleint. Tegelijkertijd waarschuwen sommige studies dat het gebruik van AI zonder behoorlijk toezicht tot een vermindering van de productiviteit kan leiden[1].
8. Wetenschappelijke vooruitgang versnelt dankzij AI
In 2023 werden significante wetenschappelijke AI-toepassingen gepresenteerd: AlphaDev (versnelling van sorteeralgoritmen), GNoME (ontdekking van nieuwe materialen), GraphCast (weersvoorspelling) en andere[1].
9. Het aantal AI-regelgevingsbesluiten in de VS is sterk gestegen
In 2023 werden 25 regelgevingsbesluiten met betrekking tot AI aangenomen — een stijging van 56,3% ten opzichte van het voorgaande jaar. Ter vergelijking: in 2016 werd slechts één dergelijk besluit aangenomen[1].
10. Mensen zijn zich steeds meer bewust van de invloed van AI — en maken zich steeds meer zorgen
Volgens Ipsos is het aandeel respondenten dat gelooft dat AI hun leven de komende 3–5 jaar wezenlijk zal beïnvloeden, gestegen van 60% naar 66%. Bovendien uiten 52% nervositeit ten aanzien van AI-producten en -diensten — een stijging van 13 procentpunten ten opzichte van 2022. In de VS rapporteert, volgens Pew Research, 52% van de Amerikanen meer bezorgdheid dan enthousiasme over AI (37% in 2022)[4][5].
Hoofdstuk 1. Onderzoek en ontwikkeling
Het hoofdstuk analyseert trends in publicaties, patenten, geavanceerde AI-systemen, basismodellen (foundation models), conferenties en open-softwareprojecten[1].
Publicaties
Het totale aantal publicaties over AI blijft groeien: van ongeveer 88.000 in 2010 tot meer dan 240.000 in 2022 (bijna een verdrievoudiging). De groei over het afgelopen jaar bedroeg 1,1%[1].
Patenten
Het aantal verleende AI-patenten wereldwijd is sterk gestegen: van 2021 tot 2022 bedroeg de groei 62,7%, en ten opzichte van 2010 meer dan 31 keer. China domineert in AI-patentering: in 2022 was het goed voor 61,1% van de patentaanvragen, terwijl het aandeel van de VS 20,9% bedroeg (een daling van 54,1% in 2010)[1].
Geavanceerde modellen
In 2023 bleef de industrie domineren in de ontwikkeling van geavanceerde modellen. Er werden 149 basismodellen uitgebracht — twee keer zoveel als in 2022. Hiervan was 65,7% open-source (vergeleken met 44,4% in 2022 en 33,3% in 2021)[1].
Trainingskosten. De samenwerking van de AI Index met Epoch AI heeft verfijnde schattingen van de trainingskosten van modellen opgeleverd. De volgende dynamiek illustreert de kostenstijging[2]:
| Model | Jaar | Schatting van de trainingskosten (USD) |
|---|---|---|
| Transformer | 2017 | ~930 |
| BERT-Large | 2018 | ~3.300 |
| RoBERTa Large | 2019 | ~160.000 |
| GPT-3 175B | 2020 | ~4,3 mln |
| PaLM 540B | 2022 | ~12,4 mln |
| Llama 2 70B | 2023 | ~3,9 mln |
| GPT-4 | 2023 | ~78 mln |
| Gemini Ultra | 2023 | ~191 mln |
Nationale herkomst. In 2023 werden 61 significante modellen gecreëerd door organisaties in de VS, 21 door de EU en 15 door China. Dit bevestigt de leidende rol van de VS in de ontwikkeling van geavanceerde AI-systemen[1].
Open-source software
Het aantal AI-projecten op GitHub groeit gestaag: van 845 in 2011 tot ongeveer 1,8 miljoen in 2023. In 2023 werd een groei van 59,3% geregistreerd. Het totale aantal sterren voor AI-projecten verdrievoudigde: van 4,0 miljoen in 2022 tot 12,2 miljoen in 2023[1].
Conferenties
Het bezoekersaantal van toonaangevende AI-conferenties (NeurIPS, ICML, ICLR en andere) bleef groeien, wat de toenemende interesse in het vakgebied weerspiegelt[1].
Hoofdstuk 2. Technische prestaties
Het hoofdstuk analyseert de vooruitgang van AI-systemen op het gebied van taalverwerking, beeldgeneratie, redeneren, coderen en agentgedrag[1].
Stand van de AI-prestaties
Per 2023 overtreft AI het menselijk niveau in meerdere taakcategorieën: beeldclassificatie (sinds 2015), basisbegrip van tekst (sinds 2017), visueel redeneren (sinds 2020), logische gevolgtrekking in natuurlijke taal (sinds 2021). Op taken zoals olympische wiskunde (MATH) en planning blijft AI echter nog achter bij mensen[1].
Taalmodellen
HELM. De benchmark Holistic Evaluation of Language Models (HELM), ontwikkeld bij Stanford, evalueert LLM's op tien scenario's, waaronder tekstbegrip, wiskunde en juridisch redeneren. Per januari 2024 leidt GPT-4 met een mean win rate van 0,96[6].
MMLU. De benchmark Massive Multitask Language Understanding (MMLU) beoordeelt modellen op 57 vakgebieden. Gemini Ultra van Google was de eerste die het menselijk basisniveau (89,8%) overtrof met een score van 90,0% — een verbetering van 14,8 procentpunten ten opzichte van 2022 en 57,6 procentpunten sinds de oprichting van de benchmark in 2019[7].
Chatbot Arena. Het in 2023 gelanceerde platform stelt gebruikers in staat om de uitvoer van anonieme modellen te vergelijken. Per begin 2024 wordt GPT-4 Turbo beschouwd als het meest geprefereerde model op basis van meer dan 200.000 stemmen[1].
Multimodaliteit
Traditoneel waren AI-systemen beperkt tot één modaliteit. In 2023 verschenen echter krachtige multimodale modellen — Google Gemini en OpenAI GPT-4 — die tekst, afbeeldingen en in sommige gevallen ook audio kunnen verwerken. De benchmark MMMU (Massive Multi-discipline Multimodal Understanding) toonde aan dat Gemini Ultra leidt met 59,4%, maar dat is aanzienlijk lager dan het niveau van een menselijke expert (82,6%)[8].
Redeneren
GPQA. De benchmark Graduate-Level Google-Proof Q&A bevat 448 moeilijke vragen over biologie, fysica en scheikunde die niet beantwoord kunnen worden via een eenvoudige zoekopdracht in Google. GPT-4 met zoekfunctie scoorde 41,0%, wat lager is dan het niveau van experts (72,5%), maar hoger dan niet-experts (30,5%)[9].
Theory of Mind (BigToM). Tests van het vermogen van LLM's om overtuigingen van anderen te modelleren toonden aan dat GPT-4 het menselijk niveau benadert bij taken voor directe gevolgtrekking van overtuigingen en acties, hoewel het nog steeds achterloopt bij taken voor omgekeerde gevolgtrekking van overtuigingen[10].
Coderen
De benchmark HumanEval beoordeelt de generatie van code. In 2023 bleven modellen hun scores verbeteren, en SWE-bench — een nieuwe benchmark voor de evaluatie van het oplossen van echte software-engineeringproblemen — toonde aan dat zelfs de beste modellen slechts een klein deel van de taken oplossen, wat een aanzienlijk potentieel voor verdere vooruitgang aantoont[1].
Agentgedrag
AI-systemen worden steeds vaker getest in agentscenario's. Voyager (Microsoft) demonstreerde het vermogen tot autonoom leren in de dynamische omgeving van Minecraft, waarbij het 3,3 keer zoveel unieke voorwerpen verzamelde, 2,3 keer verder bewoog en belangrijke mijlpalen 15,3 keer sneller bereikte in vergelijking met eerdere modellen[11]. MLAgentBench toonde aan dat AI-agenten voor wetenschappelijk onderzoek potentieel beloven, maar dat de resultaten sterk variëren tussen taken[1].
Eigenschappen van LLM's
Emergent gedrag. Een onderzoek uit 2023 stelde de opvatting in twijfel dat bij het opschalen van modellen onvermijdelijk onvoorspelbare 'emergente' capaciteiten ontstaan. Bij gebruik van lineaire en continue meetwaarden verdwijnen dergelijke capaciteiten grotendeels[12].
Prestatiedegradatie. Onderzoek van Stanford en Berkeley toonde aan dat de prestaties van GPT-4 aanzienlijk kunnen veranderen tussen updates: de versie van juni 2023 bleek 42 procentpunten slechter te zijn dan de versie van maart bij het genereren van code en 33 procentpunten slechter bij wiskundige taken[13].
Zelfcorrectie. Onderzoekers van DeepMind en de Universiteit van Illinois toonden aan dat LLM's slecht presteren bij het zelfstandig corrigeren van hun redenering zonder externe begeleiding: de prestaties van GPT-4 daalden op alle geteste benchmarks bij pogingen tot zelfcorrectie[1].
Hoofdstuk 3. Verantwoorde AI
Het hoofdstuk is gewijd aan de belangrijkste dimensies van verantwoorde AI: privacy, transparantie, veiligheid en rechtvaardigheid[1].
AI-incidenten
De AI Incident Database registreerde 123 incidenten in 2023 — een stijging van 32,3% ten opzichte van 2022. Sinds 2013 is het aantal incidenten meer dan twintig keer gestegen. De groei wordt verklaard door zowel de uitbreiding van het gebruik van AI als de toenemende bewustwording van de ethische risico's ervan[14].
Standaardisering van benchmarks voor verantwoorde AI
Analyse van vijf toonaangevende ontwikkelaars (OpenAI, Meta, Anthropic, Google, Mistral AI) heeft aangetoond dat er geen uniforme set benchmarks bestaat voor de evaluatie van verantwoorde AI. Hoewel algemene prestatiebenchmarks (MMLU, HellaSwag, ARC Challenge, HumanEval, GSM8K) breed worden gebruikt, worden benchmarks voor verantwoorde AI (TruthfulQA, RealToxicityPrompts, ToxiGen, BOLD, BBQ) versnipperd toegepast: TruthfulQA wordt door niet meer dan drie van de vijf ontwikkelaars gebruikt, en één ontwikkelaar rapporteert helemaal niet over testen op benchmarks voor verantwoorde AI[1].
AI en verkiezingen
Onderzoek uit 2023 toonde aan dat mensen audio-deepfakes slechts in 73% van de gevallen correct identificeren. Naarmate de technologie voor geluidsopwekking zich verder ontwikkelt, zal de herkenningsnauwkeurigheid naar verwachting afnemen. Dit creëert risico's van manipulatie van politieke campagnes en geeft politici de mogelijkheid om belastende geluidsopnamen als vervalsingen af te wijzen (het zogenaamde 'leugenaarsdividend')[15].
Onderzoek naar politieke vooringenomenheid in LLM's heeft een correlatie aangetoond tussen de standaardantwoorden van ChatGPT en de standpunten van de Democratische Partij, en een negatieve correlatie met de standpunten van de Republikeinse Partij[16].
Hoofdstuk 4. Economie
Het hoofdstuk onderzoekt trends in investeringen, werkgelegenheid, bedrijfsimplementatie van AI en robotisering[1].
Investeringen
Algemene trends. De totale bedrijfsinvesteringen in AI daalden tot 189,2 miljard dollar in 2023 (een daling van ~20% ten opzichte van 2022). Over een decennium is het investeringsvolume echter dertien keer zo groot geworden. Privé-investeringen daalden voor het tweede jaar op rij, hoewel de daling minder uitgesproken was dan in 2021–2022[3].
Generatieve AI. Investeringen in generatieve AI bedroegen 25,2 miljard dollar — een bijna negenmalige stijging ten opzichte van 2022 en dertigmaal ten opzichte van 2019. Generatieve AI was goed voor meer dan een kwart van alle privé-investeringen in AI[3].
Regionale verdeling. De VS met investeringen van 67,2 miljard dollar overtrof China (7,8 miljard) 8,7 keer en het Verenigd Koninkrijk (3,8 miljard) 17,8 keer. Privé-investeringen in China daalden met 44,2%, in de EU en het VK met 14,1%, terwijl ze in de VS met 22,1% stegen[3].
Startups. Het aantal nieuwe AI-bedrijven dat financiering ontving, steeg tot 1.812 (een stijging van 40,6%). Op het gebied van generatieve AI ontvingen 99 nieuwe startups financiering (tegenover 56 in 2022)[3].
Arbeidsmarkt
Het aandeel AI-gerelateerde vacatures in de VS daalde van 2,0% in 2022 naar 1,6% in 2023. Een vergelijkbare trend is wereldwijd waarneembaar. De daling wordt verklaard door een terugloop in de werving door grote AI-bedrijven en een afname van het aandeel technische vacatures[1].
De migratie van AI-specialisten van de academische wereld naar de industrie blijft versnellen: in 2022 ging 70,7% van nieuwe AI-gepromoveerden naar de industrie (tegenover 40,9% in 2011), en slechts 20,0% naar de academische wereld (tegenover 41,6%)[1].
Bedrijfsimplementatie
Volgens McKinsey gebruikt 55% van de organisaties AI (inclusief generatieve AI) in ten minste één bedrijfsafdeling — een stijging van 50% in 2022 en 20% in 2017. Tegelijkertijd rapporteert 42% van de organisaties kostenbesparingen en 59% omzetgroei dankzij AI[17].
Vermeldingen van AI in winstverslagen van Fortune 500-bedrijven bereikten 394 (bijna 80% van alle bedrijven) — een opmerkelijke stijging van 266 in 2022. Het meest genoemde onderwerp (19,7% van alle gesprekken) was generatieve AI[1].
Robotica
In 2022 werden 553.000 industriële robots geïnstalleerd — een stijging van 5,1% ten opzichte van 2021 en meer dan een verdrievoudiging ten opzichte van 2012. China domineert: sinds 2013, toen het Japan inhaalde, groeide het aandeel van China van 20,8% naar 52,4% van de wereldwijde installaties in 2022. Het aandeel van collaboratieve robots steeg van 2,8% in 2017 naar 9,9% in 2022[18].
Hoofdstuk 5. Wetenschap en geneeskunde
Het voor het eerst in het rapport opgenomen hoofdstuk belicht de rol van AI bij wetenschappelijke ontdekkingen en medische innovaties[1].
Wetenschappelijke prestaties van 2023
AlphaDev (DeepMind) — een systeem voor Reinforcement Learning dat sorteeralgoritmen ontdekte met minder instructies dan bestaande menselijke referentiepunten. Sommige van de gevonden algoritmen werden opgenomen in de standaard C++ sorteerbibliotheek (LLVM) — de eerste update van dit deel van de bibliotheek in meer dan tien jaar[19].
GraphCast (DeepMind) — een weersvoorspellingssysteem op basis van grafische Neural Networks dat een 10-daagse prognose in minder dan een minuut levert met een nauwkeurigheid die het toonaangevende modelleringssysteem HRES (Europees Centrum voor Middellange-termijn Weersvoorspellingen) overtreft[20].
GNoME (Google DeepMind) — een model dat grafische netwerken gebruikt voor de versnelde zoektocht naar nieuwe functionele materialen, wat van cruciaal belang is voor de vooruitgang in robotica en de halfgeleiderindustrie[21].
Synbot — een door AI aangestuurd robotachtige chemicus voor de autonome synthese van organische moleculen, die een reactieopbrengst behaalde die vergelijkbaar is met of hoger is dan referentiewaarden[22].
FlexiCubes (NVIDIA) — een methode voor de optimalisatie van 3D-meshes met behulp van AI voor de verbetering van de kwaliteit van 3D-objectgeneratie in computergraphics[23].
AI in de geneeskunde
Klinische kennis. Op de benchmark MedQA (evaluatie van klinische AI-kennis) behaalde het model GPT-4 Medprompt een nauwkeurigheid van 90,2% — een stijging van 22,6 procentpunten ten opzichte van het beste resultaat van 2022. Sinds de oprichting van de benchmark in 2019 zijn de AI-prestaties op MedQA bijna verdrievoudigd. Opmerkelijk is dat GPT-4 Medprompt prompt-engineering gebruikte in plaats van fine-tuning en gespecialiseerde medische modellen overtrof[24].
MediTron-70B — een open medische LLM die 70,2% scoorde op MedQA — het beste resultaat onder open-source modellen, hoewel lager dan de scores van de gesloten modellen GPT-4 Medprompt en Med-PaLM 2[25].
Medische innovaties. Onder de significante systemen van 2023: SynthSR (verbetering van de visualisatie van hersenstructuren uit laagwaardige MRI-scans), ImmunoSEIRA (AI-infraroodsensoren voor de diagnostiek van neurodegeneratieve ziekten), EVEscape (voorspelling van virusevolutie voor de preventie van pandemieën), AlphaMissense (classificatie van missense-mutaties)[1].
FDA-goedkeuring. In 2022 keurde de FDA 139 medische hulpmiddelen op basis van AI goed — een stijging van 12,1% ten opzichte van 2021. Sinds 2012 is het aantal dergelijke goedkeuringen meer dan 45 keer gestegen[26].
Hoofdstuk 6. Onderwijs
Het hoofdstuk bespreekt trends in het onderwijs op het gebied van informatica en AI[1].
Hoger onderwijs
Het aantal bachelorafgestudeerden in informatica in de VS en Canada blijft stijgen. Het aantal masterstudenten blijft relatief stabiel, terwijl het aantal promovendi bescheiden toeneemt. Sinds 2018 is het aantal master- en doctoraatsafgestudeerden in informatica enigszins gedaald[1].
Het aandeel internationale studenten is op alle onderwijsniveaus afgenomen, vooral merkbaar op masterniveau. Wereldwijd is het aantal Engelstalige onderwijsprogramma's gerelateerd aan AI sinds 2017 verdrievoudigd[1].
ChatGPT in het onderwijs
Volgens een enquête van de Walton Foundation is 88% van de leraren en 79% van de studenten van mening dat ChatGPT een positieve invloed heeft op het onderwijsproces. 76% van de leraren en 65% van de studenten zijn van mening dat het belangrijk is ChatGPT in het onderwijs te integreren[27].
Hoofdstuk 7. Beleid en bestuur
Het hoofdstuk analyseert de wetgevende en regulatoire activiteit op het gebied van AI op wereldwijd, Amerikaans en Europees niveau[1].
Mondiale tendensen
Vermeldingen van AI in wetgevende processen over de hele wereld bereikten een recordniveau. Er is een verschuiving waarneembaar van puur stimulerende maatregelen naar beperkende wetgeving, wat wijst op toenemende aandacht van toezichthouders voor de potentiële risico's van AI[1].
Het scala aan onderwerpen van aangenomen wetten in 2023 is aanzienlijk uitgebreid en omvat de strijdkrachten en nationale veiligheid, burgerrechten, handel, onderwijs, arbeidsverhoudingen, wetenschap en technologie[1].
Regulering in de VS
Het aantal AI-gerelateerde regelgevingsbesluiten bereikte 25 in 2023 (een stijging van 56,3% ten opzichte van 2022). De meest voorkomende thematiek betrof buitenlandse handel en internationale financiën. Het aandeel regelgevingsbesluiten met een hoge en gemiddelde relevantie voor AI is toegenomen ten opzichte van voorgaande jaren[1].
Een belangrijk evenement in 2023 was het Uitvoeringsbesluit van President Biden over AI (Executive Order on AI), dat onder meer gericht was op de oprichting van de National AI Research Resource om gelijke kansen te garanderen tussen industrie en academie[28].
Regulering in de EU
In de Europese Unie is een vergelijkbare trend waarneembaar van een toename van het aantal AI-gerelateerde regelgevingsbesluiten. Een belangrijke prestatie van 2023 was de voortgang van de AI Act — 's werelds eerste uitgebreide wet over AI[1].
Hoofdstuk 8. Diversiteit
Het hoofdstuk onderzoekt de gender- en etnische diversiteit onder AI-specialisten. Ondanks enige vooruitgang zijn vrouwen en minderheden nog steeds aanzienlijk ondervertegenwoordigd in de AI-sector, zowel in de industrie als in de academische wereld[1].
Hoofdstuk 9. Publieke opinie
Het hoofdstuk analyseert de publieke perceptie van AI op basis van internationale enquêtes en gegevens uit sociale media[1].
Internationale enquêtes
Bewustwording en bezorgdheid. Volgens Ipsos is 66% van de respondenten (een stijging van 60%) van mening dat AI hun leven de komende 3–5 jaar wezenlijk zal beïnvloeden. Tegelijkertijd uit 52% nervositeit ten aanzien van AI-producten (een stijging van 13 procentpunten ten opzichte van 2022)[4].
Economische verwachtingen. Slechts 37% van de respondenten is van mening dat AI hun werk zal verbeteren, 34% dat het de economie zal verbeteren, en 32% dat het een positieve invloed zal hebben op de arbeidsmarkt[4].
Demografische verschillen. Jongere generaties zijn aanzienlijk optimistischer: 59% van de vertegenwoordigers van Generatie Z is van mening dat AI de entertainment-sector zal verbeteren, tegenover 40% van de babyboomers. Mensen met een hoger inkomen en opleidingsniveau zijn ook optimistischer[1].
Bekendheid van ChatGPT. Volgens een internationale enquête van de Universiteit van Toronto kent 63% van de respondenten ChatGPT, van wie ongeveer de helft het ten minste eenmaal per week gebruikt[29].
Gegevens uit sociale media
Analyse door Quid van meer dan 7 miljoen berichten op sociale media in 2023 toonde aan dat de modellen GraphCast en Claude 2.1 de hoogste positieve sentimentscore (net sentiment score) ontvingen. GPT-4 trok de grootste aandacht in het eerste kwartaal, terwijl de focus aan het einde van het jaar verschoof naar Gemini en Grok[1].
Significante AI-modellen van 2023
Het rapport constateert de opkomst van een aantal sleutelmodellen[1]:
| Model | Ontwikkelaar | Type | Datum | Betekenis |
|---|---|---|---|---|
| GPT-4 | OpenAI | LLM, multimodaal | Maart 2023 | Een van de krachtigste LLM's; leider op HELM |
| PaLM 2 | LLM | Mei 2023 | Uitgebreide meertalige mogelijkheden | |
| Llama 2 | Meta | LLM (open) | Juli 2023 | Toonaangevend open model; versies 7B/13B/70B |
| Claude 2 / 2.1 | Anthropic | LLM | Juli / November 2023 | Contextvenster tot 200K tokens |
| Mistral 7B | Mistral AI | LLM (open) | September 2023 | Compact hoogpresterend model |
| DALL-E 3 | OpenAI | Beeldgeneratie | Oktober 2023 | Verbeterde kwaliteit en naleving van prompts |
| Gemini / Gemini Ultra | LLM, multimodaal | December 2023 | Eerste LLM die de mens overtrof op MMLU | |
| Mixtral 8×7B | Mistral AI | LLM (MoE, open) | December 2023 | Mixture-of-Experts-architectuur |
| Midjourney v6 | Midjourney | Beeldgeneratie | December 2023 | Verbeterde kwaliteit en intuïtieve prompts |
| Whisper v3 | OpenAI | Spraakherkenning | November 2023 | Verhoogde nauwkeurigheid, uitgebreide taalondersteuning |
Methodologie
Het rapport maakt gebruik van gegevens uit talrijke bronnen[1]:
- Publicaties en patenten: OpenAlex, WIPO, USPTO, gegevens van Epoch AI.
- Benchmarks: Papers With Code, CRFM (HELM), gespecialiseerde leaderboards.
- Investeringen: Quid (Capital IQ, Crunchbase), gegevens over meer dan 8 miljoen bedrijven.
- Arbeidsmarkt: Lightcast, LinkedIn, Stack Overflow.
- Bedrijfsactiviteit: McKinsey & Company, Seeking Alpha (earnings calls).
- Robotica: International Federation of Robotics (IFR).
- Regulering: Federal Register (VS), EUR-Lex (EU), Govini.
- Publieke opinie: Ipsos, Pew Research Center, University of Toronto (GPO-AI), Quid (sociale media).
- Onderwijs: CRA Taulbee Survey, Informatics Europe, Studyportals, Code.org, Walton Foundation.
- Geneeskunde: FDA, Papers With Code (MedQA).
Schattingen van de trainingskosten van modellen werden gezamenlijk opgesteld met Epoch AI op basis van een analyse van het type en de hoeveelheid hardware, de trainingsduur en de huurprijzen voor cloud computing[2].
Auteursgroep
Het rapport is opgesteld onder leiding van co-directeuren Ray Perrault en Jack Clark met medewerking van een brede groep onderzoekers en partnerorganisaties. De AI Index is een project van het Stanford HAI-instituut (Human-Centered Artificial Intelligence)[1].
Externe links
- Stanford HAI — AI Index Report 2024 (volledige tekst): https://aiindex.stanford.edu/report/
- Epoch AI — gegevens over trainingskosten en computationele trends: https://epochai.org/
- Papers With Code — benchmarks en leaderboards: https://paperswithcode.com/
- CRFM HELM — Holistic Evaluation of Language Models: https://crfm.stanford.edu/helm/
- AI Incident Database: https://incidentdatabase.ai/
- International Federation of Robotics: https://ifr.org/
- McKinsey Global Survey on AI: https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
Literatuur
- Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/
- Epoch AI (2023). AI Training Cost Estimates and Compute Trends. https://epochai.org/
- Liang, P. et al. (2022). Holistic Evaluation of Language Models. https://arxiv.org/abs/2211.09110
- Hendrycks, D. et al. (2021). Measuring Massive Multitask Language Understanding. https://arxiv.org/abs/2009.03300
- Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. https://arxiv.org/abs/2311.16502
- Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
- Gandhi, K. et al. (2023). Understanding Social Reasoning in Language Models with Language Models. https://arxiv.org/abs/2306.15448
- Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? https://arxiv.org/abs/2304.15004
- Chen, L. et al. (2023). How Is ChatGPT's Behavior Changing over Time? https://arxiv.org/abs/2307.09009
- Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. https://arxiv.org/abs/2305.16291
- Mankowitz, D. J. et al. (2023). Faster sorting algorithms discovered using deep reinforcement learning. Nature. https://doi.org/10.1038/s41586-023-06004-9
- Lam, R. et al. (2023). Learning skillful medium-range global weather forecasting. Science. https://doi.org/10.1126/science.adi2336
- Merchant, A. et al. (2023). Scaling deep learning for materials discovery. Nature. https://doi.org/10.1038/s41586-023-06735-9
- Ha, T. et al. (2023). AI-driven robotic chemist for autonomous synthesis of organic molecules. Science Advances. https://doi.org/10.1126/sciadv.adj0461
- Shen, T. et al. (2023). Flexible Isosurface Extraction for Gradient-Based Mesh Optimization. ACM Transactions on Graphics. https://doi.org/10.1145/3592430
- Nori, H. et al. (2023). Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine. https://arxiv.org/abs/2311.16452
- Chen, Z. et al. (2023). MEDITRON-70B: Scaling Medical Pretraining for Large Language Models. https://arxiv.org/abs/2311.16079
- Mai, K. T. et al. (2023). Warning: Humans Cannot Reliably Detect Speech Deepfakes. https://arxiv.org/abs/2301.07829
- Motoki, F. et al. (2023). More Human than Human: Measuring ChatGPT Political Bias. https://doi.org/10.1007/s11127-023-01097-2
- McKinsey & Company (2023). The State of AI in 2023: Generative AI's Breakout Year. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
- International Federation of Robotics (2023). World Robotics Report 2023. https://ifr.org/worldrobotics/
- The White House (2023). Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence. https://www.whitehouse.gov/briefing-room/presidential-actions/2023/10/30/executive-order-on-the-safe-secure-and-trustworthy-development-and-use-of-artificial-intelligence/
- Fleming, S. L. et al. (2023). MedAlign: A Clinician-Generated Dataset for Instruction Following With Electronic Medical Records. https://arxiv.org/abs/2308.14089
- Iglesias, J. E. et al. (2023). SynthSR: A public AI tool to turn heterogeneous clinical brain scans into high-resolution T1-weighted images for 3D morphometry. Science Advances. https://doi.org/10.1126/sciadv.add3607
- Cheng, J. et al. (2023). Accurate Proteome-Wide Missense Variant Effect Prediction With AlphaMissense. Science. https://doi.org/10.1126/science.adg7492
Noten
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/
- ↑ 2.0 2.1 2.2 Epoch AI (2023). AI Training Cost Estimates. https://epochai.org/
- ↑ 3.0 3.1 3.2 3.3 3.4 Quid (2023). AI Investment Data. https://quid.com/
- ↑ 4.0 4.1 4.2 Ipsos (2023). Global Perceptions of AI Survey. https://www.ipsos.com/
- ↑ Pew Research Center (2023). Public Views on AI. https://www.pewresearch.org/
- ↑ Liang, P. et al. (2022). Holistic Evaluation of Language Models. https://arxiv.org/abs/2211.09110
- ↑ Hendrycks, D. et al. (2021). Measuring Massive Multitask Language Understanding. https://arxiv.org/abs/2009.03300
- ↑ Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. https://arxiv.org/abs/2311.16502
- ↑ Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
- ↑ Gandhi, K. et al. (2023). Understanding Social Reasoning in Language Models with Language Models. https://arxiv.org/abs/2306.15448
- ↑ Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. https://arxiv.org/abs/2305.16291
- ↑ Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? https://arxiv.org/abs/2304.15004
- ↑ Chen, L. et al. (2023). How Is ChatGPT's Behavior Changing over Time? https://arxiv.org/abs/2307.09009
- ↑ AI Incident Database (2023). https://incidentdatabase.ai/
- ↑ Mai, K. T. et al. (2023). Warning: Humans Cannot Reliably Detect Speech Deepfakes. https://arxiv.org/abs/2301.07829
- ↑ Motoki, F. et al. (2023). More Human than Human: Measuring ChatGPT Political Bias. https://doi.org/10.1007/s11127-023-01097-2
- ↑ McKinsey & Company (2023). The State of AI in 2023: Generative AI's Breakout Year. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
- ↑ International Federation of Robotics (2023). World Robotics Report 2023. https://ifr.org/worldrobotics/
- ↑ Mankowitz, D. J. et al. (2023). Faster sorting algorithms discovered using deep reinforcement learning. Nature. https://doi.org/10.1038/s41586-023-06004-9
- ↑ Lam, R. et al. (2023). Learning skillful medium-range global weather forecasting. Science. https://doi.org/10.1126/science.adi2336
- ↑ Merchant, A. et al. (2023). Scaling deep learning for materials discovery. Nature. https://doi.org/10.1038/s41586-023-06735-9
- ↑ Ha, T. et al. (2023). AI-driven robotic chemist for autonomous synthesis of organic molecules. Science Advances. https://doi.org/10.1126/sciadv.adj0461
- ↑ Shen, T. et al. (2023). Flexible Isosurface Extraction for Gradient-Based Mesh Optimization. ACM Transactions on Graphics. https://doi.org/10.1145/3592430
- ↑ Nori, H. et al. (2023). Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine. https://arxiv.org/abs/2311.16452
- ↑ Chen, Z. et al. (2023). MEDITRON-70B: Scaling Medical Pretraining for Large Language Models. https://arxiv.org/abs/2311.16079
- ↑ U.S. Food and Drug Administration (2023). Artificial Intelligence and Machine Learning (AI/ML)-Enabled Medical Devices. https://www.fda.gov/medical-devices/software-medical-device-samd/artificial-intelligence-and-machine-learning-aiml-enabled-medical-devices
- ↑ Impact Research / Walton Family Foundation (2023). ChatGPT and Education Survey. https://www.waltonfamilyfoundation.org/
- ↑ The White House (2023). Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence. https://www.whitehouse.gov/briefing-room/presidential-actions/2023/10/30/executive-order-on-the-safe-secure-and-trustworthy-development-and-use-of-artificial-intelligence/
- ↑ Global Public Opinion on AI Survey, University of Toronto (2023). https://www.mediatechdemocracy.com/