The 2024 AI Index Report (SV)
AI Index Report 2024 — den sjunde årsutgåvan av rapporten AI Index, framtagen av Stanfords institut för människocentrerad artificiell intelligens (Stanford HAI)[1]. 2024 års rapport är den mest omfattande i publikationens historia och ges ut i ett läge då AI:s påverkan på samhället är utan motstycke. Utgåvan innehåller nya uppskattningar av träningskostnader för modeller, en detaljerad analys av ansvarsfullt AI och innehåller för första gången ett separat kapitel om AI:s påverkan på vetenskap och medicin. Rapporten spårar, systematiserar och visualiserar data relaterade till artificiell intelligens och tillhandahåller objektiv och noggrant verifierad information för beslutsfattare, forskare, ledare, journalister och allmänheten.
Rapportens struktur
2024 års rapport består av nio tematiska kapitel[1]:
- Forskning och utveckling (Research and Development) — trender inom publikationer, patent, grundmodeller och öppna projekt.
- Teknisk prestanda (Technical Performance) — benchmark, jämförelse med mänsklig nivå, multimodalitet.
- Ansvarsfullt AI (Responsible AI) — incidenter, säkerhet, partiskhet, integritet.
- Ekonomi (Economy) — investeringar, arbetsmarknad, företagsimplementering, robotisering.
- Vetenskap och medicin (Science and Medicine) — nytt kapitel: genombrott inom vetenskap och medicinska tillämpningar av AI.
- Utbildning (Education) — personalutbildning, utbildningsprogram, ChatGPT i undervisningen.
- Politik och styrning (Policy and Governance) — lagstiftning, reglering, nationella strategier.
- Mångfald (Diversity) — könsmässig och etnisk mångfald inom AI-sektorn.
- Allmänhetens åsikter (Public Opinion) — befolkningens inställning till AI enligt internationella enkätundersökningar.
Rapportens viktigaste slutsatser (Top 10)
Rapportens författare identifierade tio huvudteser för 2024[1]:
1. AI överträffar människor i vissa uppgifter, men inte i alla
Artificiella intelligenssystem har överträffat den mänskliga nivån på flera benchmark, inklusive bildklassificering (ImageNet), visuellt resonemang (VQA) och förståelse av engelska (SuperGLUE). Samtidigt presterar AI fortfarande sämre än människor i mer komplexa uppgifter: matematik på olympiadnivå (MATH), visuellt vardagsresonemang och planering[1].
2. Industrin dominerar den ledande AI-forskningen
Under 2023 skapade industrin 51 betydelsefulla machine learning-modeller, medan akademin skapade blott 15. Dessutom var 21 modeller resultatet av samarbete mellan industri och akademi — ett rekord[1].
3. Kostnaderna för att träna ledande modeller ökar kraftigt
Enligt uppskattningar från AI Index och Epoch AI uppgick träningskostnaderna för GPT-4 till cirka 78 miljoner dollar och för Googles Gemini Ultra till ungefär 191 miljoner dollar[2]. Som jämförelse kostade träningen av den ursprungliga Transformer-modellen 2017 cirka 900 dollar och RoBERTa Large 2019 cirka 160 000 dollar[1].
4. USA leder som källa till de ledande AI-modellerna
Under 2023 skapades 61 betydelsefulla AI-modeller i amerikanska organisationer, vilket avsevärt överträffar EU (21 modeller) och Kina (15 modeller)[1].
5. Standardiserade utvärderingar av LLM:ers ansvarsfullhet ligger långt efter
AI Index-undersökningen visade på en betydande brist på standardisering i rapporteringen om ansvarsfullt AI. Ledande utvecklare — OpenAI, Google och Anthropic — testar sina modeller på olika benchmark för ansvarsfullt AI, vilket försvårar systematisk riskjämförelse[1].
6. Investeringarna i generativ AI ökar snabbt
Trots en allmän minskning av privata AI-investeringar ökade finansieringen av generativ AI med nästan åtta gånger jämfört med 2022 och nådde 25,2 miljarder dollar. OpenAI, Anthropic, Hugging Face och Inflection genomförde stora finansieringsrundor[3].
7. AI förbättrar produktiviteten och arbetskvaliteten
Talrika studier från 2023 visade att AI hjälper arbetstagare att utföra uppgifter snabbare och med högre kvalitet, samt minskar klyftan mellan låg- och högkvalificerade specialister. Samtidigt varnar en del studier för att användning av AI utan lämplig tillsyn kan leda till minskad produktivitet[1].
8. Det vetenskapliga framsteget påskyndas tack vare AI
Under 2023 presenterades betydande vetenskapliga AI-tillämpningar: AlphaDev (snabbare sorteringsalgoritmer), GNoME (upptäckt av nya material), GraphCast (väderprognoser) och andra[1].
9. Antalet AI-relaterade föreskrifter i USA har ökat kraftigt
Under 2023 antogs 25 AI-relaterade föreskrifter — en ökning med 56,3% jämfört med föregående år. Som jämförelse antogs enbart en sådan föreskrift under 2016[1].
10. Människor är alltmer medvetna om AI:s påverkan — och alltmer oroliga
Enligt Ipsos ökade andelen respondenter som anser att AI avsevärt kommer att påverka deras liv under de kommande 3–5 åren från 60% till 66%. Dessutom uttrycker 52% nervositet inför AI-produkter och -tjänster — en ökning med 13 procentenheter sedan 2022. I USA uppger 52% av amerikanerna, enligt Pew Research, att de känner mer oro än entusiasm inför AI (37% år 2022)[4][5].
Kapitel 1. Forskning och utveckling
Kapitlet analyserar trender inom publikationer, patent, ledande AI-system, grundmodeller (foundation models), konferenser och öppna programvaruprojekt[1].
Publikationer
Det totala antalet publikationer om AI fortsätter att öka: från ungefär 88 000 år 2010 till mer än 240 000 år 2022 (nästan en trefaldig ökning). Ökningen det senaste året uppgick till 1,1%[1].
Patent
Antalet beviljade AI-patent i världen har ökat kraftigt: från 2021 till 2022 var ökningen 62,7%, och sedan 2010 har antalet ökat mer än 31 gånger. Kina dominerar AI-patentering: år 2022 stod landet för 61,1% av patentansökningarna, medan USA:s andel uppgick till 20,9% (en minskning från 54,1% år 2010)[1].
Ledande modeller
Under 2023 fortsatte industrin att dominera skapandet av ledande modeller. Totalt lanserades 149 grundmodeller — dubbelt så många som 2022. Av dessa var 65,7% med öppen källkod (jämfört med 44,4% år 2022 och 33,3% år 2021)[1].
Träningskostnader. Samarbetet mellan AI Index och Epoch AI resulterade i preciserade uppskattningar av modellernas träningskostnader. Kostnadsutvecklingen illustreras tydligt av följande dynamik[2]:
| Modell | År | Uppskattad träningskostnad (USD) |
|---|---|---|
| Transformer | 2017 | ~930 |
| BERT-Large | 2018 | ~3 300 |
| RoBERTa Large | 2019 | ~160 000 |
| GPT-3 175B | 2020 | ~4,3 milj. |
| PaLM 540B | 2022 | ~12,4 milj. |
| Llama 2 70B | 2023 | ~3,9 milj. |
| GPT-4 | 2023 | ~78 milj. |
| Gemini Ultra | 2023 | ~191 milj. |
Nationell tillhörighet. Under 2023 skapades 61 betydelsefulla modeller av amerikanska organisationer, 21 av EU och 15 av Kina. Detta bekräftar USA:s ledande roll i utvecklingen av avancerade AI-system[1].
Öppen programvara
Antalet AI-projekt på GitHub ökar stadigt: från 845 år 2011 till ungefär 1,8 miljoner år 2023. Under 2023 registrerades en tillväxt på 59,3%. Det totala antalet stjärnor för AI-projekt tredubblades: från 4,0 miljoner år 2022 till 12,2 miljoner år 2023[1].
Konferenser
Deltagandet vid ledande AI-konferenser (NeurIPS, ICML, ICLR m.fl.) fortsatte att öka, vilket speglar det växande intresset för området[1].
Kapitel 2. Teknisk prestanda
Kapitlet analyserar AI-systems framsteg inom språkbehandling, bildgenerering, resonemang, kodning och agentbeteende[1].
AI-prestandans nuläge
Per 2023 överträffar AI den mänskliga nivån i flera uppgiftskategorier: bildklassificering (sedan 2015), grundläggande textförståelse (sedan 2017), visuellt resonemang (sedan 2020), logisk slutledning på naturligt språk (sedan 2021). Däremot presterar AI fortfarande sämre än människor i uppgifter som olympiadmatematik (MATH) och planering[1].
Språkmodeller
HELM. Benchmark Holistic Evaluation of Language Models (HELM), utvecklat vid Stanford, utvärderar LLM:er i tio scenarier, inklusive textförståelse, matematik och juridiskt resonemang. Per januari 2024 leder GPT-4 med ett mean win rate på 0,96[6].
MMLU. Benchmark Massive Multitask Language Understanding (MMLU) utvärderar modeller inom 57 ämnesområden. Googles Gemini Ultra var den första att överskrida den mänskliga baslinjenivån (89,8%) med 90,0% — en förbättring med 14,8 procentenheter jämfört med 2022 och 57,6 procentenheter sedan benchmark skapades 2019[7].
Chatbot Arena. Plattformen som lanserades 2023 låter användare jämföra anonyma modellers svar. Per början av 2024 har GPT-4 Turbo utsetts till den mest föredragna modellen baserat på mer än 200 000 röster[1].
Multimodalitet
Traditionellt har AI-system varit begränsade till en enda modalitet. Under 2023 lanserades dock kraftfulla multimodala modeller — Google Gemini och OpenAI GPT-4 — som kan bearbeta text, bilder och i vissa fall även ljud. Benchmark MMMU (Massive Multi-discipline Multimodal Understanding) visade att Gemini Ultra leder med 59,4%, men detta är avsevärt lägre än en mänsklig experts nivå (82,6%)[8].
Resonemang
GPQA. Benchmark Graduate-Level Google-Proof Q&A innehåller 448 svåra frågor inom biologi, fysik och kemi som inte kan besvaras med en enkel Google-sökning. GPT-4 med sökning uppnådde 41,0%, vilket är lägre än experternas nivå (72,5%) men högre än icke-experternas (30,5%)[9].
Theory of mind (BigToM). Testning av LLM:ers förmåga att modellera andra människors övertygelser visade att GPT-4 närmar sig den mänskliga nivån i uppgifter om direkt slutledning av övertygelser och handlingar, även om den fortfarande är sämre i uppgifter om omvänd slutledning av övertygelser[10].
Kodning
Benchmark HumanEval utvärderar kodgenerering. Under 2023 fortsatte modellerna att förbättra sina resultat, och SWE-bench — ett nytt benchmark för att utvärdera lösningar på verkliga programvaruteknikuppgifter — visade att även de bästa modellerna löser enbart en liten andel av uppgifterna, vilket visar på en betydande potential för ytterligare framsteg[1].
Agentbeteende
AI-system testas alltmer i agentscenarier. Voyager (Microsoft) visade förmåga till autonomt lärande i den dynamiska miljön Minecraft och samlade 3,3 gånger fler unika föremål, förflyttade sig 2,3 gånger längre och nådde viktiga milstolpar 15,3 gånger snabbare jämfört med tidigare modeller[11]. MLAgentBench visade att AI-agenter för vetenskaplig forskning är lovande, men resultaten varierar avsevärt mellan uppgifterna[1].
LLM-egenskaper
Emergent beteende. En studie från 2023 ifrågasatte uppfattningen om att oförutsägbara "emergenta" förmågor oundvikligen uppstår vid skalning av modeller. Vid användning av linjära och kontinuerliga mätvärden försvinner sådana förmågor i stor utsträckning[12].
Prestandaförsämring. En studie från Stanford och Berkeley visade att GPT-4:s prestanda kan förändras avsevärt mellan uppdateringar: versionen från juni 2023 var 42 procentenheter sämre än mars-versionen vad gäller kodgenerering och 33 procentenheter sämre i matematiska uppgifter[13].
Självkorrigering. Forskare från DeepMind och University of Illinois visade att LLM:er är dåliga på att självständigt korrigera sitt resonemang utan extern vägledning: GPT-4:s prestanda minskade på alla testade benchmark vid försök till självkorrigering[1].
Kapitel 3. Ansvarsfullt AI
Kapitlet ägnas åt de viktigaste dimensionerna av ansvarsfullt AI: integritet, transparens, säkerhet och rättvisa[1].
AI-incidenter
AI Incident Database registrerade 123 incidenter under 2023 — en ökning med 32,3% jämfört med 2022. Sedan 2013 har antalet incidenter ökat mer än tjugo gånger. Ökningen beror både på den utbredda användningen av AI och på ökad medvetenhet om dess etiska risker[14].
Standardisering av benchmark för ansvarsfullt AI
En analys av fem ledande utvecklare (OpenAI, Meta, Anthropic, Google, Mistral AI) visade på avsaknaden av en gemensam uppsättning benchmark för utvärdering av ansvarsfullt AI. Även om vanliga förmågebenchmark (MMLU, HellaSwag, ARC Challenge, HumanEval, GSM8K) används i stor utsträckning, tillämpas benchmark för ansvarsfullt AI (TruthfulQA, RealToxicityPrompts, ToxiGen, BOLD, BBQ) fragmentariskt: TruthfulQA används av högst tre av fem utvecklare, och en utvecklare rapporterar överhuvudtaget inte om testning mot benchmark för ansvarsfullt AI[1].
AI och val
Studier från 2023 visade att människor korrekt identifierar deepfake-ljud i blott 73% av fallen. I takt med att tekniken för ljudgenerering utvecklas förväntas igenkänningsnoggrannheten minska. Detta skapar risker för manipulation av politiska kampanjer och ger politiker möjlighet att avfärda komprometterande ljudupptagningar som förfalskningar (den så kallade "lögnardividenden")[15].
Studier av LLM:er avseende politisk partiskhet visade på en korrelation mellan ChatGPT:s standardsvar och Demokratiska partiets ståndpunkter och en negativ korrelation med Republikanska partiets ståndpunkter[16].
Kapitel 4. Ekonomi
Kapitlet undersöker trender inom investeringar, sysselsättning, företagsimplementering av AI och robotisering[1].
Investeringar
Allmänna trender. De totala företagsinvesteringarna i AI minskade till 189,2 miljarder dollar år 2023 (en minskning med ~20% jämfört med 2022). Under det senaste decenniet har dock investeringsvolymen ökat trettiofalt. De privata investeringarna minskade för andra året i rad, även om minskningen var mindre uttalad än under 2021–2022[3].
Generativ AI. Investeringarna i generativ AI uppgick till 25,2 miljarder dollar — en nästan niofaldigt ökning jämfört med 2022 och en trettiofaldigt ökning jämfört med 2019. Generativ AI stod för mer än en fjärdedel av alla privata AI-investeringar[3].
Regional fördelning. USA med investeringar på 67,2 miljarder dollar överskred Kina (7,8 miljarder) med 8,7 gånger och Storbritannien (3,8 miljarder) med 17,8 gånger. Privata investeringar i Kina minskade med 44,2%, i EU och Storbritannien med 14,1%, medan de i USA ökade med 22,1%[3].
Startups. Antalet nya AI-företag som erhöll finansiering ökade till 1 812 (en ökning med 40,6%). Inom generativ AI erhöll 99 nya startups finansiering (jämfört med 56 år 2022)[3].
Arbetsmarknad
Andelen AI-relaterade lediga tjänster i USA minskade från 2,0% år 2022 till 1,6% år 2023. En liknande tendens observeras globalt. Minskningen förklaras av minskad nyanställning hos stora AI-företag och en minskad andel tekniska tjänster[1].
Migrationen av AI-specialister från akademin till industrin fortsätter att accelerera: år 2022 tog sig 70,7% av nya doktorer inom AI till industrin (jämfört med 40,9% år 2011), och enbart 20,0% till akademin (jämfört med 41,6%)[1].
Företagsimplementering
Enligt McKinsey använder 55% av organisationerna AI (inklusive generativ AI) i åtminstone en affärsenhet — en ökning från 50% år 2022 och 20% år 2017. Dessutom rapporterar 42% av organisationerna om minskade kostnader och 59% om ökade intäkter tack vare AI[17].
Nämnanden av AI i Fortune 500-företagens kvartalsrapporter nådde 394 (nästan 80% av alla företag) — en markant ökning från 266 år 2022. Det mest frekvent nämnda ämnet (19,7% av alla samtal) var generativ AI[1].
Robotteknik
Under 2022 installerades 553 000 industrirobotar — en ökning med 5,1% jämfört med 2021 och mer än tre gånger sedan 2012. Kina dominerar: sedan 2013, då landet gick om Japan, har Kinas andel vuxit från 20,8% till 52,4% av världens installationer år 2022. Andelen kollaborativa robotar ökade från 2,8% år 2017 till 9,9% år 2022[18].
Kapitel 5. Vetenskap och medicin
Detta kapitel, som inkluderats i rapporten för första gången, belyser AI:s roll i vetenskapliga upptäckter och medicinska innovationer[1].
Vetenskapliga framsteg 2023
AlphaDev (DeepMind) — ett system baserat på Reinforcement Learning som upptäckte sorteringsalgoritmer med färre instruktioner än befintliga mänskliga referensimplementationer. Några av de hittade algoritmerna inkorporerades i C++:s standardsorteringsbibliotek (LLVM) — den första uppdateringen av denna del av biblioteket på mer än tio år[19].
GraphCast (DeepMind) — ett system för väderprognoser baserat på grafiska neurala nätverk som ger 10-dagarsprognoser på under en minut med en noggrannhet som överstiger det ledande simuleringsystemet HRES (European Centre for Medium-Range Weather Forecasts)[20].
GNoME (Google DeepMind) — en modell som använder grafnätverk för accelererad sökning efter nya funktionella material, vilket är avgörande för framsteg inom robotteknik och halvledarindustrin[21].
Synbot — en AI-styrd robotkemist för autonom syntes av organiska molekyler, som uppnådde reaktionsutbyten jämförbara med eller överskridande referensvärden[22].
FlexiCubes (NVIDIA) — en metod för optimering av 3D-nät med hjälp av AI för att förbättra kvaliteten på 3D-objektgenerering inom datorgrafik[23].
AI inom medicin
Kliniska kunskaper. I benchmark MedQA (utvärdering av AI:s kliniska kunskaper) uppnådde modellen GPT-4 Medprompt en noggrannhet på 90,2% — en ökning med 22,6 procentenheter jämfört med det bästa resultatet år 2022. Sedan benchmark skapades 2019 har AI:s prestanda på MedQA nästan tredubblats. Anmärkningsvärt är att GPT-4 Medprompt använde prompt-ingenjörskonst istället för fine-tuning och överpresterade specialiserade medicinska modeller[24].
MediTron-70B — en öppen medicinsk LLM som uppnådde 70,2% på MedQA — det bästa resultatet bland modeller med öppen källkod, även om det understiger de slutna modellerna GPT-4 Medprompt och Med-PaLM 2[25].
Medicinska innovationer. Bland betydelsefulla system från 2023: SynthSR (förbättring av visualisering av hjärnstrukturer från lågkvalitativa MRT-skanningar), ImmunoSEIRA (AI-infraröda sensorer för diagnostik av neurodegenerativa sjukdomar), EVEscape (prognos för virusevolution för att förhindra pandemier), AlphaMissense (klassificering av missense-mutationer)[1].
FDA-godkännanden. Under 2022 godkände FDA 139 AI-baserade medicintekniska produkter — en ökning med 12,1% jämfört med 2021. Sedan 2012 har antalet sådana godkännanden ökat mer än 45 gånger[26].
Kapitel 6. Utbildning
Kapitlet behandlar trender inom utbildning inom datavetenskap och AI[1].
Högre utbildning
Antalet kandidatexaminerade i datavetenskap i USA och Kanada fortsätter att öka. Antalet mastersstudenter förblir relativt stabilt, och antalet doktorer ökar blygsamt. Sedan 2018 har antalet master- och doktorsexaminerade i datavetenskap minskat något[1].
Andelen internationella studenter minskade på alla utbildningsnivåer, med en särskilt märkbar nedgång på masternivå. Globalt sett har antalet engelskspråkiga utbildningsprogram relaterade till AI tredubblats sedan 2017[1].
ChatGPT inom utbildning
Enligt en enkätundersökning från Walton Foundation anser 88% av lärarna och 79% av studenterna att ChatGPT har en positiv inverkan på utbildningsprocessen. 76% av lärarna och 65% av studenterna anser att det är viktigt att integrera ChatGPT i undervisningen[27].
Kapitel 7. Politik och styrning
Kapitlet analyserar lagstiftnings- och regleringsaktiviteten inom AI på global, amerikansk och europeisk nivå[1].
Globala trender
Nämnanden av AI i lagstiftningsprocesser runt om i världen nådde rekordnivåer. Det sker en förskjutning från rent stimulerande åtgärder mot restriktiv lagstiftning, vilket vittnar om tillsynsmyndigheternas ökade uppmärksamhet på AI:s potentiella risker[1].
Ämnesområdena för de lagar som antogs under 2023 utvidgades avsevärt och kom att omfatta armed forces och nationell säkerhet, medborgerliga rättigheter, handel, utbildning, arbetsrelationer, vetenskap och teknik[1].
Reglering i USA
Antalet AI-relaterade föreskrifter nådde 25 under 2023 (en ökning med 56,3% jämfört med 2022). Det vanligast förekommande ämnesområdet var utrikeshandel och internationella finanser. Andelen föreskrifter med hög och medelhög relevans för AI ökade jämfört med tidigare år[1].
Ett epokgörande händelse under 2023 var president Bidens Executive Order on AI, som bland annat syftade till att inrätta National AI Research Resource för att säkerställa lika villkor mellan industri och akademi[28].
Reglering i EU
Inom Europeiska unionen observeras en liknande tendens mot ett ökat antal AI-relaterade föreskrifter. En viktig milstolpe under 2023 var framstegen med AI Act — den första heltäckande AI-lagen i världen[1].
Kapitel 8. Mångfald
Kapitlet undersöker könsmässig och etnisk mångfald bland AI-specialister. Trots vissa framsteg är kvinnor och representanter för minoriteter fortfarande kraftigt underrepresenterade inom AI-sektorn, såväl i industrin som i akademin[1].
Kapitel 9. Allmänhetens åsikter
Kapitlet analyserar allmänhetens uppfattning om AI utifrån internationella enkätundersökningar och data från sociala medier[1].
Internationella enkätundersökningar
Medvetenhet och oro. Enligt Ipsos anser 66% av respondenterna (en ökning från 60%) att AI avsevärt kommer att påverka deras liv under de kommande 3–5 åren. Dessutom uttrycker 52% nervositet inför AI-produkter (en ökning med 13 procentenheter sedan 2022)[4].
Ekonomiska förväntningar. Enbart 37% av respondenterna anser att AI kommer att förbättra deras arbete, 34% att det kommer att förbättra ekonomin och 32% att det kommer att påverka arbetsmarknaden positivt[4].
Demografiska skillnader. Yngre generationer är betydligt mer optimistiska: 59% av generation Z anser att AI kommer att förbättra underhållning, jämfört med 40% av baby boomers. Människor med högre inkomst och utbildning är också mer optimistiska[1].
Kännedom om ChatGPT. Enligt en internationell enkätundersökning från University of Toronto känner 63% av respondenterna till ChatGPT, och av dessa använder ungefär hälften det minst en gång i veckan[29].
Data från sociala medier
En analys från Quid av mer än 7 miljoner inlägg i sociala medier under 2023 visade att modellerna GraphCast och Claude 2.1 fick de högsta positivt inställda sentimentpoängen (net sentiment score). GPT-4 attraherade den största uppmärksamheten under det första kvartalet, medan fokus mot slutet av året förskjöts mot Gemini och Grok[1].
Betydelsefulla AI-modeller 2023
Rapporten registrerar tillkomsten av ett antal viktiga modeller[1]:
| Modell | Utvecklare | Typ | Datum | Betydelse |
|---|---|---|---|---|
| GPT-4 | OpenAI | LLM, multimodal | Mars 2023 | En av de kraftfullaste LLM:erna; leder HELM |
| PaLM 2 | LLM | Maj 2023 | Utvidgade flerspråkiga förmågor | |
| Llama 2 | Meta | LLM (öppen) | Juli 2023 | Ledande öppen modell; versioner 7B/13B/70B |
| Claude 2 / 2.1 | Anthropic | LLM | Juli / November 2023 | Kontextfönster upp till 200K token |
| Mistral 7B | Mistral AI | LLM (öppen) | September 2023 | Kompakt högpresterande modell |
| DALL-E 3 | OpenAI | Bildgenerering | Oktober 2023 | Förbättrad kvalitet och prompt-följsamhet |
| Gemini / Gemini Ultra | LLM, multimodal | December 2023 | Första LLM som överträffade människan på MMLU | |
| Mixtral 8×7B | Mistral AI | LLM (MoE, öppen) | December 2023 | Mixture-of-Experts-arkitektur |
| Midjourney v6 | Midjourney | Bildgenerering | December 2023 | Förbättrad kvalitet och intuitiva prompt |
| Whisper v3 | OpenAI | Taligenkänning | November 2023 | Ökad noggrannhet, utökat språkstöd |
Metodik
Rapporten använder data från ett flertal källor[1]:
- Publikationer och patent: OpenAlex, WIPO, USPTO, data från Epoch AI.
- Benchmark: Papers With Code, CRFM (HELM), specialiserade topplistor.
- Investeringar: Quid (Capital IQ, Crunchbase), data om mer än 8 miljoner företag.
- Arbetsmarknad: Lightcast, LinkedIn, Stack Overflow.
- Företagsaktivitet: McKinsey & Company, Seeking Alpha (earnings calls).
- Robotteknik: International Federation of Robotics (IFR).
- Reglering: Federal Register (USA), EUR-Lex (EU), Govini.
- Allmänhetens åsikter: Ipsos, Pew Research Center, University of Toronto (GPO-AI), Quid (sociala medier).
- Utbildning: CRA Taulbee Survey, Informatics Europe, Studyportals, Code.org, Walton Foundation.
- Medicin: FDA, Papers With Code (MedQA).
Uppskattningarna av modellernas träningskostnader togs fram i samarbete med Epoch AI baserat på analys av typ och mängd maskinvara, träningens varaktighet och molnhyrespriser[2].
Författargrupp
Rapporten togs fram under ledning av medordförande Ray Perrault och Jack Clark med deltagande av ett brett nätverk av forskare och partnerorganisationer. AI Index är ett projekt vid Stanfords HAI-institut (Human-Centered Artificial Intelligence)[1].
Externa länkar
- Stanford HAI — AI Index Report 2024 (fulltext): https://aiindex.stanford.edu/report/
- Epoch AI — data om träningskostnader och beräkningstrender: https://epochai.org/
- Papers With Code — benchmark och topplistor: https://paperswithcode.com/
- CRFM HELM — Holistic Evaluation of Language Models: https://crfm.stanford.edu/helm/
- AI Incident Database: https://incidentdatabase.ai/
- International Federation of Robotics: https://ifr.org/
- McKinsey Global Survey on AI: https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
Litteratur
- Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/
- Epoch AI (2023). AI Training Cost Estimates and Compute Trends. https://epochai.org/
- Liang, P. et al. (2022). Holistic Evaluation of Language Models. https://arxiv.org/abs/2211.09110
- Hendrycks, D. et al. (2021). Measuring Massive Multitask Language Understanding. https://arxiv.org/abs/2009.03300
- Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. https://arxiv.org/abs/2311.16502
- Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
- Gandhi, K. et al. (2023). Understanding Social Reasoning in Language Models with Language Models. https://arxiv.org/abs/2306.15448
- Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? https://arxiv.org/abs/2304.15004
- Chen, L. et al. (2023). How Is ChatGPT's Behavior Changing over Time? https://arxiv.org/abs/2307.09009
- Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. https://arxiv.org/abs/2305.16291
- Mankowitz, D. J. et al. (2023). Faster sorting algorithms discovered using deep reinforcement learning. Nature. https://doi.org/10.1038/s41586-023-06004-9
- Lam, R. et al. (2023). Learning skillful medium-range global weather forecasting. Science. https://doi.org/10.1126/science.adi2336
- Merchant, A. et al. (2023). Scaling deep learning for materials discovery. Nature. https://doi.org/10.1038/s41586-023-06735-9
- Ha, T. et al. (2023). AI-driven robotic chemist for autonomous synthesis of organic molecules. Science Advances. https://doi.org/10.1126/sciadv.adj0461
- Shen, T. et al. (2023). Flexible Isosurface Extraction for Gradient-Based Mesh Optimization. ACM Transactions on Graphics. https://doi.org/10.1145/3592430
- Nori, H. et al. (2023). Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine. https://arxiv.org/abs/2311.16452
- Chen, Z. et al. (2023). MEDITRON-70B: Scaling Medical Pretraining for Large Language Models. https://arxiv.org/abs/2311.16079
- Mai, K. T. et al. (2023). Warning: Humans Cannot Reliably Detect Speech Deepfakes. https://arxiv.org/abs/2301.07829
- Motoki, F. et al. (2023). More Human than Human: Measuring ChatGPT Political Bias. https://doi.org/10.1007/s11127-023-01097-2
- McKinsey & Company (2023). The State of AI in 2023: Generative AI's Breakout Year. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
- International Federation of Robotics (2023). World Robotics Report 2023. https://ifr.org/worldrobotics/
- The White House (2023). Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence. https://www.whitehouse.gov/briefing-room/presidential-actions/2023/10/30/executive-order-on-the-safe-secure-and-trustworthy-development-and-use-of-artificial-intelligence/
- Fleming, S. L. et al. (2023). MedAlign: A Clinician-Generated Dataset for Instruction Following With Electronic Medical Records. https://arxiv.org/abs/2308.14089
- Iglesias, J. E. et al. (2023). SynthSR: A public AI tool to turn heterogeneous clinical brain scans into high-resolution T1-weighted images for 3D morphometry. Science Advances. https://doi.org/10.1126/sciadv.add3607
- Cheng, J. et al. (2023). Accurate Proteome-Wide Missense Variant Effect Prediction With AlphaMissense. Science. https://doi.org/10.1126/science.adg7492
Noter
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/
- ↑ 2.0 2.1 2.2 Epoch AI (2023). AI Training Cost Estimates. https://epochai.org/
- ↑ 3.0 3.1 3.2 3.3 3.4 Quid (2023). AI Investment Data. https://quid.com/
- ↑ 4.0 4.1 4.2 Ipsos (2023). Global Perceptions of AI Survey. https://www.ipsos.com/
- ↑ Pew Research Center (2023). Public Views on AI. https://www.pewresearch.org/
- ↑ Liang, P. et al. (2022). Holistic Evaluation of Language Models. https://arxiv.org/abs/2211.09110
- ↑ Hendrycks, D. et al. (2021). Measuring Massive Multitask Language Understanding. https://arxiv.org/abs/2009.03300
- ↑ Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. https://arxiv.org/abs/2311.16502
- ↑ Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
- ↑ Gandhi, K. et al. (2023). Understanding Social Reasoning in Language Models with Language Models. https://arxiv.org/abs/2306.15448
- ↑ Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. https://arxiv.org/abs/2305.16291
- ↑ Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? https://arxiv.org/abs/2304.15004
- ↑ Chen, L. et al. (2023). How Is ChatGPT's Behavior Changing over Time? https://arxiv.org/abs/2307.09009
- ↑ AI Incident Database (2023). https://incidentdatabase.ai/
- ↑ Mai, K. T. et al. (2023). Warning: Humans Cannot Reliably Detect Speech Deepfakes. https://arxiv.org/abs/2301.07829
- ↑ Motoki, F. et al. (2023). More Human than Human: Measuring ChatGPT Political Bias. https://doi.org/10.1007/s11127-023-01097-2
- ↑ McKinsey & Company (2023). The State of AI in 2023: Generative AI's Breakout Year. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
- ↑ International Federation of Robotics (2023). World Robotics Report 2023. https://ifr.org/worldrobotics/
- ↑ Mankowitz, D. J. et al. (2023). Faster sorting algorithms discovered using deep reinforcement learning. Nature. https://doi.org/10.1038/s41586-023-06004-9
- ↑ Lam, R. et al. (2023). Learning skillful medium-range global weather forecasting. Science. https://doi.org/10.1126/science.adi2336
- ↑ Merchant, A. et al. (2023). Scaling deep learning for materials discovery. Nature. https://doi.org/10.1038/s41586-023-06735-9
- ↑ Ha, T. et al. (2023). AI-driven robotic chemist for autonomous synthesis of organic molecules. Science Advances. https://doi.org/10.1126/sciadv.adj0461
- ↑ Shen, T. et al. (2023). Flexible Isosurface Extraction for Gradient-Based Mesh Optimization. ACM Transactions on Graphics. https://doi.org/10.1145/3592430
- ↑ Nori, H. et al. (2023). Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine. https://arxiv.org/abs/2311.16452
- ↑ Chen, Z. et al. (2023). MEDITRON-70B: Scaling Medical Pretraining for Large Language Models. https://arxiv.org/abs/2311.16079
- ↑ U.S. Food and Drug Administration (2023). Artificial Intelligence and Machine Learning (AI/ML)-Enabled Medical Devices. https://www.fda.gov/medical-devices/software-medical-device-samd/artificial-intelligence-and-machine-learning-aiml-enabled-medical-devices
- ↑ Impact Research / Walton Family Foundation (2023). ChatGPT and Education Survey. https://www.waltonfamilyfoundation.org/
- ↑ The White House (2023). Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence. https://www.whitehouse.gov/briefing-room/presidential-actions/2023/10/30/executive-order-on-the-safe-secure-and-trustworthy-development-and-use-of-artificial-intelligence/
- ↑ Global Public Opinion on AI Survey, University of Toronto (2023). https://www.mediatechdemocracy.com/