The 2024 AI Index Report (HU)
AI Index Report 2024 — az AI Index hetedik éves kiadása, amelyet a Stanford Humánközpontú Mesterséges Intelligencia Intézete (Stanford HAI) készített[1]. A 2024-es jelentés a kiadvány eddigi történetének legátfogóbb kiadása, és abban a pillanatban jelenik meg, amikor az MI társadalomra gyakorolt hatása példátlanul szembetűnővé válik. A kiadvány tartalmaz új becsléseket a modellek tanítási költségeiről, részletes elemzést a felelős MI-ről, és először tartalmaz önálló fejezetet az MI tudományra és orvostudományra gyakorolt hatásáról. A jelentés nyomon követi, rendszerezi és vizualizálja a mesterséges intelligenciával kapcsolatos adatokat, objektív és gondosan ellenőrzött információkat nyújtva politikusok, kutatók, vezetők, újságírók és a széles nyilvánosság számára.
A jelentés szerkezete
A 2024-es jelentés kilenc tematikus fejezetből áll[1]:
- Kutatás és fejlesztés (Research and Development) — trendek a publikációkban, szabadalmakban, alapmodellekben és nyílt projektekben.
- Technikai teljesítmény (Technical Performance) — benchmark-ok, összehasonlítás az emberi szinttel, multimodalitás.
- Felelős MI (Responsible AI) — incidensek, biztonság, elfogultság, adatvédelem.
- Gazdaság (Economy) — befektetések, munkaerőpiac, vállalati bevezetés, robotizáció.
- Tudomány és orvostudomány (Science and Medicine) — új fejezet: áttörések az MI tudományos és orvosi alkalmazásaiban.
- Oktatás (Education) — szakemberképzés, oktatási programok, ChatGPT az oktatásban.
- Politika és irányítás (Policy and Governance) — jogszabályok, szabályozás, nemzeti stratégiák.
- Sokszínűség (Diversity) — nemi és etnikai sokszínűség az MI területén.
- Közvélemény (Public Opinion) — a lakosság MI-hez való viszonya nemzetközi felmérések adatai alapján.
A jelentés főbb megállapításai (Top 10)
A jelentés szerzői tíz fő tézist emeltek ki 2024-re[1]:
1. Az MI számos feladatban felülmúlja az embereket, de nem mindenben
A mesterséges intelligencia rendszerek több benchmark-on is meghaladták az emberi szintet, köztük a képosztályozásban (ImageNet), a vizuális következtetésben (VQA) és az angol nyelv megértésében (SuperGLUE). Ugyanakkor az MI még mindig elmarad az emberektől az összetettebb feladatokban: olimpiai szintű matematikában (MATH), vizuális mindennapi következtetésben és tervezésben[1].
2. Az ipar dominál az élvonalbeli MI-kutatásokban
2023-ban az ipar 51 jelentős gépi tanulási modellt hozott létre, míg az akadémia csupán 15-öt. Emellett 21 modell az ipar és az akadémia együttműködéséből született — ez rekordszintű eredmény[1].
3. Az élvonalbeli modellek tanítási költsége meredeken emelkedik
Az AI Index és az Epoch AI becslései szerint a GPT-4 tanítási költsége mintegy 78 millió dollár volt, a Google Gemini Ultráé pedig körülbelül 191 millió dollár[2]. Összehasonlításképpen: az eredeti Transformer modell tanítása 2017-ben körülbelül 900 dollárba, a RoBERTa Large-é 2019-ben pedig mintegy 160 ezer dollárba került[1].
4. Az USA vezet a legjelentősebb MI-modellek forrásaként
2023-ban 61 jelentős MI-modellt hoztak létre az USA szervezetei, jóval megelőzve az EU-t (21 modell) és Kínát (15 modell)[1].
5. Az LLM-ek felelősségi értékelésének szabványosítása komolyan elmarad
Az AI Index kutatása jelentős standardizációhiányt tárt fel a felelős MI-re vonatkozó jelentési gyakorlatban. A vezető fejlesztők — az OpenAI, a Google és az Anthropic — különböző felelős MI benchmark-okon tesztelik modelljeiket, ami megnehezíti a kockázatok szisztematikus összehasonlítását[1].
6. A generatív MI-be irányuló befektetések rohamosan növekednek
Annak ellenére, hogy a magánbefektetések összességében csökkentek az MI területén, a generatív MI finanszírozása közel nyolcszorosára nőtt 2022-höz képest, elérve a 25,2 milliárd dollárt. Nagy finanszírozási köröket hajtott végre az OpenAI, az Anthropic, a Hugging Face és az Inflection[3].
7. Az MI növeli a termelékenységet és a munka minőségét
Számos 2023-as kutatás kimutatta, hogy az MI segít a dolgozóknak gyorsabban és magasabb minőségben elvégezni feladataikat, és csökkenti a különbséget az alacsony és magasan képzett szakemberek között. Ugyanakkor néhány tanulmány figyelmeztet arra, hogy az MI megfelelő felügyelet nélküli alkalmazása termelékenységcsökkenéshez vezethet[1].
8. A tudományos haladás az MI révén felgyorsul
2023-ban számos jelentős MI-alapú tudományos alkalmazás jelent meg: AlphaDev (rendezési algoritmusok felgyorsítása), GNoME (új anyagok felfedezése), GraphCast (időjárás-előrejelzés) és mások[1].
9. Az MI-re vonatkozó jogszabályok száma az USA-ban meredeken emelkedett
2023-ban 25 MI-hez kapcsolódó jogszabályt fogadtak el — ez 56,3%-os növekedés az előző évhez képest. Összehasonlításképpen: 2016-ban csupán egyetlen ilyen jogszabályt fogadtak el[1].
10. Az emberek egyre inkább tudatában vannak az MI hatásának — és egyre inkább aggódnak miatta
Az Ipsos adatai szerint a válaszadók azon aránya, akik szerint az MI jelentősen befolyásolja majd életüket a következő 3–5 évben, 60%-ról 66%-ra nőtt. Emellett 52% fejez ki szorongást az MI-termékekkel és -szolgáltatásokkal kapcsolatban — ez 13 százalékpontos növekedés 2022 óta. Az USA-ban a Pew Research adatai szerint az amerikaiak 52%-a inkább aggodalmasnak, mint lelkesítőnek tartja az MI-t (2022-ben ez az arány 37% volt)[4][5].
1. fejezet. Kutatás és fejlesztés
A fejezet elemzi a publikációk, szabadalmak, élvonalbeli MI-rendszerek, alapmodellek (foundation models), konferenciák és nyílt forráskódú projektek trendjeit[1].
Publikációk
Az MI-vel kapcsolatos publikációk száma tovább növekszik: a 2010-es körülbelül 88 000-ről 2022-ben több mint 240 000-re (közel háromszoros növekedés). Az utolsó évi növekedés 1,1% volt[1].
Szabadalmak
A világban kiadott MI-szabadalmak száma meredeken emelkedett: 2021 és 2022 között 62,7%-os növekedés következett be, 2010 óta pedig több mint 31-szeresére nőtt. Kína dominálja az MI-szabadalmazást: 2022-ben a szabadalmi bejelentések 61,1%-a kínai volt, míg az USA részesedése 20,9% volt (csökkent a 2010-es 54,1%-ról)[1].
Élvonalbeli modellek
2023-ban az ipar tovább dominált az élvonalbeli modellek létrehozásában. 149 alapmodell jelent meg — kétszer annyi, mint 2022-ben. Ezek 65,7%-a nyílt forráskódú volt (szemben a 2022-es 44,4%-kal és a 2021-es 33,3%-kal)[1].
Tanítási költségek. Az AI Index és az Epoch AI együttműködése lehetővé tette a modellek tanítási költségeire vonatkozó pontosított becslések megszerzését. A kiadások növekedését a következő dinamika szemlélteti[2]:
| Modell | Év | Becsült tanítási költség (USD) |
|---|---|---|
| Transformer | 2017 | ~930 |
| BERT-Large | 2018 | ~3 300 |
| RoBERTa Large | 2019 | ~160 000 |
| GPT-3 175B | 2020 | ~4,3 millió |
| PaLM 540B | 2022 | ~12,4 millió |
| Llama 2 70B | 2023 | ~3,9 millió |
| GPT-4 | 2023 | ~78 millió |
| Gemini Ultra | 2023 | ~191 millió |
Nemzeti hovatartozás. 2023-ban 61 jelentős modellt hoztak létre az USA szervezetei, 21-et az EU, 15-öt Kína szervezetei. Ez megerősíti az USA vezető szerepét az élvonalbeli MI-rendszerek fejlesztésében[1].
Nyílt forráskódú szoftverek
A GitHubon található MI-projektek száma folyamatosan növekszik: a 2011-es 845-ről 2023-ban körülbelül 1,8 millióra. 2023-ban 59,3%-os növekedést rögzítettek. Az MI-projektek csillagainak száma megháromszorozódott: 2022-ben 4,0 millióról 2023-ban 12,2 millióra nőtt[1].
Konferenciák
A vezető MI-konferenciák (NeurIPS, ICML, ICLR stb.) látogatottsága tovább növekedett, tükrözve a terület iránti növekvő érdeklődést[1].
2. fejezet. Technikai teljesítmény
A fejezet elemzi az MI-rendszerek előrehaladását a nyelvfeldolgozás, képgenerálás, következtetés, kódolás és ágens-viselkedés területén[1].
Az MI teljesítményének jelenlegi helyzete
2023 állapotát tekintve az MI több feladatkategóriában meghaladja az emberi szintet: képosztályozásban (2015 óta), alapvető szövegmegértésben (2017 óta), vizuális következtetésben (2020 óta), természetes nyelvi következtetésben (2021 óta). Azonban olyan feladatokban, mint az olimpiai szintű matematika (MATH) és a tervezés, az MI egyelőre elmarad az emberektől[1].
Nyelvi modellek
HELM. A Stanfordon kidolgozott Holistic Evaluation of Language Models (HELM) benchmark tíz forgatókönyv szerint értékeli az LLM-eket, köztük szövegmegértés, matematika és jogi következtetés. 2024 januárjától a GPT-4 vezet 0,96-os mean win rate mutatóval[6].
MMLU. A Massive Multitask Language Understanding (MMLU) benchmark 57 szakterületen értékeli a modelleket. A Google Gemini Ultra volt az első, amely meghaladta az emberi alapszintet (89,8%), 90,0%-ot érve el — ez 14,8 százalékpontos javulás 2022-höz képest és 57,6 százalékpontos javulás a benchmark 2019-es létrehozása óta[7].
Chatbot Arena. A 2023-ban indított platform lehetővé teszi a felhasználók számára, hogy névtelen modellek generációit hasonlítsák össze. 2024 elejétől a GPT-4 Turbo-t tartják a leginkább preferált modellnek több mint 200 000 szavazat alapján[1].
Multimodalitás
Hagyományosan az MI-rendszerek egyetlen modalitásra korlátozódtak. 2023-ban azonban megjelentek a hatékony multimodális modellek — a Google Gemini és az OpenAI GPT-4 —, amelyek képesek szöveget, képeket, egyes esetekben hangot is feldolgozni. Az MMMU (Massive Multi-discipline Multimodal Understanding) benchmark megmutatta, hogy a Gemini Ultra vezet 59,4%-kal, de ez lényegesen elmarad a szakértői emberi szinttől (82,6%)[8].
Következtetés
GPQA. A Graduate-Level Google-Proof Q&A benchmark 448 összetett kérdést tartalmaz biológia, fizika és kémia területéről, amelyekre egyszerű Google-kereséssel nem lehet válaszolni. A GPT-4 kereséssel 41,0%-ot ért el, ami elmarad a szakértők szintjétől (72,5%), de meghaladja a nem szakértőkét (30,5%)[9].
Tudatelméleti tesztelés (BigToM). Az LLM-ek azon képességének tesztelése, hogy képesek-e modellezni mások meggyőződését, megmutatta, hogy a GPT-4 megközelíti az emberi szintet a közvetlen meggyőződés- és cselekvéskövetkeztetési feladatokban, bár még mindig elmarad a visszafelé irányuló meggyőződés-következtetési feladatokban[10].
Kódolás
A HumanEval benchmark értékeli a kódgenerálást. 2023-ban a modellek tovább javították eredményeiket, az SWE-bench — a valós szoftvermérnöki feladatok megoldásának értékelésére szolgáló új benchmark — megmutatta, hogy még a legjobb modellek is csak kis töredékét oldják meg a feladatoknak, ami jelentős fejlődési potenciálra utal[1].
Ágensviselkedés
Az MI-rendszereket egyre inkább tesztelik ágenses forgatókönyvekben. A Voyager (Microsoft) bemutatta az önálló tanulás képességét a Minecraft dinamikus környezetében, 3,3-szor több egyedi tárgyat gyűjtve, 2,3-szor nagyobb távolságot megtéve és 15,3-szor gyorsabban elérve a kulcsmérföldköveket az előző modellekhez képest[11]. Az MLAgentBench megmutatta, hogy a tudományos kutatásra szánt MI-ágensek ígéretes lehetőségeket kínálnak, de az eredmények feladatonként lényegesen eltérnek[1].
LLM-tulajdonságok
Emergens viselkedés. Egy 2023-as tanulmány megkérdőjelezte azt az elképzelést, hogy a modellek méretezésekor elkerülhetetlenül megjelennek kiszámíthatatlan „emergens" képességek. Lineáris és folytonos metrikák alkalmazásakor ezek a képességek nagyrészt eltűnnek[12].
Teljesítményromlás. A Stanford és Berkeley közös kutatása megmutatta, hogy a GPT-4 teljesítménye lényegesen változhat frissítések között: a 2023 júniusi verzió 42 százalékponttal gyengébben teljesített a márciusi verzióhoz képest kódgenerálásban és 33 százalékponttal gyengébben matematikai feladatokban[13].
Önkorrekció. A DeepMind és az Illinoisi Egyetem kutatói megmutatták, hogy az LLM-ek külső útmutatás nélkül nem képesek megfelelően korrigálni saját következtetéseiket: a GPT-4 teljesítménye az összes tesztelt benchmark-on csökkent önkorrekciós kísérlet során[1].
3. fejezet. Felelős MI
A fejezet a felelős MI kulcsdimenzióival foglalkozik: adatvédelem, átláthatóság, biztonság és méltányosság[1].
MI-incidensek
Az AI Incident Database 2023-ban 123 incidenst rögzített — ez 32,3%-os növekedés 2022-höz képest. 2013 óta az incidensek száma több mint húszszorosára nőtt. A növekedés oka egyrészt az MI alkalmazásának bővülése, másrészt az etikai kockázatokkal kapcsolatos tudatosság növekedése[14].
A felelős MI benchmark-ok szabványosítása
Öt vezető fejlesztő (OpenAI, Meta, Anthropic, Google, Mistral AI) elemzése kimutatta, hogy nincs egységes benchmark-készlet a felelős MI értékelésére. Bár az általános képességek benchmark-jait (MMLU, HellaSwag, ARC Challenge, HumanEval, GSM8K) széles körben alkalmazzák, a felelős MI benchmark-jait (TruthfulQA, RealToxicityPrompts, ToxiGen, BOLD, BBQ) széttagoltan használják: a TruthfulQA-t legfeljebb három fejlesztő alkalmazza az ötből, és az egyik fejlesztő egyáltalán nem számol be felelős MI benchmark-okon végzett tesztelésről[1].
MI és választások
A 2023-as kutatások megmutatták, hogy az emberek csupán az esetek 73%-ában azonosítják helyesen a hangalapú deepfake-eket. Várható, hogy a hangszintézis technológiájának fejlődésével az azonosítás pontossága csökkenni fog. Ez kockázatot jelent a politikai kampányok manipulálása szempontjából, és lehetőséget ad a politikusoknak arra, hogy kompromittáló hangfelvételeket hamisítványként utasítsanak el (az úgynevezett „hazug dividenda")[15].
Az LLM-ek politikai elfogultságát vizsgáló kutatások összefüggést tártak fel a ChatGPT alapértelmezett válaszai és a Demokrata Párt álláspontjai között, valamint negatív összefüggést a Republikánus Párt álláspontjaival[16].
4. fejezet. Gazdaság
A fejezet a befektetések, a foglalkoztatás, a vállalati MI-bevezetés és a robotizáció trendjeit vizsgálja[1].
Befektetések
Általános trendek. Az MI-be irányuló összesített vállalati befektetések 189,2 milliárd dollárra csökkentek 2023-ban (körülbelül 20%-os visszaesés 2022-höz képest). Ugyanakkor az évtized alatt a befektetések volumene tizenhárom-szorosára nőtt. A magánbefektetések második egymást követő évben csökkentek, bár a visszaesés kevésbé volt kifejezett, mint 2021–2022-ben[3].
Generatív MI. A generatív MI-be irányuló befektetések 25,2 milliárd dollárt tettek ki — ez közel kilencszeres növekedés 2022-höz képest és harmincszorosnövekedés 2019-hez képest. A generatív MI az összes MI-magánbefektetés több mint negyedét adta[3].
Regionális megoszlás. Az USA 67,2 milliárd dolláros befektetéseivel 8,7-szer megelőzte Kínát (7,8 milliárd) és 17,8-szor az Egyesült Királyságot (3,8 milliárd). Eközben a magánbefektetések Kínában 44,2%-kal, az EU-ban és az Egyesült Királyságban 14,1%-kal csökkentek, míg az USA-ban 22,1%-kal nőttek[3].
Startupok. A finanszírozásban részesült új MI-vállalatok száma 1 812-re nőtt (40,6%-os növekedés). A generatív MI területén 99 új startup kapott finanszírozást (szemben a 2022-es 56-tal)[3].
Munkaerőpiac
Az MI-hez kapcsolódó állásajánlatok aránya az USA-ban 2,0%-ról (2022) 1,6%-ra csökkent 2023-ban. Hasonló tendencia figyelhető meg globálisan. A csökkenés oka a nagyvállalatok csökkentett felvételi aktivitása és a műszaki jellegű állásajánlatok arányának visszaesése[1].
Az MI-szakemberek migrációja az akadémiából az iparba tovább gyorsul: 2022-ben az MI-területen doktori fokozatot szerzők 70,7%-a az iparban helyezkedett el (szemben a 2011-es 40,9%-kal), és mindössze 20,0%-uk az akadémián (szemben a 41,6%-kal)[1].
Vállalati bevezetés
A McKinsey adatai szerint a szervezetek 55%-a alkalmaz MI-t (beleértve a generatív MI-t) legalább egy üzleti egységben — ez növekedés a 2022-es 50%-ról és a 2017-es 20%-ról. Emellett a szervezetek 42%-a számol be költségcsökkentésről, 59%-a pedig bevételnövekedésről az MI révén[17].
A Fortune 500 vállalatok eredményjelentéseiben az MI-re való hivatkozások száma elérte a 394-et (az összes vállalat közel 80%-a) — ez figyelemre méltó növekedés a 2022-es 266-hoz képest. A leggyakrabban említett téma (az összes hívás 19,7%-ában) a generatív MI volt[1].
Robotika
2022-ben 553 000 ipari robotot telepítettek — ez 5,1%-os növekedés 2021-hez képest és több mint háromszoros növekedés 2012-höz képest. Kína dominál: 2013 óta, amikor megelőzte Japánt, Kína részesedése a globális telepítésekből 20,8%-ról 52,4%-ra nőtt 2022-ben. A kollaboratív robotok aránya 2017-es 2,8%-ról 2022-re 9,9%-ra emelkedett[18].
5. fejezet. Tudomány és orvostudomány
A jelentésbe először bekerült fejezet az MI szerepét tárgyalja a tudományos felfedezések és orvosi innovációk területén[1].
2023-as tudományos eredmények
AlphaDev (DeepMind) — megerősítéses tanulási rendszer, amely kevesebb utasítással rendelkező rendezési algoritmusokat fedezett fel, mint a meglévő emberi referenciaértékek. Néhány megtalált algoritmust beépítettek a C++ szabványos rendezési könyvtárába (LLVM) — ez az első frissítés a könyvtár ezen részében több mint tíz év óta[19].
GraphCast (DeepMind) — gráf neurális hálózatokon alapuló időjárás-előrejelző rendszer, amely kevesebb mint egy perc alatt 10 napos előrejelzést nyújt, meghaladva a vezető HRES modellezési rendszer (Európai Középtávú Időjárás-előrejelzési Központ) pontosságát[20].
GNoME (Google DeepMind) — gráfhálózatokat alkalmazó modell az új funkcionális anyagok gyorsított keresésére, ami kritikusan fontos a robotika és a félvezető-ipar fejlődése szempontjából[21].
Synbot — MI-vezérelt kémiairobotrendszer szerves molekulák autonóm szintéziséhez, amely a referencia-értékekkel összehasonlítható vagy azokat meghaladó reakcióhozamot ért el[22].
FlexiCubes (NVIDIA) — MI-vel támogatott 3D mesh optimalizálási módszer a 3D objektumok generálásának minőségi javítására a számítógépes grafikában[23].
MI az orvostudományban
Klinikai tudás. A MedQA benchmark-on (az MI klinikai tudásának értékelése) a GPT-4 Medprompt modell 90,2%-os pontosságot ért el — ez 22,6 százalékpontos növekedés a 2022-es legjobb eredményhez képest. A benchmark 2019-es létrehozása óta az MI teljesítménye a MedQA-n közel megháromszorozódott. Figyelemre méltó, hogy a GPT-4 Medprompt prompt-tervezést alkalmazott finomhangolás helyett, felülmúlva a speciális orvosi modelleket[24].
MediTron-70B — nyílt forráskódú orvosi LLM, amely 70,2%-ot ért el a MedQA-n — ez a legjobb eredmény a nyílt forráskódú modellek körében, bár elmarad a zárt GPT-4 Medprompt és Med-PaLM 2 modellek eredményeitől[25].
Orvosi innovációk. A 2023-as jelentős rendszerek közé tartozik: SynthSR (agyszerkezetek megjelenítésének javítása alacsony minőségű MRI-felvételekből), ImmunoSEIRA (MI-alapú infravörös érzékelők neurodegeneratív betegségek diagnosztizálásához), EVEscape (vírusok evolúciójának előrejelzése a járványok megelőzése érdekében), AlphaMissense (misszensz mutációk osztályozása)[1].
FDA-jóváhagyások. 2022-ben az FDA 139 MI-alapú orvosi eszközt hagyott jóvá — ez 12,1%-os növekedés 2021-hez képest. 2012 óta az ilyen jóváhagyások száma több mint 45-szörösére nőtt[26].
6. fejezet. Oktatás
A fejezet az informatika és az MI területén tapasztalható oktatási trendeket vizsgálja[1].
Felsőoktatás
Az informatika alapszakon végzett hallgatók száma az USA-ban és Kanadában tovább növekszik. A mesterszakosok száma viszonylag stabil marad, a doktori fokozatot szerzők száma pedig szerényen emelkedik. 2018 óta az informatikán végzett mesterek és doktorok száma kissé csökkent[1].
A külföldi hallgatók aránya csökkent az oktatás minden szintjén, különösen szembeötlően a mesterképzésben. Globális szinten az MI-hez kapcsolódó angol nyelvű képzési programok száma 2017 óta megháromszorozódott[1].
ChatGPT az oktatásban
A Walton Foundation felmérése szerint a tanárok 88%-a és a diákok 79%-a úgy véli, hogy a ChatGPT pozitív hatással van az oktatási folyamatra. A tanárok 76%-a és a diákok 65%-a gondolja, hogy a ChatGPT integrálása az oktatásba fontos[27].
7. fejezet. Politika és irányítás
A fejezet a globális, az amerikai és az európai MI-jogalkotási és szabályozási aktivitást elemzi[1].
Globális tendenciák
Az MI-re való hivatkozások a világ jogalkotási folyamataiban rekordszintet értek el. Eltolódás tapasztalható a tisztán ösztönző intézkedésektől a korlátozó jogalkotás felé, ami azt jelzi, hogy a szabályozók egyre nagyobb figyelmet fordítanak az MI potenciális kockázataira[1].
A 2023-ban elfogadott törvények tematikája jelentősen bővült, kiterjedve a fegyveres erőkre és a nemzetbiztonságra, a polgári jogokra, a kereskedelemre, az oktatásra, a munkaügyi kapcsolatokra, a tudományra és a technológiára[1].
Szabályozás az USA-ban
Az MI-hez kapcsolódó jogszabályok száma 25-re nőtt 2023-ban (56,3%-os növekedés 2022-höz képest). A legelterjedtebb témakör a külkereskedelem és a nemzetközi pénzügyek volt. A magas és közepes mértékű MI-relevanciájú jogszabályok aránya nőtt az előző évekhez képest[1].
2023 egyik mérföldköve Biden elnök MI-ről szóló végrehajtási rendelete (Executive Order on AI) volt, amelynek célja többek között a Nemzeti MI-Kutatási Erőforrás (National AI Research Resource) létrehozása az ipar és az akadémia közötti egyenlő lehetőségek biztosítása érdekében[28].
Szabályozás az EU-ban
Az Európai Unióban hasonló tendencia figyelhető meg az MI-hez kapcsolódó jogszabályok számának növekedésében. 2023 jelentős eredménye az AI Act előrehaladása — a világ első átfogó MI-törvénye[1].
8. fejezet. Sokszínűség
A fejezet az MI-szakemberek körében tapasztalható nemi és etnikai sokszínűséget vizsgálja. Bizonyos előrelépés ellenére a nők és a kisebbségek képviselete az MI területén még mindig jelentősen elmarad mind az iparban, mind az akadémián[1].
9. fejezet. Közvélemény
A fejezet az MI társadalmi megítélését elemzi nemzetközi felmérések és közösségi médiaadatok alapján[1].
Nemzetközi felmérések
Tudatosság és aggodalom. Az Ipsos adatai szerint a válaszadók 66%-a (növekedés 60%-ról) úgy véli, hogy az MI jelentősen befolyásolja majd életüket a következő 3–5 évben. Emellett 52% fejez ki szorongást az MI-termékekkel kapcsolatban (13 százalékpontos növekedés 2022 óta)[4].
Gazdasági várakozások. Csupán a válaszadók 37%-a gondolja, hogy az MI javítani fogja munkájukat, 34%, hogy javítani fogja a gazdaságot, és 32%, hogy pozitívan befolyásolja a munkaerőpiacot[4].
Demográfiai különbségek. A fiatalabb generációk lényegesen optimistábbak: a Z-generáció tagjainak 59%-a gondolja, hogy az MI javítani fogja a szórakoztatást, szemben a baby boomerek 40%-ával. A magasabb jövedelmű és magasabb iskolai végzettségű emberek szintén optimistábbak[1].
ChatGPT ismertsége. A Torontói Egyetem nemzetközi felmérése szerint a válaszadók 63%-a ismeri a ChatGPT-t, és közel felük legalább hetente egyszer használja[29].
Közösségi média adatok
A Quid által 2023-ban elemzett több mint 7 millió közösségi médiabejegyzés azt mutatta, hogy a GraphCast és Claude 2.1 modellek kapták a legmagasabb pozitív hangulati mutatót (net sentiment score). A GPT-4 az első negyedévben a figyelem legnagyobb részét vonzotta, míg az év végére a fókusz a Geminire és a Grokra helyeződött[1].
A 2023-as év jelentős MI-modelljei
A jelentés rögzíti számos kulcsfontosságú modell megjelenését[1]:
| Modell | Fejlesztő | Típus | Dátum | Jelentőség |
|---|---|---|---|---|
| GPT-4 | OpenAI | LLM, multimodális | 2023. március | Az egyik legerősebb LLM; a HELM listavezetője |
| PaLM 2 | LLM | 2023. május | Fejlett többnyelvű képességek | |
| Llama 2 | Meta | LLM (nyílt) | 2023. július | Vezető nyílt modell; 7B/13B/70B verziók |
| Claude 2 / 2.1 | Anthropic | LLM | 2023. július / november | Akár 200K token kontextusablak |
| Mistral 7B | Mistral AI | LLM (nyílt) | 2023. szeptember | Kompakt, nagy teljesítményű modell |
| DALL-E 3 | OpenAI | Képgenerálás | 2023. október | Javított minőség és prompt-követés |
| Gemini / Gemini Ultra | LLM, multimodális | 2023. december | Az első LLM, amely meghaladta az embert az MMLU-n | |
| Mixtral 8×7B | Mistral AI | LLM (MoE, nyílt) | 2023. december | Mixture-of-Experts architektúra |
| Midjourney v6 | Midjourney | Képgenerálás | 2023. december | Javított minőség és intuitív promptok |
| Whisper v3 | OpenAI | Hangfelismerés | 2023. november | Növelt pontosság, bővített nyelvi támogatás |
Módszertan
A jelentés számos forrásból gyűjt adatokat[1]:
- Publikációk és szabadalmak: OpenAlex, WIPO, USPTO, Epoch AI adatai.
- Benchmark-ok: Papers With Code, CRFM (HELM), specializált ranglisták.
- Befektetések: Quid (Capital IQ, Crunchbase), több mint 8 millió vállalat adatai.
- Munkaerőpiac: Lightcast, LinkedIn, Stack Overflow.
- Vállalati aktivitás: McKinsey & Company, Seeking Alpha (earnings calls).
- Robotika: International Federation of Robotics (IFR).
- Szabályozás: Federal Register (USA), EUR-Lex (EU), Govini.
- Közvélemény: Ipsos, Pew Research Center, University of Toronto (GPO-AI), Quid (közösségi média).
- Oktatás: CRA Taulbee Survey, Informatics Europe, Studyportals, Code.org, Walton Foundation.
- Orvostudomány: FDA, Papers With Code (MedQA).
A modellek tanítási költségeire vonatkozó becsléseket az Epoch AI-jal közösen készítették, a hardvereszközök típusának és mennyiségének, a tanítás időtartamának és a felhőalapú bérleti díjak elemzése alapján[2].
Szerzői kollektíva
A jelentést Ray Perrault és Jack Clark társigazgatók irányításával készítették, kutatók és partnerszervezetek széles körének közreműködésével. Az AI Index a Stanford HAI (Human-Centered Artificial Intelligence) Intézet projektje[1].
Hivatkozások
- Stanford HAI — AI Index Report 2024 (teljes szöveg): https://aiindex.stanford.edu/report/
- Epoch AI — adatok a tanítási költségekről és számítási trendekről: https://epochai.org/
- Papers With Code — benchmark-ok és ranglisták: https://paperswithcode.com/
- CRFM HELM — Holistic Evaluation of Language Models: https://crfm.stanford.edu/helm/
- AI Incident Database: https://incidentdatabase.ai/
- International Federation of Robotics: https://ifr.org/
- McKinsey Global Survey on AI: https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
Irodalom
- Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/
- Epoch AI (2023). AI Training Cost Estimates and Compute Trends. https://epochai.org/
- Liang, P. et al. (2022). Holistic Evaluation of Language Models. https://arxiv.org/abs/2211.09110
- Hendrycks, D. et al. (2021). Measuring Massive Multitask Language Understanding. https://arxiv.org/abs/2009.03300
- Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. https://arxiv.org/abs/2311.16502
- Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
- Gandhi, K. et al. (2023). Understanding Social Reasoning in Language Models with Language Models. https://arxiv.org/abs/2306.15448
- Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? https://arxiv.org/abs/2304.15004
- Chen, L. et al. (2023). How Is ChatGPT's Behavior Changing over Time? https://arxiv.org/abs/2307.09009
- Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. https://arxiv.org/abs/2305.16291
- Mankowitz, D. J. et al. (2023). Faster sorting algorithms discovered using deep reinforcement learning. Nature. https://doi.org/10.1038/s41586-023-06004-9
- Lam, R. et al. (2023). Learning skillful medium-range global weather forecasting. Science. https://doi.org/10.1126/science.adi2336
- Merchant, A. et al. (2023). Scaling deep learning for materials discovery. Nature. https://doi.org/10.1038/s41586-023-06735-9
- Ha, T. et al. (2023). AI-driven robotic chemist for autonomous synthesis of organic molecules. Science Advances. https://doi.org/10.1126/sciadv.adj0461
- Shen, T. et al. (2023). Flexible Isosurface Extraction for Gradient-Based Mesh Optimization. ACM Transactions on Graphics. https://doi.org/10.1145/3592430
- Nori, H. et al. (2023). Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine. https://arxiv.org/abs/2311.16452
- Chen, Z. et al. (2023). MEDITRON-70B: Scaling Medical Pretraining for Large Language Models. https://arxiv.org/abs/2311.16079
- Mai, K. T. et al. (2023). Warning: Humans Cannot Reliably Detect Speech Deepfakes. https://arxiv.org/abs/2301.07829
- Motoki, F. et al. (2023). More Human than Human: Measuring ChatGPT Political Bias. https://doi.org/10.1007/s11127-023-01097-2
- McKinsey & Company (2023). The State of AI in 2023: Generative AI's Breakout Year. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
- International Federation of Robotics (2023). World Robotics Report 2023. https://ifr.org/worldrobotics/
- The White House (2023). Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence. https://www.whitehouse.gov/briefing-room/presidential-actions/2023/10/30/executive-order-on-the-safe-secure-and-trustworthy-development-and-use-of-artificial-intelligence/
- Fleming, S. L. et al. (2023). MedAlign: A Clinician-Generated Dataset for Instruction Following With Electronic Medical Records. https://arxiv.org/abs/2308.14089
- Iglesias, J. E. et al. (2023). SynthSR: A public AI tool to turn heterogeneous clinical brain scans into high-resolution T1-weighted images for 3D morphometry. Science Advances. https://doi.org/10.1126/sciadv.add3607
- Cheng, J. et al. (2023). Accurate Proteome-Wide Missense Variant Effect Prediction With AlphaMissense. Science. https://doi.org/10.1126/science.adg7492
Megjegyzések
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/
- ↑ 2.0 2.1 2.2 Epoch AI (2023). AI Training Cost Estimates. https://epochai.org/
- ↑ 3.0 3.1 3.2 3.3 3.4 Quid (2023). AI Investment Data. https://quid.com/
- ↑ 4.0 4.1 4.2 Ipsos (2023). Global Perceptions of AI Survey. https://www.ipsos.com/
- ↑ Pew Research Center (2023). Public Views on AI. https://www.pewresearch.org/
- ↑ Liang, P. et al. (2022). Holistic Evaluation of Language Models. https://arxiv.org/abs/2211.09110
- ↑ Hendrycks, D. et al. (2021). Measuring Massive Multitask Language Understanding. https://arxiv.org/abs/2009.03300
- ↑ Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. https://arxiv.org/abs/2311.16502
- ↑ Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
- ↑ Gandhi, K. et al. (2023). Understanding Social Reasoning in Language Models with Language Models. https://arxiv.org/abs/2306.15448
- ↑ Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. https://arxiv.org/abs/2305.16291
- ↑ Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? https://arxiv.org/abs/2304.15004
- ↑ Chen, L. et al. (2023). How Is ChatGPT's Behavior Changing over Time? https://arxiv.org/abs/2307.09009
- ↑ AI Incident Database (2023). https://incidentdatabase.ai/
- ↑ Mai, K. T. et al. (2023). Warning: Humans Cannot Reliably Detect Speech Deepfakes. https://arxiv.org/abs/2301.07829
- ↑ Motoki, F. et al. (2023). More Human than Human: Measuring ChatGPT Political Bias. https://doi.org/10.1007/s11127-023-01097-2
- ↑ McKinsey & Company (2023). The State of AI in 2023: Generative AI's Breakout Year. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
- ↑ International Federation of Robotics (2023). World Robotics Report 2023. https://ifr.org/worldrobotics/
- ↑ Mankowitz, D. J. et al. (2023). Faster sorting algorithms discovered using deep reinforcement learning. Nature. https://doi.org/10.1038/s41586-023-06004-9
- ↑ Lam, R. et al. (2023). Learning skillful medium-range global weather forecasting. Science. https://doi.org/10.1126/science.adi2336
- ↑ Merchant, A. et al. (2023). Scaling deep learning for materials discovery. Nature. https://doi.org/10.1038/s41586-023-06735-9
- ↑ Ha, T. et al. (2023). AI-driven robotic chemist for autonomous synthesis of organic molecules. Science Advances. https://doi.org/10.1126/sciadv.adj0461
- ↑ Shen, T. et al. (2023). Flexible Isosurface Extraction for Gradient-Based Mesh Optimization. ACM Transactions on Graphics. https://doi.org/10.1145/3592430
- ↑ Nori, H. et al. (2023). Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine. https://arxiv.org/abs/2311.16452
- ↑ Chen, Z. et al. (2023). MEDITRON-70B: Scaling Medical Pretraining for Large Language Models. https://arxiv.org/abs/2311.16079
- ↑ U.S. Food and Drug Administration (2023). Artificial Intelligence and Machine Learning (AI/ML)-Enabled Medical Devices. https://www.fda.gov/medical-devices/software-medical-device-samd/artificial-intelligence-and-machine-learning-aiml-enabled-medical-devices
- ↑ Impact Research / Walton Family Foundation (2023). ChatGPT and Education Survey. https://www.waltonfamilyfoundation.org/
- ↑ The White House (2023). Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence. https://www.whitehouse.gov/briefing-room/presidential-actions/2023/10/30/executive-order-on-the-safe-secure-and-trustworthy-development-and-use-of-artificial-intelligence/
- ↑ Global Public Opinion on AI Survey, University of Toronto (2023). https://www.mediatechdemocracy.com/