The 2024 AI Index Report (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

AI Index Report 2024 — az AI Index hetedik éves kiadása, amelyet a Stanford Humánközpontú Mesterséges Intelligencia Intézete (Stanford HAI) készített[1]. A 2024-es jelentés a kiadvány eddigi történetének legátfogóbb kiadása, és abban a pillanatban jelenik meg, amikor az MI társadalomra gyakorolt hatása példátlanul szembetűnővé válik. A kiadvány tartalmaz új becsléseket a modellek tanítási költségeiről, részletes elemzést a felelős MI-ről, és először tartalmaz önálló fejezetet az MI tudományra és orvostudományra gyakorolt hatásáról. A jelentés nyomon követi, rendszerezi és vizualizálja a mesterséges intelligenciával kapcsolatos adatokat, objektív és gondosan ellenőrzött információkat nyújtva politikusok, kutatók, vezetők, újságírók és a széles nyilvánosság számára.

A jelentés szerkezete

A 2024-es jelentés kilenc tematikus fejezetből áll[1]:

  1. Kutatás és fejlesztés (Research and Development) — trendek a publikációkban, szabadalmakban, alapmodellekben és nyílt projektekben.
  2. Technikai teljesítmény (Technical Performance) — benchmark-ok, összehasonlítás az emberi szinttel, multimodalitás.
  3. Felelős MI (Responsible AI) — incidensek, biztonság, elfogultság, adatvédelem.
  4. Gazdaság (Economy) — befektetések, munkaerőpiac, vállalati bevezetés, robotizáció.
  5. Tudomány és orvostudomány (Science and Medicine) — új fejezet: áttörések az MI tudományos és orvosi alkalmazásaiban.
  6. Oktatás (Education) — szakemberképzés, oktatási programok, ChatGPT az oktatásban.
  7. Politika és irányítás (Policy and Governance) — jogszabályok, szabályozás, nemzeti stratégiák.
  8. Sokszínűség (Diversity) — nemi és etnikai sokszínűség az MI területén.
  9. Közvélemény (Public Opinion) — a lakosság MI-hez való viszonya nemzetközi felmérések adatai alapján.

A jelentés főbb megállapításai (Top 10)

A jelentés szerzői tíz fő tézist emeltek ki 2024-re[1]:

1. Az MI számos feladatban felülmúlja az embereket, de nem mindenben

A mesterséges intelligencia rendszerek több benchmark-on is meghaladták az emberi szintet, köztük a képosztályozásban (ImageNet), a vizuális következtetésben (VQA) és az angol nyelv megértésében (SuperGLUE). Ugyanakkor az MI még mindig elmarad az emberektől az összetettebb feladatokban: olimpiai szintű matematikában (MATH), vizuális mindennapi következtetésben és tervezésben[1].

2. Az ipar dominál az élvonalbeli MI-kutatásokban

2023-ban az ipar 51 jelentős gépi tanulási modellt hozott létre, míg az akadémia csupán 15-öt. Emellett 21 modell az ipar és az akadémia együttműködéséből született — ez rekordszintű eredmény[1].

3. Az élvonalbeli modellek tanítási költsége meredeken emelkedik

Az AI Index és az Epoch AI becslései szerint a GPT-4 tanítási költsége mintegy 78 millió dollár volt, a Google Gemini Ultráé pedig körülbelül 191 millió dollár[2]. Összehasonlításképpen: az eredeti Transformer modell tanítása 2017-ben körülbelül 900 dollárba, a RoBERTa Large-é 2019-ben pedig mintegy 160 ezer dollárba került[1].

4. Az USA vezet a legjelentősebb MI-modellek forrásaként

2023-ban 61 jelentős MI-modellt hoztak létre az USA szervezetei, jóval megelőzve az EU-t (21 modell) és Kínát (15 modell)[1].

5. Az LLM-ek felelősségi értékelésének szabványosítása komolyan elmarad

Az AI Index kutatása jelentős standardizációhiányt tárt fel a felelős MI-re vonatkozó jelentési gyakorlatban. A vezető fejlesztők — az OpenAI, a Google és az Anthropic — különböző felelős MI benchmark-okon tesztelik modelljeiket, ami megnehezíti a kockázatok szisztematikus összehasonlítását[1].

6. A generatív MI-be irányuló befektetések rohamosan növekednek

Annak ellenére, hogy a magánbefektetések összességében csökkentek az MI területén, a generatív MI finanszírozása közel nyolcszorosára nőtt 2022-höz képest, elérve a 25,2 milliárd dollárt. Nagy finanszírozási köröket hajtott végre az OpenAI, az Anthropic, a Hugging Face és az Inflection[3].

7. Az MI növeli a termelékenységet és a munka minőségét

Számos 2023-as kutatás kimutatta, hogy az MI segít a dolgozóknak gyorsabban és magasabb minőségben elvégezni feladataikat, és csökkenti a különbséget az alacsony és magasan képzett szakemberek között. Ugyanakkor néhány tanulmány figyelmeztet arra, hogy az MI megfelelő felügyelet nélküli alkalmazása termelékenységcsökkenéshez vezethet[1].

8. A tudományos haladás az MI révén felgyorsul

2023-ban számos jelentős MI-alapú tudományos alkalmazás jelent meg: AlphaDev (rendezési algoritmusok felgyorsítása), GNoME (új anyagok felfedezése), GraphCast (időjárás-előrejelzés) és mások[1].

9. Az MI-re vonatkozó jogszabályok száma az USA-ban meredeken emelkedett

2023-ban 25 MI-hez kapcsolódó jogszabályt fogadtak el — ez 56,3%-os növekedés az előző évhez képest. Összehasonlításképpen: 2016-ban csupán egyetlen ilyen jogszabályt fogadtak el[1].

10. Az emberek egyre inkább tudatában vannak az MI hatásának — és egyre inkább aggódnak miatta

Az Ipsos adatai szerint a válaszadók azon aránya, akik szerint az MI jelentősen befolyásolja majd életüket a következő 3–5 évben, 60%-ról 66%-ra nőtt. Emellett 52% fejez ki szorongást az MI-termékekkel és -szolgáltatásokkal kapcsolatban — ez 13 százalékpontos növekedés 2022 óta. Az USA-ban a Pew Research adatai szerint az amerikaiak 52%-a inkább aggodalmasnak, mint lelkesítőnek tartja az MI-t (2022-ben ez az arány 37% volt)[4][5].

1. fejezet. Kutatás és fejlesztés

A fejezet elemzi a publikációk, szabadalmak, élvonalbeli MI-rendszerek, alapmodellek (foundation models), konferenciák és nyílt forráskódú projektek trendjeit[1].

Publikációk

Az MI-vel kapcsolatos publikációk száma tovább növekszik: a 2010-es körülbelül 88 000-ről 2022-ben több mint 240 000-re (közel háromszoros növekedés). Az utolsó évi növekedés 1,1% volt[1].

Szabadalmak

A világban kiadott MI-szabadalmak száma meredeken emelkedett: 2021 és 2022 között 62,7%-os növekedés következett be, 2010 óta pedig több mint 31-szeresére nőtt. Kína dominálja az MI-szabadalmazást: 2022-ben a szabadalmi bejelentések 61,1%-a kínai volt, míg az USA részesedése 20,9% volt (csökkent a 2010-es 54,1%-ról)[1].

Élvonalbeli modellek

2023-ban az ipar tovább dominált az élvonalbeli modellek létrehozásában. 149 alapmodell jelent meg — kétszer annyi, mint 2022-ben. Ezek 65,7%-a nyílt forráskódú volt (szemben a 2022-es 44,4%-kal és a 2021-es 33,3%-kal)[1].

Tanítási költségek. Az AI Index és az Epoch AI együttműködése lehetővé tette a modellek tanítási költségeire vonatkozó pontosított becslések megszerzését. A kiadások növekedését a következő dinamika szemlélteti[2]:

Modell Év Becsült tanítási költség (USD)
Transformer 2017 ~930
BERT-Large 2018 ~3 300
RoBERTa Large 2019 ~160 000
GPT-3 175B 2020 ~4,3 millió
PaLM 540B 2022 ~12,4 millió
Llama 2 70B 2023 ~3,9 millió
GPT-4 2023 ~78 millió
Gemini Ultra 2023 ~191 millió

Nemzeti hovatartozás. 2023-ban 61 jelentős modellt hoztak létre az USA szervezetei, 21-et az EU, 15-öt Kína szervezetei. Ez megerősíti az USA vezető szerepét az élvonalbeli MI-rendszerek fejlesztésében[1].

Nyílt forráskódú szoftverek

A GitHubon található MI-projektek száma folyamatosan növekszik: a 2011-es 845-ről 2023-ban körülbelül 1,8 millióra. 2023-ban 59,3%-os növekedést rögzítettek. Az MI-projektek csillagainak száma megháromszorozódott: 2022-ben 4,0 millióról 2023-ban 12,2 millióra nőtt[1].

Konferenciák

A vezető MI-konferenciák (NeurIPS, ICML, ICLR stb.) látogatottsága tovább növekedett, tükrözve a terület iránti növekvő érdeklődést[1].

2. fejezet. Technikai teljesítmény

A fejezet elemzi az MI-rendszerek előrehaladását a nyelvfeldolgozás, képgenerálás, következtetés, kódolás és ágens-viselkedés területén[1].

Az MI teljesítményének jelenlegi helyzete

2023 állapotát tekintve az MI több feladatkategóriában meghaladja az emberi szintet: képosztályozásban (2015 óta), alapvető szövegmegértésben (2017 óta), vizuális következtetésben (2020 óta), természetes nyelvi következtetésben (2021 óta). Azonban olyan feladatokban, mint az olimpiai szintű matematika (MATH) és a tervezés, az MI egyelőre elmarad az emberektől[1].

Nyelvi modellek

HELM. A Stanfordon kidolgozott Holistic Evaluation of Language Models (HELM) benchmark tíz forgatókönyv szerint értékeli az LLM-eket, köztük szövegmegértés, matematika és jogi következtetés. 2024 januárjától a GPT-4 vezet 0,96-os mean win rate mutatóval[6].

MMLU. A Massive Multitask Language Understanding (MMLU) benchmark 57 szakterületen értékeli a modelleket. A Google Gemini Ultra volt az első, amely meghaladta az emberi alapszintet (89,8%), 90,0%-ot érve el — ez 14,8 százalékpontos javulás 2022-höz képest és 57,6 százalékpontos javulás a benchmark 2019-es létrehozása óta[7].

Chatbot Arena. A 2023-ban indított platform lehetővé teszi a felhasználók számára, hogy névtelen modellek generációit hasonlítsák össze. 2024 elejétől a GPT-4 Turbo-t tartják a leginkább preferált modellnek több mint 200 000 szavazat alapján[1].

Multimodalitás

Hagyományosan az MI-rendszerek egyetlen modalitásra korlátozódtak. 2023-ban azonban megjelentek a hatékony multimodális modellek — a Google Gemini és az OpenAI GPT-4 —, amelyek képesek szöveget, képeket, egyes esetekben hangot is feldolgozni. Az MMMU (Massive Multi-discipline Multimodal Understanding) benchmark megmutatta, hogy a Gemini Ultra vezet 59,4%-kal, de ez lényegesen elmarad a szakértői emberi szinttől (82,6%)[8].

Következtetés

GPQA. A Graduate-Level Google-Proof Q&A benchmark 448 összetett kérdést tartalmaz biológia, fizika és kémia területéről, amelyekre egyszerű Google-kereséssel nem lehet válaszolni. A GPT-4 kereséssel 41,0%-ot ért el, ami elmarad a szakértők szintjétől (72,5%), de meghaladja a nem szakértőkét (30,5%)[9].

Tudatelméleti tesztelés (BigToM). Az LLM-ek azon képességének tesztelése, hogy képesek-e modellezni mások meggyőződését, megmutatta, hogy a GPT-4 megközelíti az emberi szintet a közvetlen meggyőződés- és cselekvéskövetkeztetési feladatokban, bár még mindig elmarad a visszafelé irányuló meggyőződés-következtetési feladatokban[10].

Kódolás

A HumanEval benchmark értékeli a kódgenerálást. 2023-ban a modellek tovább javították eredményeiket, az SWE-bench — a valós szoftvermérnöki feladatok megoldásának értékelésére szolgáló új benchmark — megmutatta, hogy még a legjobb modellek is csak kis töredékét oldják meg a feladatoknak, ami jelentős fejlődési potenciálra utal[1].

Ágensviselkedés

Az MI-rendszereket egyre inkább tesztelik ágenses forgatókönyvekben. A Voyager (Microsoft) bemutatta az önálló tanulás képességét a Minecraft dinamikus környezetében, 3,3-szor több egyedi tárgyat gyűjtve, 2,3-szor nagyobb távolságot megtéve és 15,3-szor gyorsabban elérve a kulcsmérföldköveket az előző modellekhez képest[11]. Az MLAgentBench megmutatta, hogy a tudományos kutatásra szánt MI-ágensek ígéretes lehetőségeket kínálnak, de az eredmények feladatonként lényegesen eltérnek[1].

LLM-tulajdonságok

Emergens viselkedés. Egy 2023-as tanulmány megkérdőjelezte azt az elképzelést, hogy a modellek méretezésekor elkerülhetetlenül megjelennek kiszámíthatatlan „emergens" képességek. Lineáris és folytonos metrikák alkalmazásakor ezek a képességek nagyrészt eltűnnek[12].

Teljesítményromlás. A Stanford és Berkeley közös kutatása megmutatta, hogy a GPT-4 teljesítménye lényegesen változhat frissítések között: a 2023 júniusi verzió 42 százalékponttal gyengébben teljesített a márciusi verzióhoz képest kódgenerálásban és 33 százalékponttal gyengébben matematikai feladatokban[13].

Önkorrekció. A DeepMind és az Illinoisi Egyetem kutatói megmutatták, hogy az LLM-ek külső útmutatás nélkül nem képesek megfelelően korrigálni saját következtetéseiket: a GPT-4 teljesítménye az összes tesztelt benchmark-on csökkent önkorrekciós kísérlet során[1].

3. fejezet. Felelős MI

A fejezet a felelős MI kulcsdimenzióival foglalkozik: adatvédelem, átláthatóság, biztonság és méltányosság[1].

MI-incidensek

Az AI Incident Database 2023-ban 123 incidenst rögzített — ez 32,3%-os növekedés 2022-höz képest. 2013 óta az incidensek száma több mint húszszorosára nőtt. A növekedés oka egyrészt az MI alkalmazásának bővülése, másrészt az etikai kockázatokkal kapcsolatos tudatosság növekedése[14].

A felelős MI benchmark-ok szabványosítása

Öt vezető fejlesztő (OpenAI, Meta, Anthropic, Google, Mistral AI) elemzése kimutatta, hogy nincs egységes benchmark-készlet a felelős MI értékelésére. Bár az általános képességek benchmark-jait (MMLU, HellaSwag, ARC Challenge, HumanEval, GSM8K) széles körben alkalmazzák, a felelős MI benchmark-jait (TruthfulQA, RealToxicityPrompts, ToxiGen, BOLD, BBQ) széttagoltan használják: a TruthfulQA-t legfeljebb három fejlesztő alkalmazza az ötből, és az egyik fejlesztő egyáltalán nem számol be felelős MI benchmark-okon végzett tesztelésről[1].

MI és választások

A 2023-as kutatások megmutatták, hogy az emberek csupán az esetek 73%-ában azonosítják helyesen a hangalapú deepfake-eket. Várható, hogy a hangszintézis technológiájának fejlődésével az azonosítás pontossága csökkenni fog. Ez kockázatot jelent a politikai kampányok manipulálása szempontjából, és lehetőséget ad a politikusoknak arra, hogy kompromittáló hangfelvételeket hamisítványként utasítsanak el (az úgynevezett „hazug dividenda")[15].

Az LLM-ek politikai elfogultságát vizsgáló kutatások összefüggést tártak fel a ChatGPT alapértelmezett válaszai és a Demokrata Párt álláspontjai között, valamint negatív összefüggést a Republikánus Párt álláspontjaival[16].

4. fejezet. Gazdaság

A fejezet a befektetések, a foglalkoztatás, a vállalati MI-bevezetés és a robotizáció trendjeit vizsgálja[1].

Befektetések

Általános trendek. Az MI-be irányuló összesített vállalati befektetések 189,2 milliárd dollárra csökkentek 2023-ban (körülbelül 20%-os visszaesés 2022-höz képest). Ugyanakkor az évtized alatt a befektetések volumene tizenhárom-szorosára nőtt. A magánbefektetések második egymást követő évben csökkentek, bár a visszaesés kevésbé volt kifejezett, mint 2021–2022-ben[3].

Generatív MI. A generatív MI-be irányuló befektetések 25,2 milliárd dollárt tettek ki — ez közel kilencszeres növekedés 2022-höz képest és harmincszorosnövekedés 2019-hez képest. A generatív MI az összes MI-magánbefektetés több mint negyedét adta[3].

Regionális megoszlás. Az USA 67,2 milliárd dolláros befektetéseivel 8,7-szer megelőzte Kínát (7,8 milliárd) és 17,8-szor az Egyesült Királyságot (3,8 milliárd). Eközben a magánbefektetések Kínában 44,2%-kal, az EU-ban és az Egyesült Királyságban 14,1%-kal csökkentek, míg az USA-ban 22,1%-kal nőttek[3].

Startupok. A finanszírozásban részesült új MI-vállalatok száma 1 812-re nőtt (40,6%-os növekedés). A generatív MI területén 99 új startup kapott finanszírozást (szemben a 2022-es 56-tal)[3].

Munkaerőpiac

Az MI-hez kapcsolódó állásajánlatok aránya az USA-ban 2,0%-ról (2022) 1,6%-ra csökkent 2023-ban. Hasonló tendencia figyelhető meg globálisan. A csökkenés oka a nagyvállalatok csökkentett felvételi aktivitása és a műszaki jellegű állásajánlatok arányának visszaesése[1].

Az MI-szakemberek migrációja az akadémiából az iparba tovább gyorsul: 2022-ben az MI-területen doktori fokozatot szerzők 70,7%-a az iparban helyezkedett el (szemben a 2011-es 40,9%-kal), és mindössze 20,0%-uk az akadémián (szemben a 41,6%-kal)[1].

Vállalati bevezetés

A McKinsey adatai szerint a szervezetek 55%-a alkalmaz MI-t (beleértve a generatív MI-t) legalább egy üzleti egységben — ez növekedés a 2022-es 50%-ról és a 2017-es 20%-ról. Emellett a szervezetek 42%-a számol be költségcsökkentésről, 59%-a pedig bevételnövekedésről az MI révén[17].

A Fortune 500 vállalatok eredményjelentéseiben az MI-re való hivatkozások száma elérte a 394-et (az összes vállalat közel 80%-a) — ez figyelemre méltó növekedés a 2022-es 266-hoz képest. A leggyakrabban említett téma (az összes hívás 19,7%-ában) a generatív MI volt[1].

Robotika

2022-ben 553 000 ipari robotot telepítettek — ez 5,1%-os növekedés 2021-hez képest és több mint háromszoros növekedés 2012-höz képest. Kína dominál: 2013 óta, amikor megelőzte Japánt, Kína részesedése a globális telepítésekből 20,8%-ról 52,4%-ra nőtt 2022-ben. A kollaboratív robotok aránya 2017-es 2,8%-ról 2022-re 9,9%-ra emelkedett[18].

5. fejezet. Tudomány és orvostudomány

A jelentésbe először bekerült fejezet az MI szerepét tárgyalja a tudományos felfedezések és orvosi innovációk területén[1].

2023-as tudományos eredmények

AlphaDev (DeepMind) — megerősítéses tanulási rendszer, amely kevesebb utasítással rendelkező rendezési algoritmusokat fedezett fel, mint a meglévő emberi referenciaértékek. Néhány megtalált algoritmust beépítettek a C++ szabványos rendezési könyvtárába (LLVM) — ez az első frissítés a könyvtár ezen részében több mint tíz év óta[19].

GraphCast (DeepMind) — gráf neurális hálózatokon alapuló időjárás-előrejelző rendszer, amely kevesebb mint egy perc alatt 10 napos előrejelzést nyújt, meghaladva a vezető HRES modellezési rendszer (Európai Középtávú Időjárás-előrejelzési Központ) pontosságát[20].

GNoME (Google DeepMind) — gráfhálózatokat alkalmazó modell az új funkcionális anyagok gyorsított keresésére, ami kritikusan fontos a robotika és a félvezető-ipar fejlődése szempontjából[21].

Synbot — MI-vezérelt kémiairobotrendszer szerves molekulák autonóm szintéziséhez, amely a referencia-értékekkel összehasonlítható vagy azokat meghaladó reakcióhozamot ért el[22].

FlexiCubes (NVIDIA) — MI-vel támogatott 3D mesh optimalizálási módszer a 3D objektumok generálásának minőségi javítására a számítógépes grafikában[23].

MI az orvostudományban

Klinikai tudás. A MedQA benchmark-on (az MI klinikai tudásának értékelése) a GPT-4 Medprompt modell 90,2%-os pontosságot ért el — ez 22,6 százalékpontos növekedés a 2022-es legjobb eredményhez képest. A benchmark 2019-es létrehozása óta az MI teljesítménye a MedQA-n közel megháromszorozódott. Figyelemre méltó, hogy a GPT-4 Medprompt prompt-tervezést alkalmazott finomhangolás helyett, felülmúlva a speciális orvosi modelleket[24].

MediTron-70B — nyílt forráskódú orvosi LLM, amely 70,2%-ot ért el a MedQA-n — ez a legjobb eredmény a nyílt forráskódú modellek körében, bár elmarad a zárt GPT-4 Medprompt és Med-PaLM 2 modellek eredményeitől[25].

Orvosi innovációk. A 2023-as jelentős rendszerek közé tartozik: SynthSR (agyszerkezetek megjelenítésének javítása alacsony minőségű MRI-felvételekből), ImmunoSEIRA (MI-alapú infravörös érzékelők neurodegeneratív betegségek diagnosztizálásához), EVEscape (vírusok evolúciójának előrejelzése a járványok megelőzése érdekében), AlphaMissense (misszensz mutációk osztályozása)[1].

FDA-jóváhagyások. 2022-ben az FDA 139 MI-alapú orvosi eszközt hagyott jóvá — ez 12,1%-os növekedés 2021-hez képest. 2012 óta az ilyen jóváhagyások száma több mint 45-szörösére nőtt[26].

6. fejezet. Oktatás

A fejezet az informatika és az MI területén tapasztalható oktatási trendeket vizsgálja[1].

Felsőoktatás

Az informatika alapszakon végzett hallgatók száma az USA-ban és Kanadában tovább növekszik. A mesterszakosok száma viszonylag stabil marad, a doktori fokozatot szerzők száma pedig szerényen emelkedik. 2018 óta az informatikán végzett mesterek és doktorok száma kissé csökkent[1].

A külföldi hallgatók aránya csökkent az oktatás minden szintjén, különösen szembeötlően a mesterképzésben. Globális szinten az MI-hez kapcsolódó angol nyelvű képzési programok száma 2017 óta megháromszorozódott[1].

ChatGPT az oktatásban

A Walton Foundation felmérése szerint a tanárok 88%-a és a diákok 79%-a úgy véli, hogy a ChatGPT pozitív hatással van az oktatási folyamatra. A tanárok 76%-a és a diákok 65%-a gondolja, hogy a ChatGPT integrálása az oktatásba fontos[27].

7. fejezet. Politika és irányítás

A fejezet a globális, az amerikai és az európai MI-jogalkotási és szabályozási aktivitást elemzi[1].

Globális tendenciák

Az MI-re való hivatkozások a világ jogalkotási folyamataiban rekordszintet értek el. Eltolódás tapasztalható a tisztán ösztönző intézkedésektől a korlátozó jogalkotás felé, ami azt jelzi, hogy a szabályozók egyre nagyobb figyelmet fordítanak az MI potenciális kockázataira[1].

A 2023-ban elfogadott törvények tematikája jelentősen bővült, kiterjedve a fegyveres erőkre és a nemzetbiztonságra, a polgári jogokra, a kereskedelemre, az oktatásra, a munkaügyi kapcsolatokra, a tudományra és a technológiára[1].

Szabályozás az USA-ban

Az MI-hez kapcsolódó jogszabályok száma 25-re nőtt 2023-ban (56,3%-os növekedés 2022-höz képest). A legelterjedtebb témakör a külkereskedelem és a nemzetközi pénzügyek volt. A magas és közepes mértékű MI-relevanciájú jogszabályok aránya nőtt az előző évekhez képest[1].

2023 egyik mérföldköve Biden elnök MI-ről szóló végrehajtási rendelete (Executive Order on AI) volt, amelynek célja többek között a Nemzeti MI-Kutatási Erőforrás (National AI Research Resource) létrehozása az ipar és az akadémia közötti egyenlő lehetőségek biztosítása érdekében[28].

Szabályozás az EU-ban

Az Európai Unióban hasonló tendencia figyelhető meg az MI-hez kapcsolódó jogszabályok számának növekedésében. 2023 jelentős eredménye az AI Act előrehaladása — a világ első átfogó MI-törvénye[1].

8. fejezet. Sokszínűség

A fejezet az MI-szakemberek körében tapasztalható nemi és etnikai sokszínűséget vizsgálja. Bizonyos előrelépés ellenére a nők és a kisebbségek képviselete az MI területén még mindig jelentősen elmarad mind az iparban, mind az akadémián[1].

9. fejezet. Közvélemény

A fejezet az MI társadalmi megítélését elemzi nemzetközi felmérések és közösségi médiaadatok alapján[1].

Nemzetközi felmérések

Tudatosság és aggodalom. Az Ipsos adatai szerint a válaszadók 66%-a (növekedés 60%-ról) úgy véli, hogy az MI jelentősen befolyásolja majd életüket a következő 3–5 évben. Emellett 52% fejez ki szorongást az MI-termékekkel kapcsolatban (13 százalékpontos növekedés 2022 óta)[4].

Gazdasági várakozások. Csupán a válaszadók 37%-a gondolja, hogy az MI javítani fogja munkájukat, 34%, hogy javítani fogja a gazdaságot, és 32%, hogy pozitívan befolyásolja a munkaerőpiacot[4].

Demográfiai különbségek. A fiatalabb generációk lényegesen optimistábbak: a Z-generáció tagjainak 59%-a gondolja, hogy az MI javítani fogja a szórakoztatást, szemben a baby boomerek 40%-ával. A magasabb jövedelmű és magasabb iskolai végzettségű emberek szintén optimistábbak[1].

ChatGPT ismertsége. A Torontói Egyetem nemzetközi felmérése szerint a válaszadók 63%-a ismeri a ChatGPT-t, és közel felük legalább hetente egyszer használja[29].

Közösségi média adatok

A Quid által 2023-ban elemzett több mint 7 millió közösségi médiabejegyzés azt mutatta, hogy a GraphCast és Claude 2.1 modellek kapták a legmagasabb pozitív hangulati mutatót (net sentiment score). A GPT-4 az első negyedévben a figyelem legnagyobb részét vonzotta, míg az év végére a fókusz a Geminire és a Grokra helyeződött[1].

A 2023-as év jelentős MI-modelljei

A jelentés rögzíti számos kulcsfontosságú modell megjelenését[1]:

Modell Fejlesztő Típus Dátum Jelentőség
GPT-4 OpenAI LLM, multimodális 2023. március Az egyik legerősebb LLM; a HELM listavezetője
PaLM 2 Google LLM 2023. május Fejlett többnyelvű képességek
Llama 2 Meta LLM (nyílt) 2023. július Vezető nyílt modell; 7B/13B/70B verziók
Claude 2 / 2.1 Anthropic LLM 2023. július / november Akár 200K token kontextusablak
Mistral 7B Mistral AI LLM (nyílt) 2023. szeptember Kompakt, nagy teljesítményű modell
DALL-E 3 OpenAI Képgenerálás 2023. október Javított minőség és prompt-követés
Gemini / Gemini Ultra Google LLM, multimodális 2023. december Az első LLM, amely meghaladta az embert az MMLU-n
Mixtral 8×7B Mistral AI LLM (MoE, nyílt) 2023. december Mixture-of-Experts architektúra
Midjourney v6 Midjourney Képgenerálás 2023. december Javított minőség és intuitív promptok
Whisper v3 OpenAI Hangfelismerés 2023. november Növelt pontosság, bővített nyelvi támogatás

Módszertan

A jelentés számos forrásból gyűjt adatokat[1]:

  • Publikációk és szabadalmak: OpenAlex, WIPO, USPTO, Epoch AI adatai.
  • Benchmark-ok: Papers With Code, CRFM (HELM), specializált ranglisták.
  • Befektetések: Quid (Capital IQ, Crunchbase), több mint 8 millió vállalat adatai.
  • Munkaerőpiac: Lightcast, LinkedIn, Stack Overflow.
  • Vállalati aktivitás: McKinsey & Company, Seeking Alpha (earnings calls).
  • Robotika: International Federation of Robotics (IFR).
  • Szabályozás: Federal Register (USA), EUR-Lex (EU), Govini.
  • Közvélemény: Ipsos, Pew Research Center, University of Toronto (GPO-AI), Quid (közösségi média).
  • Oktatás: CRA Taulbee Survey, Informatics Europe, Studyportals, Code.org, Walton Foundation.
  • Orvostudomány: FDA, Papers With Code (MedQA).

A modellek tanítási költségeire vonatkozó becsléseket az Epoch AI-jal közösen készítették, a hardvereszközök típusának és mennyiségének, a tanítás időtartamának és a felhőalapú bérleti díjak elemzése alapján[2].

Szerzői kollektíva

A jelentést Ray Perrault és Jack Clark társigazgatók irányításával készítették, kutatók és partnerszervezetek széles körének közreműködésével. Az AI Index a Stanford HAI (Human-Centered Artificial Intelligence) Intézet projektje[1].

Hivatkozások

Irodalom

Megjegyzések

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/
  2. 2.0 2.1 2.2 Epoch AI (2023). AI Training Cost Estimates. https://epochai.org/
  3. 3.0 3.1 3.2 3.3 3.4 Quid (2023). AI Investment Data. https://quid.com/
  4. 4.0 4.1 4.2 Ipsos (2023). Global Perceptions of AI Survey. https://www.ipsos.com/
  5. Pew Research Center (2023). Public Views on AI. https://www.pewresearch.org/
  6. Liang, P. et al. (2022). Holistic Evaluation of Language Models. https://arxiv.org/abs/2211.09110
  7. Hendrycks, D. et al. (2021). Measuring Massive Multitask Language Understanding. https://arxiv.org/abs/2009.03300
  8. Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. https://arxiv.org/abs/2311.16502
  9. Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
  10. Gandhi, K. et al. (2023). Understanding Social Reasoning in Language Models with Language Models. https://arxiv.org/abs/2306.15448
  11. Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. https://arxiv.org/abs/2305.16291
  12. Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? https://arxiv.org/abs/2304.15004
  13. Chen, L. et al. (2023). How Is ChatGPT's Behavior Changing over Time? https://arxiv.org/abs/2307.09009
  14. AI Incident Database (2023). https://incidentdatabase.ai/
  15. Mai, K. T. et al. (2023). Warning: Humans Cannot Reliably Detect Speech Deepfakes. https://arxiv.org/abs/2301.07829
  16. Motoki, F. et al. (2023). More Human than Human: Measuring ChatGPT Political Bias. https://doi.org/10.1007/s11127-023-01097-2
  17. McKinsey & Company (2023). The State of AI in 2023: Generative AI's Breakout Year. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
  18. International Federation of Robotics (2023). World Robotics Report 2023. https://ifr.org/worldrobotics/
  19. Mankowitz, D. J. et al. (2023). Faster sorting algorithms discovered using deep reinforcement learning. Nature. https://doi.org/10.1038/s41586-023-06004-9
  20. Lam, R. et al. (2023). Learning skillful medium-range global weather forecasting. Science. https://doi.org/10.1126/science.adi2336
  21. Merchant, A. et al. (2023). Scaling deep learning for materials discovery. Nature. https://doi.org/10.1038/s41586-023-06735-9
  22. Ha, T. et al. (2023). AI-driven robotic chemist for autonomous synthesis of organic molecules. Science Advances. https://doi.org/10.1126/sciadv.adj0461
  23. Shen, T. et al. (2023). Flexible Isosurface Extraction for Gradient-Based Mesh Optimization. ACM Transactions on Graphics. https://doi.org/10.1145/3592430
  24. Nori, H. et al. (2023). Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine. https://arxiv.org/abs/2311.16452
  25. Chen, Z. et al. (2023). MEDITRON-70B: Scaling Medical Pretraining for Large Language Models. https://arxiv.org/abs/2311.16079
  26. U.S. Food and Drug Administration (2023). Artificial Intelligence and Machine Learning (AI/ML)-Enabled Medical Devices. https://www.fda.gov/medical-devices/software-medical-device-samd/artificial-intelligence-and-machine-learning-aiml-enabled-medical-devices
  27. Impact Research / Walton Family Foundation (2023). ChatGPT and Education Survey. https://www.waltonfamilyfoundation.org/
  28. The White House (2023). Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence. https://www.whitehouse.gov/briefing-room/presidential-actions/2023/10/30/executive-order-on-the-safe-secure-and-trustworthy-development-and-use-of-artificial-intelligence/
  29. Global Public Opinion on AI Survey, University of Toronto (2023). https://www.mediatechdemocracy.com/