The 2024 AI Index Report (CS)
AI Index Report 2024 — sedmé každoroční vydání zprávy AI Index, připravené Stanfordským institutem umělé inteligence zaměřené na člověka (Stanford HAI)[1]. Zpráva roku 2024 je nejrozsáhlejší v celé historii publikace a vychází v době, kdy vliv AI na společnost dosahuje bezprecedentní viditelnosti. Vydání zahrnuje nová hodnocení nákladů na trénování modelů, podrobnou analýzu odpovědné AI a poprvé obsahuje samostatnou kapitolu věnovanou vlivu AI na vědu a medicínu. Zpráva sleduje, systematizuje a vizualizuje data spojená s umělou inteligencí a poskytuje objektivní a důkladně ověřené informace pro politiky, výzkumníky, manažery, novináře i širokou veřejnost.
Struktura zprávy
Zpráva roku 2024 se skládá z devíti tematických kapitol[1]:
- Výzkum a vývoj (Research and Development) — trendy v publikacích, patentech, základních modelech a otevřených projektech.
- Technický výkon (Technical Performance) — benchmarky, srovnání s lidskou úrovní, multimodalita.
- Odpovědná AI (Responsible AI) — incidenty, bezpečnost, zaujatost, soukromí.
- Ekonomika (Economy) — investice, trh práce, korporátní nasazení, robotizace.
- Věda a medicína (Science and Medicine) — nová kapitola: průlomy ve vědě a medicínských aplikacích AI.
- Vzdělávání (Education) — příprava odborníků, vzdělávací programy, ChatGPT ve výuce.
- Politika a správa (Policy and Governance) — legislativa, regulace, národní strategie.
- Rozmanitost (Diversity) — genderová a etnická rozmanitost v oblasti AI.
- Veřejné mínění (Public Opinion) — postoje obyvatelstva k AI podle mezinárodních průzkumů.
Klíčové závěry zprávy (Top 10)
Autoři zprávy vyzdvihli deset hlavních tezí roku 2024[1]:
1. AI překonává lidi v řadě úkolů, ale ne ve všech
Systémy umělé inteligence překonaly lidskou úroveň na několika benchmarcích, včetně klasifikace obrázků (ImageNet), vizuálního uvažování (VQA) a porozumění anglickému jazyku (SuperGLUE). Přitom AI stále zaostává za lidmi ve složitějších úkolech: matematice na olympijské úrovni (MATH), vizuálním každodenním uvažování a plánování[1].
2. Průmysl dominuje v pokročilém AI výzkumu
V roce 2023 průmysl vytvořil 51 významných modelů strojového učení, zatímco akademická sféra pouze 15. Přitom 21 modelů vzniklo jako výsledek společné práce průmyslu a akademie — rekordní ukazatel[1].
3. Náklady na trénování pokročilých modelů prudce rostou
Podle odhadů AI Index a Epoch AI činily náklady na trénování GPT-4 přibližně 78 milionů dolarů a modelu Gemini Ultra od Google přibližně 191 milionů dolarů[2]. Pro srovnání: trénování původního modelu Transformer v roce 2017 stálo přibližně 900 dolarů a RoBERTa Large v roce 2019 přibližně 160 tisíc[1].
4. USA vedou jako zdroj předních AI modelů
V roce 2023 bylo 61 významných AI modelů vytvořeno v organizacích z USA, výrazně předčíce EU (21 modelů) a Čínu (15 modelů)[1].
5. Standardizované hodnocení odpovědnosti LLM výrazně zaostává
Výzkum AI Index odhalil výrazný nedostatek standardizace v reportování odpovědné AI. Přední vývojáři — OpenAI, Google a Anthropic — testují své modely na různých benchmarcích odpovědné AI, což ztěžuje systematické srovnání rizik[1].
6. Investice do generativní AI rychle rostou
Navzdory celkovému poklesu soukromých investic do AI vzrostlo financování generativní AI téměř osminásobně ve srovnání s rokem 2022 a dosáhlo 25,2 miliardy dolarů. Velká investiční kola uskutečnily OpenAI, Anthropic, Hugging Face a Inflection[3].
7. AI zvyšuje produktivitu a kvalitu práce
Četné studie z roku 2023 ukázaly, že AI pomáhá pracovníkům plnit úkoly rychleji a s vyšší kvalitou a také snižuje rozdíl mezi nízkokvalifikovanými a vysokokvalifikovanými odborníky. Zároveň řada prací varuje, že používání AI bez náležitého dohledu může vést ke snížení produktivity[1].
8. Vědecký pokrok se díky AI urychluje
V roce 2023 byly představeny významné vědecké aplikace AI: AlphaDev (urychlení řadicích algoritmů), GNoME (objev nových materiálů), GraphCast (předpovídání počasí) a další[1].
9. Počet regulačních aktů o AI v USA prudce vzrostl
V roce 2023 bylo přijato 25 regulačních aktů souvisejících s AI — nárůst o 56,3 % ve srovnání s předchozím rokem. Pro srovnání: v roce 2016 byl přijat pouze jeden takový akt[1].
10. Lidé jsou stále více informováni o dopadu AI — a stále více znepokojeni
Podle údajů Ipsos vzrostl podíl respondentů, kteří se domnívají, že AI výrazně ovlivní jejich život v příštích 3–5 letech, z 60 % na 66 %. Přičemž 52 % vyjadřuje nervozitu ohledně produktů a služeb AI — nárůst o 13 p.b. od roku 2022. V USA podle Pew Research 52 % Američanů uvádí větší znepokojení než nadšení v souvislosti s AI (37 % v roce 2022)[4][5].
Kapitola 1. Výzkum a vývoj
Kapitola analyzuje trendy v publikacích, patentech, pokročilých AI systémech, základních modelech (foundation models), konferencích a otevřených softwarových projektech[1].
Publikace
Celkový počet publikací o AI nadále roste: z přibližně 88 000 v roce 2010 na více než 240 000 v roce 2022 (téměř trojnásobný nárůst). Přírůstek za poslední rok činil 1,1 %[1].
Patenty
Počet udělených patentů v oblasti AI ve světě prudce vzrostl: od roku 2021 do roku 2022 o 62,7 % a od roku 2010 více než jednatřicetkrát. Čína dominuje v patentování AI: v roce 2022 na ni připadlo 61,1 % patentních přihlášek, zatímco podíl USA činil 20,9 % (pokles z 54,1 % v roce 2010)[1].
Pokročilé modely
V roce 2023 průmysl nadále dominoval ve vytváření pokročilých modelů. Bylo vydáno 149 základních modelů — dvakrát více než v roce 2022. Z toho 65,7 % bylo s otevřeným zdrojovým kódem (ve srovnání se 44,4 % v roce 2022 a 33,3 % v roce 2021)[1].
Náklady na trénování. Spolupráce AI Index s Epoch AI umožnila získat upřesněné odhady nákladů na trénování modelů. Nárůst výdajů názorně ilustruje následující vývoj[2]:
| Model | Rok | Odhadované náklady na trénování (USD) |
|---|---|---|
| Transformer | 2017 | ~930 |
| BERT-Large | 2018 | ~3 300 |
| RoBERTa Large | 2019 | ~160 000 |
| GPT-3 175B | 2020 | ~4,3 mil. |
| PaLM 540B | 2022 | ~12,4 mil. |
| Llama 2 70B | 2023 | ~3,9 mil. |
| GPT-4 | 2023 | ~78 mil. |
| Gemini Ultra | 2023 | ~191 mil. |
Národní příslušnost. V roce 2023 bylo 61 významných modelů vytvořeno organizacemi z USA, 21 z EU, 15 z Číny. To potvrzuje vedoucí roli USA ve vývoji pokročilých AI systémů[1].
Otevřený software
Počet AI projektů na GitHubu neustále roste: z 845 v roce 2011 na přibližně 1,8 milionu v roce 2023. V roce 2023 byl zaznamenán nárůst o 59,3 %. Celkový počet hvězd pro AI projekty se ztrojnásobil: ze 4,0 milionů v roce 2022 na 12,2 milionů v roce 2023[1].
Konference
Návštěvnost předních AI konferencí (NeurIPS, ICML, ICLR a další) nadále rostla, což odráží rostoucí zájem o tuto oblast[1].
Kapitola 2. Technický výkon
Kapitola analyzuje pokrok AI systémů v úlohách zpracování jazyka, generování obrázků, uvažování, kódování a agentního chování[1].
Stav výkonu AI
K roku 2023 AI překonává lidskou úroveň v několika kategoriích úkolů: klasifikace obrázků (od roku 2015), základní porozumění textu (od roku 2017), vizuální uvažování (od roku 2020), logický výstupy z přirozeného jazyka (od roku 2021). Nicméně v úkolech jako olympijská matematika (MATH) a plánování AI zatím zaostává za lidmi[1].
Jazykové modely
HELM. Benchmark Holistic Evaluation of Language Models (HELM), vyvinutý na Stanfordu, hodnotí LLM v deseti scénářích, včetně porozumění textu, matematiky a právního uvažování. K lednu 2024 vede GPT-4 s ukazatelem mean win rate 0,96[6].
MMLU. Benchmark Massive Multitask Language Understanding (MMLU) hodnotí modely ve 57 tematických oblastech. Gemini Ultra od Google jako první překonal lidskou základní úroveň (89,8 %), když dosáhl 90,0 % — zlepšení o 14,8 p.b. oproti roku 2022 a o 57,6 p.b. od vzniku benchmarku v roce 2019[7].
Chatbot Arena. Platforma spuštěná v roce 2023 umožňuje uživatelům porovnávat výstupy anonymních modelů. K začátku roku 2024 byl GPT-4 Turbo uznán nejpreferovanějším modelem na základě více než 200 000 hlasů[1].
Multimodalita
Tradiční AI systémy byly omezeny na jednu modalitu. Nicméně v roce 2023 se objevily výkonné multimodální modely — Google Gemini a OpenAI GPT-4, schopné zpracovávat text, obrázky a v některých případech i zvuk. Benchmark MMMU (Massive Multi-discipline Multimodal Understanding) ukázal, že Gemini Ultra vede s 59,4 %, ale to je výrazně pod úrovní lidského experta (82,6 %)[8].
Uvažování
GPQA. Benchmark Graduate-Level Google-Proof Q&A obsahuje 448 složitých otázek z biologie, fyziky a chemie, na které nelze odpovědět jednoduchým vyhledáváním na Googlu. GPT-4 s vyhledáváním dosáhl 41,0 %, což je pod úrovní expertů (72,5 %), ale nad úrovní neexpertů (30,5 %)[9].
Teorie vědomí (BigToM). Testování schopnosti LLM modelovat přesvědčení jiných lidí ukázalo, že GPT-4 se přibližuje lidské úrovni v úkolech přímého odvozování přesvědčení a akcí, ačkoli stále zaostává v úkolech zpětného odvozování přesvědčení[10].
Kódování
Benchmark HumanEval hodnotí generování kódu. V roce 2023 modely nadále zlepšovaly své ukazatele a SWE-bench — nový benchmark pro hodnocení řešení reálných úkolů softwarového inženýrství — ukázal, že i nejlepší modely řeší pouze malou část úkolů, což demonstruje značný potenciál pro další pokrok[1].
Agentní chování
AI systémy jsou stále více testovány v agentních scénářích. Voyager (Microsoft) prokázal schopnost autonomního učení v dynamickém prostředí Minecraft, přičemž sbíral 3,3krát více unikátních předmětů, pohyboval se 2,3krát dále a dosahoval klíčových milníků 15,3krát rychleji ve srovnání s předchozími modely[11]. MLAgentBench ukázal, že AI agenti pro vědecký výzkum slibují potenciál, ale výsledky se výrazně liší mezi úkoly[1].
Vlastnosti LLM
Emergentní chování. Výzkum z roku 2023 zpochybnil představu o nevyhnutelném výskytu nepředvídatelných „emergentních" schopností při škálování modelů. Při použití lineárních a spojitých metrik tyto schopnosti ve značné míře mizí[12].
Degradace výkonu. Výzkum Stanfordu a Berkley ukázal, že výkon GPT-4 se může mezi aktualizacemi výrazně měnit: verze z června 2023 byla o 42 p.b. horší než verze z března v generování kódu a o 33 p.b. horší v matematických úlohách[13].
Samokorekce. Výzkumníci z DeepMind a Illinoiské univerzity ukázali, že LLM si špatně poradí se samostatnou korekcí svého uvažování bez vnějšího vedení: výkon GPT-4 klesal na všech testovaných benchmarcích při pokusu o samokorekci[1].
Kapitola 3. Odpovědná AI
Kapitola je věnována klíčovým dimenzím odpovědné AI: soukromí, transparentnosti, bezpečnosti a spravedlnosti[1].
Incidenty v oblasti AI
Databáze AI Incident Database zaznamenala 123 incidentů v roce 2023 — nárůst o 32,3 % oproti roku 2022. Od roku 2013 se počet incidentů zvýšil více než dvacetinásobně. Nárůst je způsoben jak rozšiřováním využívání AI, tak rostoucím povědomím o jeho etických rizicích[14].
Standardizace benchmarků odpovědné AI
Analýza pěti předních vývojářů (OpenAI, Meta, Anthropic, Google, Mistral AI) odhalila absenci jednotného souboru benchmarků pro hodnocení odpovědné AI. Ačkoli obecné benchmarky schopností (MMLU, HellaSwag, ARC Challenge, HumanEval, GSM8K) jsou využívány široce, benchmarky odpovědné AI (TruthfulQA, RealToxicityPrompts, ToxiGen, BOLD, BBQ) jsou používány nerovnoměrně: TruthfulQA využívají nejvýše tři z pěti vývojářů a jeden vývojář vůbec neuvádí testování podle benchmarků odpovědné AI[1].
AI a volby
Výzkumy z roku 2023 ukázaly, že lidé správně identifikují audio deepfaky pouze v 73 % případů. Očekává se, že s rozvojem technologií generování zvuku se přesnost rozpoznávání bude snižovat. To vytváří rizika manipulace politickými kampaněmi a dává politikům možnost odmítat kompromitující zvukové záznamy jako podvrhy (tzv. „dividenda lháře")[15].
Výzkumy LLM na politickou zaujatost odhalily korelaci mezi výchozími odpověďmi ChatGPT a pozicemi Demokratické strany a negativní korelaci s pozicemi Republikánské strany[16].
Kapitola 4. Ekonomika
Kapitola zkoumá trendy v investicích, zaměstnanosti, korporátním nasazení AI a robotizaci[1].
Investice
Celkové trendy. Celkové korporátní investice do AI klesly na 189,2 miliardy dolarů v roce 2023 (pokles ~20 % oproti roku 2022). Nicméně za jedno desetiletí se objem investic zvýšil třináctinásobně. Soukromé investice klesaly druhý rok v řadě, ačkoli pokles byl méně výrazný než v letech 2021–2022[3].
Generativní AI. Investice do generativní AI dosáhly 25,2 miliardy dolarů — téměř devítinásobný nárůst oproti roku 2022 a třicetinásobný oproti roku 2019. Generativní AI zajistila více než čtvrtinu všech soukromých investic do AI[3].
Regionální rozložení. USA s investicemi 67,2 miliardy dolarů předčily Čínu (7,8 mld.) 8,7krát a Velkou Británii (3,8 mld.) 17,8krát. Přitom soukromé investice v Číně klesly o 44,2 %, v EU a Velké Británii o 14,1 %, zatímco v USA vzrostly o 22,1 %[3].
Startupy. Počet nových AI společností, které získaly financování, vzrostl na 1 812 (nárůst o 40,6 %). V oblasti generativní AI získalo financování 99 nových startupů (oproti 56 v roce 2022)[3].
Trh práce
Podíl volných pracovních míst spojených s AI v USA klesl z 2,0 % v roce 2022 na 1,6 % v roce 2023. Podobná tendence je patrná celosvětově. Pokles je způsoben omezením náboru ze strany velkých AI společností a snížením podílu technických pracovních míst[1].
Migrace AI odborníků z akademické sféry do průmyslu se nadále urychluje: v roce 2022 nastoupilo 70,7 % nových držitelů doktorátů v oblasti AI do průmyslu (oproti 40,9 % v roce 2011) a pouze 20,0 % do akademické sféry (oproti 41,6 %)[1].
Korporátní nasazení
Podle údajů McKinsey 55 % organizací využívá AI (včetně generativní AI) alespoň v jedné obchodní jednotce — nárůst z 50 % v roce 2022 a 20 % v roce 2017. Přitom 42 % organizací uvádí snížení nákladů a 59 % nárůst příjmů díky AI[17].
Zmínky o AI ve zprávách o ziscích společností Fortune 500 dosáhly 394 (téměř 80 % všech společností) — výrazný nárůst z 266 v roce 2022. Nejčastěji zmiňovaným tématem (19,7 % všech hovorů) se stala generativní AI[1].
Robotika
V roce 2022 bylo instalováno 553 000 průmyslových robotů — nárůst o 5,1 % oproti roku 2021 a více než trojnásobný nárůst od roku 2012. Čína dominuje: od roku 2013, kdy předstihla Japonsko, vzrostl podíl Číny z 20,8 % na 52,4 % světových instalací v roce 2022. Podíl kolaborativních robotů se zvýšil z 2,8 % v roce 2017 na 9,9 % v roce 2022[18].
Kapitola 5. Věda a medicína
Poprvé zařazená kapitola v přehledu osvětluje roli AI ve vědeckých objevech a medicínských inovacích[1].
Vědecké úspěchy roku 2023
AlphaDev (DeepMind) — systém s reinforcement learning, který objevil řadicí algoritmy s menším počtem instrukcí než stávající lidské standardy. Některé z nalezených algoritmů byly začleněny do standardní řadicí knihovny C++ (LLVM) — první aktualizace této části knihovny za více než deset let[19].
GraphCast (DeepMind) — systém pro předpovídání počasí na základě grafových neuronových sítí, zajišťující 10denní předpověď za méně než minutu s přesností překračující přední simulační systém HRES (Evropské centrum pro střednědobé předpovědi počasí)[20].
GNoME (Google DeepMind) — model využívající grafové sítě pro urychlené hledání nových funkčních materiálů, což je klíčové pro pokrok v robotice a polovodičovém průmyslu[21].
Synbot — AI řízený robotický chemik pro autonomní syntézu organických molekul, dosahující výtěžnosti reakce srovnatelné s referenčními hodnotami nebo je překračující[22].
FlexiCubes (NVIDIA) — metoda optimalizace 3D sítí pomocí AI pro zlepšení kvality generování 3D objektů v počítačové grafice[23].
AI v medicíně
Klinické znalosti. Na benchmarku MedQA (hodnocení klinických znalostí AI) dosáhl model GPT-4 Medprompt přesnosti 90,2 % — nárůst o 22,6 p.b. oproti nejlepšímu výsledku roku 2022. Od vzniku benchmarku v roce 2019 se výkon AI na MedQA téměř ztrojnásobil. Pozoruhodné je, že GPT-4 Medprompt využíval prompt engineering místo fine-tuningu a překonal specializované medicínské modely[24].
MediTron-70B — otevřená medicínská LLM, která dosáhla 70,2 % na MedQA — nejlepší výsledek mezi modely s otevřeným kódem, ačkoli nižší než výsledky uzavřených modelů GPT-4 Medprompt a Med-PaLM 2[25].
Medicínské inovace. Mezi významné systémy roku 2023 patří: SynthSR (zlepšení vizualizace mozkových struktur z nízkokvalitních MRI skenů), ImmunoSEIRA (AI infračervené senzory pro diagnostiku neurodegenerativních onemocnění), EVEscape (předpovídání evoluce virů pro prevenci pandemií), AlphaMissense (klasifikace missense mutací)[1].
Schválení FDA. V roce 2022 FDA schválilo 139 zdravotnických prostředků na bázi AI — nárůst o 12,1 % oproti roku 2021. Od roku 2012 se počet takových schválení zvýšil více než čtyřicetpětinásobně[26].
Kapitola 6. Vzdělávání
Kapitola se zabývá trendy ve vzdělávání v oblasti informatiky a AI[1].
Vysokoškolské vzdělávání
Počet absolventů bakalářského studia informatiky v USA a Kanadě nadále roste. Počet magistrů zůstává relativně stabilní a počet doktorů mírně roste. Od roku 2018 počet magistrů a doktorů informatiky poněkud klesl[1].
Podíl mezinárodních studentů se snížil na všech úrovních vzdělávání, obzvláště výrazně v magisterském studiu. V celosvětovém měřítku se počet anglicky vedených vzdělávacích programů souvisejících s AI ztrojnásobil od roku 2017[1].
ChatGPT ve vzdělávání
Podle průzkumu Walton Foundation 88 % učitelů a 79 % studentů se domnívá, že ChatGPT má pozitivní vliv na vzdělávací proces. 76 % učitelů a 65 % studentů zastává názor, že je důležité integrovat ChatGPT do výuky[27].
Kapitola 7. Politika a správa
Kapitola analyzuje legislativní a regulační aktivitu v oblasti AI na globální, americké a evropské úrovni[1].
Globální tendence
Zmínky o AI v legislativních procesech po celém světě dosáhly rekordní úrovně. Je patrný posun od čistě stimulačních opatření k restriktivní legislativě, což svědčí o rostoucí pozornosti regulátorů vůči potenciálním rizikům AI[1].
Tematika přijatých zákonů v roce 2023 se výrazně rozšířila a zahrnuje ozbrojené síly a národní bezpečnost, občanská práva, obchod, vzdělávání, pracovní vztahy, vědu a technologie[1].
Regulace v USA
Počet regulačních aktů souvisejících s AI dosáhl 25 v roce 2023 (nárůst o 56,3 % oproti roku 2022). Nejčastějším tématem byl zahraniční obchod a mezinárodní finance. Podíl regulačních aktů s vysokou a střední mírou relevance k AI vzrostl ve srovnání s předchozími lety[1].
Významnou událostí roku 2023 byl Prezidentský výnos Bidena o AI (Executive Order on AI), zaměřený mimo jiné na vytvoření Národního zdroje pro výzkum AI (National AI Research Resource) pro zajištění rovných příležitostí mezi průmyslem a akademickou sférou[28].
Regulace v EU
V Evropské unii je patrná podobná tendence k nárůstu počtu regulačních aktů souvisejících s AI. Významným úspěchem roku 2023 bylo prosazení AI Act — prvního komplexního zákona o AI na světě[1].
Kapitola 8. Rozmanitost
Kapitola zkoumá genderovou a etnickou rozmanitost mezi AI odborníky. Navzdory určitému pokroku jsou ženy a příslušníci menšin nadále výrazně nedostatečně zastoupeni v oblasti AI jak v průmyslu, tak v akademické sféře[1].
Kapitola 9. Veřejné mínění
Kapitola analyzuje veřejné vnímání AI na základě mezinárodních průzkumů a dat ze sociálních sítí[1].
Mezinárodní průzkumy
Informovanost a znepokojení. Podle údajů Ipsos 66 % respondentů (nárůst z 60 %) se domnívá, že AI výrazně ovlivní jejich život v příštích 3–5 letech. Přitom 52 % vyjadřuje nervozitu vůči produktům AI (nárůst o 13 p.b. od roku 2022)[4].
Ekonomická očekávání. Pouze 37 % respondentů se domnívá, že AI zlepší jejich práci, 34 % — že zlepší ekonomiku, a 32 % — že pozitivně ovlivní trh práce[4].
Demografické rozdíly. Mladší generace jsou výrazně optimističtější: 59 % příslušníků generace Z se domnívá, že AI zlepší zábavu, oproti 40 % u baby-boomers. Lidé s vyšší úrovní příjmů a vzdělání jsou také optimističtější[1].
Rozpoznatelnost ChatGPT. Podle mezinárodního průzkumu Torontské univerzity 63 % respondentů zná ChatGPT, přičemž přibližně polovina z nich ho používá alespoň jednou týdně[29].
Data ze sociálních sítí
Analýza Quid více než 7 milionů příspěvků na sociálních sítích za rok 2023 odhalila, že modely GraphCast a Claude 2.1 získaly nejvyšší ukazatel pozitivního sentimentu (net sentiment score). GPT-4 přitahoval největší podíl pozornosti v prvním čtvrtletí, zatímco ke konci roku se pozornost přesunula na Gemini a Grok[1].
Významné AI modely roku 2023
Zpráva zaznamenává vznik řady klíčových modelů[1]:
| Model | Vývojář | Typ | Datum | Významnost |
|---|---|---|---|---|
| GPT-4 | OpenAI | LLM, multimodální | Březen 2023 | Jeden z nejvýkonnějších LLM; lídr HELM |
| PaLM 2 | LLM | Květen 2023 | Rozšířené vícejazyčné schopnosti | |
| Llama 2 | Meta | LLM (otevřená) | Červenec 2023 | Přední otevřený model; verze 7B/13B/70B |
| Claude 2 / 2.1 | Anthropic | LLM | Červenec / Listopad 2023 | Kontextové okno až 200K tokenů |
| Mistral 7B | Mistral AI | LLM (otevřená) | Září 2023 | Kompaktní vysoce výkonný model |
| DALL-E 3 | OpenAI | Generování obrázků | Říjen 2023 | Zlepšená kvalita a dodržování promptů |
| Gemini / Gemini Ultra | LLM, multimodální | Prosinec 2023 | První LLM, která překonala člověka na MMLU | |
| Mixtral 8×7B | Mistral AI | LLM (MoE, otevřená) | Prosinec 2023 | Architektura Mixture-of-Experts |
| Midjourney v6 | Midjourney | Generování obrázků | Prosinec 2023 | Zlepšená kvalita a intuitivní prompty |
| Whisper v3 | OpenAI | Rozpoznávání řeči | Listopad 2023 | Zvýšená přesnost, rozšířená jazyková podpora |
Metodologie
Zpráva využívá data z mnoha zdrojů[1]:
- Publikace a patenty: OpenAlex, WIPO, USPTO, data Epoch AI.
- Benchmarky: Papers With Code, CRFM (HELM), specializované žebříčky.
- Investice: Quid (Capital IQ, Crunchbase), data o více než 8 milionech společností.
- Trh práce: Lightcast, LinkedIn, Stack Overflow.
- Korporátní aktivita: McKinsey & Company, Seeking Alpha (earnings calls).
- Robotika: International Federation of Robotics (IFR).
- Regulace: Federal Register (USA), EUR-Lex (EU), Govini.
- Veřejné mínění: Ipsos, Pew Research Center, University of Toronto (GPO-AI), Quid (sociální média).
- Vzdělávání: CRA Taulbee Survey, Informatics Europe, Studyportals, Code.org, Walton Foundation.
- Medicína: FDA, Papers With Code (MedQA).
Odhady nákladů na trénování modelů byly připraveny ve spolupráci s Epoch AI na základě analýzy typu a množství hardwaru, délky trénování a cen pronájmu cloudových služeb[2].
Autorský kolektiv
Zpráva byla připravena pod vedením spoluředitelů Raye Perraulta (Ray Perrault) a Jacka Clarka (Jack Clark) za účasti širokého okruhu výzkumníků a partnerských organizací. AI Index je projektem Stanfordského institutu HAI (Human-Centered Artificial Intelligence)[1].
Odkazy
- Stanford HAI — AI Index Report 2024 (úplný text): https://aiindex.stanford.edu/report/
- Epoch AI — data o nákladech na trénování a výpočetních trendech: https://epochai.org/
- Papers With Code — benchmarky a žebříčky: https://paperswithcode.com/
- CRFM HELM — Holistic Evaluation of Language Models: https://crfm.stanford.edu/helm/
- AI Incident Database: https://incidentdatabase.ai/
- International Federation of Robotics: https://ifr.org/
- McKinsey Global Survey on AI: https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
Literatura
- Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/
- Epoch AI (2023). AI Training Cost Estimates and Compute Trends. https://epochai.org/
- Liang, P. et al. (2022). Holistic Evaluation of Language Models. https://arxiv.org/abs/2211.09110
- Hendrycks, D. et al. (2021). Measuring Massive Multitask Language Understanding. https://arxiv.org/abs/2009.03300
- Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. https://arxiv.org/abs/2311.16502
- Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
- Gandhi, K. et al. (2023). Understanding Social Reasoning in Language Models with Language Models. https://arxiv.org/abs/2306.15448
- Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? https://arxiv.org/abs/2304.15004
- Chen, L. et al. (2023). How Is ChatGPT's Behavior Changing over Time? https://arxiv.org/abs/2307.09009
- Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. https://arxiv.org/abs/2305.16291
- Mankowitz, D. J. et al. (2023). Faster sorting algorithms discovered using deep reinforcement learning. Nature. https://doi.org/10.1038/s41586-023-06004-9
- Lam, R. et al. (2023). Learning skillful medium-range global weather forecasting. Science. https://doi.org/10.1126/science.adi2336
- Merchant, A. et al. (2023). Scaling deep learning for materials discovery. Nature. https://doi.org/10.1038/s41586-023-06735-9
- Ha, T. et al. (2023). AI-driven robotic chemist for autonomous synthesis of organic molecules. Science Advances. https://doi.org/10.1126/sciadv.adj0461
- Shen, T. et al. (2023). Flexible Isosurface Extraction for Gradient-Based Mesh Optimization. ACM Transactions on Graphics. https://doi.org/10.1145/3592430
- Nori, H. et al. (2023). Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine. https://arxiv.org/abs/2311.16452
- Chen, Z. et al. (2023). MEDITRON-70B: Scaling Medical Pretraining for Large Language Models. https://arxiv.org/abs/2311.16079
- Mai, K. T. et al. (2023). Warning: Humans Cannot Reliably Detect Speech Deepfakes. https://arxiv.org/abs/2301.07829
- Motoki, F. et al. (2023). More Human than Human: Measuring ChatGPT Political Bias. https://doi.org/10.1007/s11127-023-01097-2
- McKinsey & Company (2023). The State of AI in 2023: Generative AI's Breakout Year. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
- International Federation of Robotics (2023). World Robotics Report 2023. https://ifr.org/worldrobotics/
- The White House (2023). Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence. https://www.whitehouse.gov/briefing-room/presidential-actions/2023/10/30/executive-order-on-the-safe-secure-and-trustworthy-development-and-use-of-artificial-intelligence/
- Fleming, S. L. et al. (2023). MedAlign: A Clinician-Generated Dataset for Instruction Following With Electronic Medical Records. https://arxiv.org/abs/2308.14089
- Iglesias, J. E. et al. (2023). SynthSR: A public AI tool to turn heterogeneous clinical brain scans into high-resolution T1-weighted images for 3D morphometry. Science Advances. https://doi.org/10.1126/sciadv.add3607
- Cheng, J. et al. (2023). Accurate Proteome-Wide Missense Variant Effect Prediction With AlphaMissense. Science. https://doi.org/10.1126/science.adg7492
Poznámky
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/
- ↑ 2.0 2.1 2.2 Epoch AI (2023). AI Training Cost Estimates. https://epochai.org/
- ↑ 3.0 3.1 3.2 3.3 3.4 Quid (2023). AI Investment Data. https://quid.com/
- ↑ 4.0 4.1 4.2 Ipsos (2023). Global Perceptions of AI Survey. https://www.ipsos.com/
- ↑ Pew Research Center (2023). Public Views on AI. https://www.pewresearch.org/
- ↑ Liang, P. et al. (2022). Holistic Evaluation of Language Models. https://arxiv.org/abs/2211.09110
- ↑ Hendrycks, D. et al. (2021). Measuring Massive Multitask Language Understanding. https://arxiv.org/abs/2009.03300
- ↑ Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. https://arxiv.org/abs/2311.16502
- ↑ Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
- ↑ Gandhi, K. et al. (2023). Understanding Social Reasoning in Language Models with Language Models. https://arxiv.org/abs/2306.15448
- ↑ Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. https://arxiv.org/abs/2305.16291
- ↑ Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? https://arxiv.org/abs/2304.15004
- ↑ Chen, L. et al. (2023). How Is ChatGPT's Behavior Changing over Time? https://arxiv.org/abs/2307.09009
- ↑ AI Incident Database (2023). https://incidentdatabase.ai/
- ↑ Mai, K. T. et al. (2023). Warning: Humans Cannot Reliably Detect Speech Deepfakes. https://arxiv.org/abs/2301.07829
- ↑ Motoki, F. et al. (2023). More Human than Human: Measuring ChatGPT Political Bias. https://doi.org/10.1007/s11127-023-01097-2
- ↑ McKinsey & Company (2023). The State of AI in 2023: Generative AI's Breakout Year. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
- ↑ International Federation of Robotics (2023). World Robotics Report 2023. https://ifr.org/worldrobotics/
- ↑ Mankowitz, D. J. et al. (2023). Faster sorting algorithms discovered using deep reinforcement learning. Nature. https://doi.org/10.1038/s41586-023-06004-9
- ↑ Lam, R. et al. (2023). Learning skillful medium-range global weather forecasting. Science. https://doi.org/10.1126/science.adi2336
- ↑ Merchant, A. et al. (2023). Scaling deep learning for materials discovery. Nature. https://doi.org/10.1038/s41586-023-06735-9
- ↑ Ha, T. et al. (2023). AI-driven robotic chemist for autonomous synthesis of organic molecules. Science Advances. https://doi.org/10.1126/sciadv.adj0461
- ↑ Shen, T. et al. (2023). Flexible Isosurface Extraction for Gradient-Based Mesh Optimization. ACM Transactions on Graphics. https://doi.org/10.1145/3592430
- ↑ Nori, H. et al. (2023). Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine. https://arxiv.org/abs/2311.16452
- ↑ Chen, Z. et al. (2023). MEDITRON-70B: Scaling Medical Pretraining for Large Language Models. https://arxiv.org/abs/2311.16079
- ↑ U.S. Food and Drug Administration (2023). Artificial Intelligence and Machine Learning (AI/ML)-Enabled Medical Devices. https://www.fda.gov/medical-devices/software-medical-device-samd/artificial-intelligence-and-machine-learning-aiml-enabled-medical-devices
- ↑ Impact Research / Walton Family Foundation (2023). ChatGPT and Education Survey. https://www.waltonfamilyfoundation.org/
- ↑ The White House (2023). Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence. https://www.whitehouse.gov/briefing-room/presidential-actions/2023/10/30/executive-order-on-the-safe-secure-and-trustworthy-development-and-use-of-artificial-intelligence/
- ↑ Global Public Opinion on AI Survey, University of Toronto (2023). https://www.mediatechdemocracy.com/