The 2024 AI Index Report (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

AI Index Report 2024 — ikapitong taunang edisyon ng ulat na AI Index, inihanda ng Stanford Institute for Human-Centered Artificial Intelligence (Stanford HAI)[1]. Ang ulat ng 2024 ay ang pinaka-malawak sa buong kasaysayan ng publikasyon at inilabas sa sandaling ang impluwensya ng AI sa lipunan ay naging walang kaparis na kapansin-pansin. Kasama sa edisyon ang mga bagong pagtatantya ng gastos sa pagsasanay ng mga modelo, detalyadong pagsusuri ng responsableng AI, at sa unang pagkakataon ay naglalaman ng hiwalay na kabanata tungkol sa impluwensya ng AI sa agham at medisina. Sinusubaybayan, pinagkakasunud-sunod, at inivisuwalisa ng ulat ang mga datos na may kaugnayan sa artificial intelligence, na nagbibigay ng obhetibo at maingat na naberipikahang impormasyon para sa mga tagagawa ng patakaran, mananaliksik, mga pinuno, mamamahayag, at sa pangkalahatang publiko.

Istraktura ng ulat

Ang ulat ng 2024 ay binubuo ng siyam na tematikal na kabanata[1]:

  1. Pananaliksik at Pagpapaunlad (Research and Development) — mga trend sa mga publikasyon, patent, foundation models, at mga bukas na proyekto.
  2. Teknikal na Pagganap (Technical Performance) — mga benchmark, paghahambing sa antas ng tao, multimodality.
  3. Responsableng AI (Responsible AI) — mga insidente, kaligtasan, pagkiling, privacy.
  4. Ekonomiya (Economy) — mga pamumuhunan, merkado ng trabaho, corporate na paggamit, robotics.
  5. Agham at Medisina (Science and Medicine) — bagong kabanata: mga tagumpay sa agham at medikal na aplikasyon ng AI.
  6. Edukasyon (Education) — paghahanda ng mga tauhan, mga programang pang-edukasyon, ChatGPT sa pagtuturo.
  7. Patakaran at Pamamahala (Policy and Governance) — batas, regulasyon, pambansang estratehiya.
  8. Pagkakaiba-iba (Diversity) — gender at etnikong pagkakaiba-iba sa larangan ng AI.
  9. Opinyon ng Publiko (Public Opinion) — saloobin ng populasyon sa AI batay sa mga internasyonal na survey.

Mga pangunahing konklusyon ng ulat (Top 10)

Pinagtibay ng mga may-akda ng ulat ang sampung pangunahing tesis para sa 2024[1]:

1. Ang AI ay lumalagpas sa mga tao sa ilang mga gawain, ngunit hindi sa lahat

Ang mga sistema ng artificial intelligence ay nalampasan ang antas ng tao sa ilang mga benchmark, kabilang ang pag-uuri ng imahe (ImageNet), visual na pangangatuwiran (VQA), at pag-unawa sa Ingles (SuperGLUE). Gayunpaman, ang AI ay nananatiling mas mahina pa rin kaysa sa mga tao sa mas kumplikadong mga gawain: matematika sa antas ng olimpiyada (MATH), visual na pang-araw-araw na pangangatuwiran, at pagpaplano[1].

2. Ang industriya ay nangunguna sa mga advanced na pananaliksik sa AI

Noong 2023, lumikha ang industriya ng 51 makabuluhang modelo ng Machine Learning, habang ang akademya ay 15 lamang. Bukod dito, 21 modelo ang resulta ng magkasamang gawa ng industriya at akademya — isang rekord na tagapagpahiwatig[1].

3. Ang gastos sa pagsasanay ng mga advanced na modelo ay mabilis na tumataas

Ayon sa mga pagtatantya ng AI Index at Epoch AI, ang gastos sa pagsasanay ng GPT-4 ay humigit-kumulang 78 milyong dolyar, at ang Gemini Ultra ng Google ay humigit-kumulang 191 milyong dolyar[2]. Para sa paghahambing: ang pagsasanay ng orihinal na Transformer modelo noong 2017 ay nagkahalaga ng humigit-kumulang 900 dolyar, at ang RoBERTa Large noong 2019 ay humigit-kumulang 160 libong dolyar[1].

4. Nangunguna ang USA bilang pinagmulan ng mga nangungunang modelo ng AI

Noong 2023, 61 makabuluhang modelo ng AI ang nilikha sa mga organisasyon ng USA, na malayo ang agwat sa EU (21 modelo) at China (15 modelo)[1].

5. Ang mga standardisadong pagtatasa ng responsibilidad ng LLM ay malubhang nahuhuli

Natuklasan ng pananaliksik ng AI Index ang malaking kakulangan ng standardisasyon sa pag-uulat ng responsableng AI. Ang mga nangungunang developer — OpenAI, Google, at Anthropic — ay sinusubukan ang kanilang mga modelo sa iba't ibang benchmark ng responsableng AI, na nagpapahirap sa sistematikong paghahambing ng mga panganib[1].

6. Mabilis na lumalaki ang mga pamumuhunan sa generative AI

Sa kabila ng pangkalahatang pagbaba ng mga pribadong pamumuhunan sa AI, ang pagpopondo ng generative AI ay halos walong beses na lumago kumpara sa 2022, na umabot sa 25.2 bilyong dolyar. Nagsagawa ng malalaking rounds ng pagkalap ng pondo ang OpenAI, Anthropic, Hugging Face, at Inflection[3].

7. Pinapataas ng AI ang produktibidad at kalidad ng trabaho

Maraming pananaliksik noong 2023 ang nagpakita na ang AI ay tumutulong sa mga manggagawa na maisagawa ang mga gawain nang mas mabilis at may mas mataas na kalidad, at nagbabawas din ng agwat sa pagitan ng mga mababa at mataas na kwalipikadong espesyalista. Gayunpaman, binabalaan ng ilang mga pag-aaral na ang paggamit ng AI nang walang wastong kontrol ay maaaring humantong sa pagbaba ng produktibidad[1].

8. Ang siyentipikong pag-unlad ay nagbibigay-tulin dahil sa AI

Noong 2023, ipinakita ang mga makabuluhang siyentipikong aplikasyon ng AI: AlphaDev (pagpapabilis ng mga sorting algorithm), GNoME (pagdiskubre ng mga bagong materyales), GraphCast (pagtataya ng panahon), at iba pa[1].

9. Mabilis na lumobo ang bilang ng mga regulatoryong batas tungkol sa AI sa USA

Noong 2023, 25 regulatoryong batas na may kaugnayan sa AI ang ipinasa — isang pagtaas ng 56.3% kumpara sa nakaraang taon. Para sa paghahambing: noong 2016, isang ganoong batas lamang ang ipinasa[1].

10. Ang mga tao ay lalong may kamalayan sa impluwensya ng AI — at lalong nangangamba

Ayon sa datos ng Ipsos, ang bahagi ng mga sumasagot na naniniwala na ang AI ay malaki ang magiging impluwensya sa kanilang buhay sa susunod na 3–5 taon ay tumaas mula 60% hanggang 66%. Bukod dito, 52% ang nagpapahayag ng kaba tungkol sa mga produkto at serbisyo ng AI — isang pagtaas ng 13 puntos kumpara sa 2022. Sa USA, ayon sa datos ng Pew Research, 52% ng mga Amerikano ang nag-uulat ng mas malaking pag-aalala kaysa kasabikan kaugnay ng AI (37% noong 2022)[4][5].

Kabanata 1. Pananaliksik at Pagpapaunlad

Sinusuri ng kabanata ang mga trend sa mga publikasyon, patent, mga advanced na sistema ng AI, foundation models, mga kumperensya, at mga bukas na proyektong software[1].

Mga Publikasyon

Ang kabuuang bilang ng mga publikasyon sa AI ay patuloy na lumalaki: mula sa humigit-kumulang 88,000 noong 2010 hanggang sa mahigit 240,000 noong 2022 (halos tatlong beses na pagtaas). Ang pagtaas sa huling taon ay 1.1%[1].

Mga Patent

Ang bilang ng mga ipinagkaloob na patent sa larangan ng AI sa buong mundo ay mabilis na tumaas: mula 2021 hanggang 2022 ang pagtaas ay 62.7%, at mula 2010 — mahigit 31 beses. Nangunguna ang China sa pagpapatente ng AI: noong 2022, 61.1% ng mga aplikasyon ng patent ay kabilang dito, habang ang bahagi ng USA ay 20.9% (pagbaba mula 54.1% noong 2010)[1].

Mga Advanced na Modelo

Noong 2023, patuloy na nangibabaw ang industriya sa paglikha ng mga advanced na modelo. Naglabas ng 149 foundation models — dalawang beses na higit kaysa noong 2022. Sa mga ito, 65.7% ay may bukas na source code (kumpara sa 44.4% noong 2022 at 33.3% noong 2021)[1].

Gastos sa pagsasanay. Ang pakikipagtulungan ng AI Index sa Epoch AI ay nagbigay ng mas tumpak na mga pagtatantya ng gastos sa pagsasanay ng mga modelo. Ang pagtaas ng mga gastos ay malinaw na ipinapakita ng sumusunod na dinamika[2]:

Modelo Taon Tinatayang gastos sa pagsasanay (USD)
Transformer 2017 ~930
BERT-Large 2018 ~3,300
RoBERTa Large 2019 ~160,000
GPT-3 175B 2020 ~4.3 milyon
PaLM 540B 2022 ~12.4 milyon
Llama 2 70B 2023 ~3.9 milyon
GPT-4 2023 ~78 milyon
Gemini Ultra 2023 ~191 milyon

Nasyonalidad. Noong 2023, 61 makabuluhang modelo ang nilikha ng mga organisasyon ng USA, 21 — ng EU, 15 — ng China. Kinukumpirma nito ang nangungunang papel ng USA sa pagbuo ng mga advanced na sistema ng AI[1].

Bukas na Software

Ang bilang ng mga proyektong AI sa GitHub ay tuluy-tuloy na lumalaki: mula 845 noong 2011 hanggang humigit-kumulang 1.8 milyon noong 2023. Noong 2023, naitala ang pagtaas na 59.3%. Ang kabuuang bilang ng mga bituin para sa mga proyektong AI ay tatlong beses na lumaki: mula 4.0 milyon noong 2022 hanggang 12.2 milyon noong 2023[1].

Mga Kumperensya

Ang pagdalo sa mga nangungunang kumperensya sa AI (NeurIPS, ICML, ICLR, at iba pa) ay patuloy na lumalaki, na sumasalamin sa lumalaking interes sa larangan[1].

Kabanata 2. Teknikal na Pagganap

Sinusuri ng kabanata ang pag-unlad ng mga sistema ng AI sa mga gawain ng pagproseso ng wika, paglikha ng imahe, pangangatuwiran, pag-coding, at agentic na pag-uugali[1].

Kalagayan ng pagganap ng AI

Noong 2023, ang AI ay lumalagpas sa antas ng tao sa ilang mga kategorya ng mga gawain: pag-uuri ng imahe (mula 2015), pangunahing pag-unawa sa teksto (mula 2017), visual na pangangatuwiran (mula 2020), lohikal na hinuha sa natural na wika (mula 2021). Gayunpaman, sa mga gawaing tulad ng matematika sa antas ng olimpiyada (MATH) at pagpaplano, ang AI ay nananatiling mas mahina pa kaysa sa mga tao[1].

Mga Modelo ng Wika

HELM. Ang benchmark na Holistic Evaluation of Language Models (HELM), na binuo sa Stanford, ay sinusuri ang mga LLM sa sampung sitwasyon, kabilang ang pag-unawa sa teksto, matematika, at legal na pangangatuwiran. Noong Enero 2024, nangunguna ang GPT-4 na may mean win rate na 0.96[6].

MMLU. Sinusuri ng benchmark na Massive Multitask Language Understanding (MMLU) ang mga modelo sa 57 paksa. Ang Gemini Ultra ng Google ang unang lumampas sa baseline na antas ng tao (89.8%), na nakakuha ng 90.0% — isang pagpapabuti ng 14.8 puntos kumpara sa 2022 at 57.6 puntos mula nang malikha ang benchmark noong 2019[7].

Chatbot Arena. Ang platform na inilunsad noong 2023 ay nagbibigay-daan sa mga gumagamit na ihambing ang mga output ng mga anonymous na modelo. Noong simula ng 2024, ang GPT-4 Turbo ay kinikilala bilang pinaka-gustong modelo batay sa mahigit 200,000 boto[1].

Multimodality

Tradisyonal na limitado ang mga sistema ng AI sa isang modality. Gayunpaman, noong 2023 lumitaw ang mga makapangyarihang multimodal na modelo — Google Gemini at OpenAI GPT-4, na kayang iproseso ang teksto, imahe, at sa ilang mga kaso ay audio rin. Ipinakita ng benchmark na MMMU (Massive Multi-discipline Multimodal Understanding) na nangunguna ang Gemini Ultra na may 59.4%, ngunit ito ay mas mababa pa rin kaysa sa antas ng isang dalubhasang tao (82.6%)[8].

Pangangatuwiran

GPQA. Ang benchmark na Graduate-Level Google-Proof Q&A ay naglalaman ng 448 mahirap na tanong sa biolohiya, pisika, at kimika, na hindi masasagot sa pamamagitan ng simpleng paghahanap sa Google. Ang GPT-4 na may paghahanap ay nakakuha ng 41.0%, na mas mababa sa antas ng mga dalubhasa (72.5%), ngunit mas mataas kaysa sa mga hindi dalubhasa (30.5%)[9].

Teorya ng Kamalayan (BigToM). Ang pagsubok sa kakayahan ng mga LLM na mag-modelo ng mga paniniwala ng ibang tao ay nagpakita na ang GPT-4 ay papalapit sa antas ng tao sa mga gawaing direktang hinuha ng mga paniniwala at pagkilos, kahit na nananatili pa itong mas mahina sa mga gawaing baligtad na hinuha ng mga paniniwala[10].

Pag-coding

Sinusuri ng benchmark na HumanEval ang paglikha ng code. Noong 2023, patuloy na pinahusay ng mga modelo ang kanilang mga tagapagpahiwatig, at ang SWE-bench — isang bagong benchmark para sa pagtatasa ng paglutas ng mga tunay na gawain sa software engineering — ay nagpakita na kahit ang pinakamahusay na mga modelo ay nalulutas lamang ng maliit na bahagi ng mga gawain, na nagpapakita ng malaking potensyal para sa karagdagang pag-unlad[1].

Agentic na Pag-uugali

Ang mga sistema ng AI ay lalong sinusuri sa mga agentic na sitwasyon. Ipinakita ng Voyager (Microsoft) ang kakayahang mag-aral nang autonomo sa dinamikong kapaligiran ng Minecraft, na nangolekta ng 3.3 beses na mas maraming natatanging bagay, lumipat ng 2.3 beses na mas malayo, at nakamit ang mga pangunahing yugto ng 15.3 beses na mas mabilis kumpara sa mga naunang modelo[11]. Ipinakita ng MLAgentBench na ang mga ahente ng AI para sa siyentipikong pananaliksik ay may pangako, ngunit ang mga resulta ay malaki ang pagkakaiba sa pagitan ng mga gawain[1].

Mga Katangian ng LLM

Emergent na Pag-uugali. Isang pananaliksik noong 2023 ang nagduda sa pananaw tungkol sa hindi maiiwasang paglabas ng hindi mahuhulaan na "emergent" na mga kakayahan kapag pinalaki ang mga modelo. Kapag gumagamit ng linear at tuluy-tuloy na sukatan, ang mga ganitong kakayahan ay halos nawawala[12].

Pagbaba ng Pagganap. Ipinakita ng pananaliksik ng Stanford at Berkeley na ang pagganap ng GPT-4 ay maaaring malaki ang pagbabago sa pagitan ng mga update: ang bersyon ng Hunyo 2023 ay 42 puntos na mas mahina kaysa sa bersyon ng Marso sa paglikha ng code at 33 puntos na mas mahina sa mga gawaing matematika[13].

Self-correction. Ipinakita ng mga mananaliksik mula sa DeepMind at Unibersidad ng Illinois na ang mga LLM ay mahirap ayusin ang kanilang sariling pangangatuwiran nang walang panlabas na gabay: ang pagganap ng GPT-4 ay bumaba sa lahat ng nasubok na benchmark sa pagtatangkang self-correction[1].

Kabanata 3. Responsableng AI

Nakatuon ang kabanata sa mga pangunahing dimensyon ng responsableng AI: privacy, transparency, kaligtasan, at katarungan[1].

Mga Insidente sa Larangan ng AI

Nagtala ang database ng AI Incident Database ng 123 insidente noong 2023 — isang pagtaas ng 32.3% kumpara sa 2022. Mula 2013, ang bilang ng mga insidente ay lumaki ng mahigit dalawampung beses. Ang pagtaas ay sanhi ng parehong pagpapalawak ng paggamit ng AI at ng pagtaas ng kamalayan sa mga etikal na panganib nito[14].

Standardisasyon ng Mga Benchmark ng Responsableng AI

Ang pagsusuri sa limang nangungunang developer (OpenAI, Meta, Anthropic, Google, Mistral AI) ay nagsiwalat ng kawalan ng iisang hanay ng mga benchmark para sa pagtatasa ng responsableng AI. Kahit na ang mga karaniwang benchmark ng kakayahan (MMLU, HellaSwag, ARC Challenge, HumanEval, GSM8K) ay malawakang ginagamit, ang mga benchmark ng responsableng AI (TruthfulQA, RealToxicityPrompts, ToxiGen, BOLD, BBQ) ay magkakaibang ginagamit: ang TruthfulQA ay ginagamit ng hindi hihigit sa tatlo sa limang developer, at isang developer ay walang naiuulat na pagsubok ayon sa mga benchmark ng responsableng AI[1].

AI at Mga Halalan

Ipinakita ng mga pananaliksik noong 2023 na tama lamang na natukoy ng mga tao ang mga audio deepfake sa 73% ng mga kaso. Inaasahang habang umuunlad ang mga teknolohiya ng paglikha ng tunog, ang katumpakan ng pagkilala ay bababa. Lumilikha ito ng mga panganib ng manipulasyon ng mga pulitikal na kampanya at nagbibigay sa mga pulitiko ng pagkakataong itanggi ang mga nakaka-kompromisong rekording bilang peke (ang tinatawag na "liar's dividend")[15].

Ang mga pananaliksik sa mga LLM para sa pulitikal na pagkiling ay natuklasan ang ugnayan sa pagitan ng mga default na sagot ng ChatGPT at ng mga posisyon ng Demokratikong Partido at negatibong ugnayan sa mga posisyon ng Republikano[16].

Kabanata 4. Ekonomiya

Sinisiyasat ng kabanata ang mga trend sa mga pamumuhunan, trabaho, corporate na paggamit ng AI, at robotics[1].

Mga Pamumuhunan

Mga Pangkalahatang Trend. Ang kabuuang corporate na pamumuhunan sa AI ay bumaba sa 189.2 bilyong dolyar noong 2023 (pagbaba ng ~20% kumpara sa 2022). Gayunpaman, sa loob ng isang dekada, ang dami ng pamumuhunan ay lumaki ng labintatlong beses. Ang mga pribadong pamumuhunan ay bumaba sa ikalawang taon nang sunud-sunod, kahit na ang pagbaba ay hindi gaanong kapansin-pansin kaysa sa 2021–2022[3].

Generative AI. Ang mga pamumuhunan sa generative AI ay umabot sa 25.2 bilyong dolyar — halos siyam na beses na pagtaas kumpara sa 2022 at tatlumpung beses kumpara sa 2019. Ang generative AI ay nag-ambag ng mahigit isang-kapat ng lahat ng pribadong pamumuhunan sa AI[3].

Rehiyonal na Pamamahagi. Ang USA na may pamumuhunan na 67.2 bilyong dolyar ay mas nauna sa China (7.8 bilyon) ng 8.7 beses at sa United Kingdom (3.8 bilyon) ng 17.8 beses. Ang mga pribadong pamumuhunan sa China ay bumaba ng 44.2%, sa EU at United Kingdom — ng 14.1%, habang sa USA ay tumaas ng 22.1%[3].

Mga Startup. Ang bilang ng mga bagong kumpanyang AI na nakatanggap ng pagpopondo ay tumaas sa 1,812 (pagtaas ng 40.6%). Sa larangan ng generative AI, 99 bagong startup ang nakatanggap ng pagpopondo (kumpara sa 56 noong 2022)[3].

Merkado ng Trabaho

Ang bahagi ng mga bakante na may kaugnayan sa AI sa USA ay bumaba mula 2.0% noong 2022 hanggang 1.6% noong 2023. Katulad na tendensya ang naoobserbahan sa buong mundo. Ang pagbaba ay ipinaliwanag ng pagbaba ng pag-hire mula sa malalaking kumpanyang AI at pagbaba ng bahagi ng mga teknikal na bakante[1].

Ang migrasyon ng mga espesyalista sa AI mula sa akademya patungong industriya ay patuloy na nagbibigay-tulin: noong 2022, 70.7% ng mga bagong may-hawak ng doktorado sa AI ang nagtrabaho sa industriya (kumpara sa 40.9% noong 2011), at 20.0% lamang — sa akademya (kumpara sa 41.6%)[1].

Corporate na Paggamit

Ayon sa datos ng McKinsey, 55% ng mga organisasyon ang gumagamit ng AI (kabilang ang generative AI) sa kahit isang dibisyon ng negosyo — pagtaas mula 50% noong 2022 at 20% noong 2017. Bukod dito, 42% ng mga organisasyon ang nag-uulat ng pagbaba ng mga gastos, at 59% — ng pagtaas ng kita dahil sa AI[17].

Ang mga pagbanggit ng AI sa mga ulat ng kita ng mga kumpanyang Fortune 500 ay umabot sa 394 (halos 80% ng lahat ng kumpanya) — kapansin-pansing pagtaas mula 266 noong 2022. Ang pinaka-madalas na binanggit na paksa (19.7% ng lahat ng tawag) ay naging ang generative AI[1].

Robotics

Noong 2022, naka-install ang 553,000 na pang-industriyang robot — pagtaas ng 5.1% kumpara sa 2021 at mahigit tatlong beses mula 2012. Nangunguna ang China: mula 2013, nang malagpas nito ang Japan, ang bahagi ng China ay tumaas mula 20.8% hanggang 52.4% ng mga pandaigdigang pag-install noong 2022. Ang bahagi ng mga collaborative na robot ay tumaas mula 2.8% noong 2017 hanggang 9.9% noong 2022[18].

Kabanata 5. Agham at Medisina

Sa unang pagkakataon na isinama sa ulat, itinutuon ng kabanata ang papel ng AI sa mga siyentipikong natuklasan at medikal na inobasyon[1].

Mga Siyentipikong Tagumpay ng 2023

AlphaDev (DeepMind) — isang sistema ng Reinforcement Learning na nakatuklasan ng mga sorting algorithm na may mas kaunting mga instruksyon kaysa sa mga kasalukuyang pamantayan ng tao. Ilan sa mga natuklasang algorithm ay isinama sa karaniwang sorting library ng C++ (LLVM) — ang unang update sa bahaging ito ng library sa loob ng mahigit sampung taon[19].

GraphCast (DeepMind) — isang sistema ng pagtataya ng panahon batay sa mga graph neural network, na nagbibigay ng 10-araw na pagtataya sa loob ng wala pang isang minuto na may katumpakang lumalagpas sa nangungunang sistema ng modelling na HRES (European Centre for Medium-Range Weather Forecasts)[20].

GNoME (Google DeepMind) — isang modelo na gumagamit ng mga graph network para sa pinabilis na paghahanap ng mga bagong functional na materyales, na kritikal para sa pag-unlad sa robotics at industriya ng semiconductor[21].

Synbot — isang AI-pinamahalaang robot na chemist para sa autonomous na synthesis ng mga organikong molekula, na nakamit ang yield ng reaksyon na maihahambing o lumalagpas sa mga reference na halaga[22].

FlexiCubes (NVIDIA) — isang paraan ng pag-optimize ng 3D mesh gamit ang AI para mapabuti ang kalidad ng paglikha ng 3D na bagay sa computer graphics[23].

AI sa Medisina

Klinikal na Kaalaman. Sa benchmark na MedQA (pagtatasa ng klinikal na kaalaman ng AI), ang modelo na GPT-4 Medprompt ay nakamit ang katumpakan na 90.2% — pagtaas ng 22.6 puntos kumpara sa pinakamahusay na resulta ng 2022. Mula nang malikha ang benchmark noong 2019, ang pagganap ng AI sa MedQA ay halos tatlong beses na lumaki. Kapansin-pansin na ang GPT-4 Medprompt ay gumamit ng prompt engineering sa halip na fine-tuning, na nalampasan ang mga espesyalisadong medikal na modelo[24].

MediTron-70B — isang bukas na medikal na LLM na nagpakita ng 70.2% sa MedQA — ang pinakamahusay na resulta sa mga modelo na may bukas na code, kahit na mas mababa kaysa sa mga resulta ng mga saradong modelo na GPT-4 Medprompt at Med-PaLM 2[25].

Mga Medikal na Inobasyon. Kabilang sa mga makabuluhang sistema ng 2023: SynthSR (pagpapabuti ng pag-visualize ng mga istruktura ng utak mula sa mga mababang kalidad na MRI scan), ImmunoSEIRA (AI-infrared sensor para sa diagnostic ng mga neurodegenerative na sakit), EVEscape (pagtataya ng ebolusyon ng virus para sa pag-iwas sa mga pandemya), AlphaMissense (pag-uuri ng mga missense mutation)[1].

Pag-apruba ng FDA. Noong 2022, naaprubahan ng FDA ang 139 medikal na device na batay sa AI — pagtaas ng 12.1% kumpara sa 2021. Mula 2012, ang bilang ng mga ganitong pag-apruba ay lumaki ng mahigit 45 beses[26].

Kabanata 6. Edukasyon

Tinitingnan ng kabanata ang mga tendensya sa edukasyon sa larangan ng computer science at AI[1].

Mataas na Edukasyon

Ang bilang ng mga nagtapos ng bachelor's degree sa computer science sa USA at Canada ay patuloy na lumalaki. Ang bilang ng mga master ay nananatiling medyo matatag, at ang bilang ng mga doktora ay bahagyang tumataas. Mula 2018, ang bilang ng mga master at doktor ng computer science ay bahagyang bumaba[1].

Ang bahagi ng mga internasyonal na estudyante ay bumaba sa lahat ng antas ng edukasyon, lalo na kapansin-pansin — sa master's degree. Sa pandaigdigang antas, ang bilang ng mga programang pang-edukasyong nakatuon sa AI sa wikang Ingles ay tatlong beses na lumaki mula 2017[1].

ChatGPT sa Edukasyon

Ayon sa datos ng survey ng Walton Foundation, 88% ng mga guro at 79% ng mga estudyante ang naniniwala na ang ChatGPT ay may positibong impluwensya sa proseso ng edukasyon. 76% ng mga guro at 65% ng mga estudyante ang naniniwala na mahalaga ang pag-integrate ng ChatGPT sa pagtuturo[27].

Kabanata 7. Patakaran at Pamamahala

Sinusuri ng kabanata ang aktibidad sa batas at regulasyon sa larangan ng AI sa pandaigdigang, Amerikanong, at Europeanong antas[1].

Mga Pandaigdigang Tendensya

Ang mga pagbanggit ng AI sa mga prosesong pambatas sa buong mundo ay umabot sa rekord na antas. Nakita ang pagbabago mula sa mga purong pampalakas na hakbain patungong limitadong batas, na nagpapakita ng lumalaking atensyon ng mga regulator sa mga potensyal na panganib ng AI[1].

Ang paksa ng mga batas na ipinasa noong 2023 ay malaki ang pagpapalawak, na sumasaklaw sa mga sandatahang lakas at pambansang seguridad, sibil na karapatan, kalakalan, edukasyon, mga relasyong paggawa, agham at teknolohiya[1].

Regulasyon sa USA

Ang bilang ng mga regulatoryong batas na may kaugnayan sa AI ay umabot sa 25 noong 2023 (pagtaas ng 56.3% kumpara sa 2022). Ang pinaka-karaniwang paksa ay naging panlabas na kalakalan at internasyonal na pananalapi. Ang bahagi ng mga regulatoryong batas na may mataas at katamtamang kaugnayan sa AI ay lumaki kumpara sa mga nakaraang taon[1].

Isang makasaysayang pangyayari noong 2023 ang Kautusang Tagapagpaganap ni Pangulong Biden sa AI (Executive Order on AI), na naglalayong, bukod sa iba, lumikha ng National AI Research Resource para sa pagbibigay ng pantay na pagkakataon sa pagitan ng industriya at akademya[28].

Regulasyon sa EU

Sa European Union, katulad na tendensya ang nakikita ng pagtaas ng bilang ng mga regulatoryong batas na may kaugnayan sa AI. Isang makabuluhang tagumpay noong 2023 ang pag-abante ng AI Act — ang unang komprehensibong batas tungkol sa AI sa mundo[1].

Kabanata 8. Pagkakaiba-iba

Sinisiyasat ng kabanata ang gender at etnikong pagkakaiba-iba sa mga espesyalista sa AI. Sa kabila ng ilang pag-unlad, ang mga kababaihan at mga kinatawan ng mga minoridad ay nananatiling malaki ang kakulangan ng representasyon sa larangan ng AI, kapwa sa industriya at sa akademya[1].

Kabanata 9. Opinyon ng Publiko

Sinusuri ng kabanata ang pampublikong pananaw sa AI batay sa mga internasyonal na survey at datos ng mga social network[1].

Mga Internasyonal na Survey

Kamalayan at Pag-aalala. Ayon sa datos ng Ipsos, 66% ng mga sumasagot (pagtaas mula 60%) ang naniniwala na ang AI ay malaki ang magiging impluwensya sa kanilang buhay sa susunod na 3–5 taon. Bukod dito, 52% ang nagpapahayag ng kaba tungkol sa mga produkto ng AI (pagtaas ng 13 puntos mula 2022)[4].

Mga Inaasahang Pang-ekonomiya. 37% lamang ng mga sumasagot ang naniniwala na ang AI ay magpapabuti ng kanilang trabaho, 34% — na ito ay magpapabuti ng ekonomiya, at 32% — na ito ay magkakaroon ng positibong impluwensya sa merkado ng trabaho[4].

Mga Pagkakaibang Demograpiko. Ang mga kabataang henerasyon ay higit na optimistiko: 59% ng mga kinatawan ng Generation Z ang naniniwala na ang AI ay magpapabuti ng entertainment, kumpara sa 40% ng mga baby boomer. Ang mga taong may mas mataas na antas ng kita at edukasyon ay mas optimistiko rin[1].

Pagkilala sa ChatGPT. Ayon sa internasyonal na survey ng Unibersidad ng Toronto, 63% ng mga sumasagot ang may kaalaman tungkol sa ChatGPT, at humigit-kumulang kalahati sa kanila ay gumagamit nito nang hindi bababa sa isang beses sa isang linggo[29].

Datos ng Mga Social Network

Ang pagsusuri ng Quid sa mahigit 7 milyong post sa mga social network para sa 2023 ay nagsiwalat na ang mga modelo ng GraphCast at Claude 2.1 ay nakatanggap ng pinaka-mataas na net sentiment score. Ang GPT-4 ay nakakuha ng pinakamataas na bahagi ng atensyon sa unang quarter, habang sa pagtatapos ng taon ang pokus ay lumipat sa Gemini at Grok[1].

Mga Makabuluhang Modelo ng AI noong 2023

Nitala ng ulat ang paglabas ng ilang mahahalagang modelo[1]:

Modelo Developer Uri Petsa Kahalagahan
GPT-4 OpenAI LLM, multimodal Marso 2023 Isa sa pinaka-makapangyarihang LLM; lider ng HELM
PaLM 2 Google LLM Mayo 2023 Pinahusay na mga kakayahang multiwika
Llama 2 Meta LLM (bukas) Hulyo 2023 Nangungunang bukas na modelo; mga bersyon 7B/13B/70B
Claude 2 / 2.1 Anthropic LLM Hulyo / Nobyembre 2023 Context window hanggang 200K token
Mistral 7B Mistral AI LLM (bukas) Setyembre 2023 Kompaktong mataas na pagganap na modelo
DALL-E 3 OpenAI Paglikha ng Imahe Oktubre 2023 Pinahusay na kalidad at pagsunod sa prompt
Gemini / Gemini Ultra Google LLM, multimodal Disyembre 2023 Unang LLM na nalampasan ang tao sa MMLU
Mixtral 8×7B Mistral AI LLM (MoE, bukas) Disyembre 2023 Arkitektura ng Mixture-of-Experts
Midjourney v6 Midjourney Paglikha ng Imahe Disyembre 2023 Pinahusay na kalidad at intuitive na prompt
Whisper v3 OpenAI Pagkilala ng Pagsasalita Nobyembre 2023 Pinahusay na katumpakan, pinapalawak na suporta sa wika

Metodolohiya

Gumagamit ang ulat ng datos mula sa maraming pinagkukunan[1]:

  • Mga Publikasyon at Patent: OpenAlex, WIPO, USPTO, datos ng Epoch AI.
  • Mga Benchmark: Papers With Code, CRFM (HELM), mga espesyalisadong leaderboard.
  • Mga Pamumuhunan: Quid (Capital IQ, Crunchbase), datos sa mahigit 8 milyong kumpanya.
  • Merkado ng Trabaho: Lightcast, LinkedIn, Stack Overflow.
  • Corporate na Aktibidad: McKinsey & Company, Seeking Alpha (earnings calls).
  • Robotics: International Federation of Robotics (IFR).
  • Regulasyon: Federal Register (USA), EUR-Lex (EU), Govini.
  • Opinyon ng Publiko: Ipsos, Pew Research Center, University of Toronto (GPO-AI), Quid (social media).
  • Edukasyon: CRA Taulbee Survey, Informatics Europe, Studyportals, Code.org, Walton Foundation.
  • Medisina: FDA, Papers With Code (MedQA).

Ang mga pagtatantya ng gastos sa pagsasanay ng mga modelo ay inihanda nang magkasama sa Epoch AI batay sa pagsusuri ng uri at dami ng hardware, tagal ng pagsasanay, at mga presyo ng cloud rental[2].

Pangkat ng mga May-akda

Ang ulat ay inihanda sa ilalim ng pamumuno ng mga co-director na Ray Perrault at Jack Clark sa pakikilahok ng malawak na grupo ng mga mananaliksik at mga organisasyong kasosyo. Ang AI Index ay isang proyekto ng Stanford HAI Institute (Human-Centered Artificial Intelligence)[1].

Mga Sanggunian

Literatura

Mga Tala

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/
  2. 2.0 2.1 2.2 Epoch AI (2023). AI Training Cost Estimates. https://epochai.org/
  3. 3.0 3.1 3.2 3.3 3.4 Quid (2023). AI Investment Data. https://quid.com/
  4. 4.0 4.1 4.2 Ipsos (2023). Global Perceptions of AI Survey. https://www.ipsos.com/
  5. Pew Research Center (2023). Public Views on AI. https://www.pewresearch.org/
  6. Liang, P. et al. (2022). Holistic Evaluation of Language Models. https://arxiv.org/abs/2211.09110
  7. Hendrycks, D. et al. (2021). Measuring Massive Multitask Language Understanding. https://arxiv.org/abs/2009.03300
  8. Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. https://arxiv.org/abs/2311.16502
  9. Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
  10. Gandhi, K. et al. (2023). Understanding Social Reasoning in Language Models with Language Models. https://arxiv.org/abs/2306.15448
  11. Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. https://arxiv.org/abs/2305.16291
  12. Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? https://arxiv.org/abs/2304.15004
  13. Chen, L. et al. (2023). How Is ChatGPT's Behavior Changing over Time? https://arxiv.org/abs/2307.09009
  14. AI Incident Database (2023). https://incidentdatabase.ai/
  15. Mai, K. T. et al. (2023). Warning: Humans Cannot Reliably Detect Speech Deepfakes. https://arxiv.org/abs/2301.07829
  16. Motoki, F. et al. (2023). More Human than Human: Measuring ChatGPT Political Bias. https://doi.org/10.1007/s11127-023-01097-2
  17. McKinsey & Company (2023). The State of AI in 2023: Generative AI's Breakout Year. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
  18. International Federation of Robotics (2023). World Robotics Report 2023. https://ifr.org/worldrobotics/
  19. Mankowitz, D. J. et al. (2023). Faster sorting algorithms discovered using deep reinforcement learning. Nature. https://doi.org/10.1038/s41586-023-06004-9
  20. Lam, R. et al. (2023). Learning skillful medium-range global weather forecasting. Science. https://doi.org/10.1126/science.adi2336
  21. Merchant, A. et al. (2023). Scaling deep learning for materials discovery. Nature. https://doi.org/10.1038/s41586-023-06735-9
  22. Ha, T. et al. (2023). AI-driven robotic chemist for autonomous synthesis of organic molecules. Science Advances. https://doi.org/10.1126/sciadv.adj0461
  23. Shen, T. et al. (2023). Flexible Isosurface Extraction for Gradient-Based Mesh Optimization. ACM Transactions on Graphics. https://doi.org/10.1145/3592430
  24. Nori, H. et al. (2023). Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine. https://arxiv.org/abs/2311.16452
  25. Chen, Z. et al. (2023). MEDITRON-70B: Scaling Medical Pretraining for Large Language Models. https://arxiv.org/abs/2311.16079
  26. U.S. Food and Drug Administration (2023). Artificial Intelligence and Machine Learning (AI/ML)-Enabled Medical Devices. https://www.fda.gov/medical-devices/software-medical-device-samd/artificial-intelligence-and-machine-learning-aiml-enabled-medical-devices
  27. Impact Research / Walton Family Foundation (2023). ChatGPT and Education Survey. https://www.waltonfamilyfoundation.org/
  28. The White House (2023). Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence. https://www.whitehouse.gov/briefing-room/presidential-actions/2023/10/30/executive-order-on-the-safe-secure-and-trustworthy-development-and-use-of-artificial-intelligence/
  29. Global Public Opinion on AI Survey, University of Toronto (2023). https://www.mediatechdemocracy.com/