The 2024 AI Index Report (KO)
AI Index Report 2024 — AI Index 보고서의 일곱 번째 연간 판으로, 스탠퍼드 인간 중심 인공지능 연구소(Stanford HAI)가 작성하였다[1]. 2024년 보고서는 발간 역사상 가장 방대한 규모이며, AI가 사회에 미치는 영향이 전례 없이 두드러지는 시점에 출간되었다. 이 보고서는 모델 훈련 비용에 대한 새로운 평가, 책임 있는 AI에 대한 심층 분석을 포함하며, AI가 과학 및 의학에 미치는 영향을 다루는 별도 장을 처음으로 수록하였다. 보고서는 인공지능과 관련된 데이터를 추적·체계화·시각화하여 정책 입안자, 연구자, 경영진, 언론인 및 일반 대중에게 객관적이고 철저히 검증된 정보를 제공한다.
보고서 구성
2024년 보고서는 아홉 개의 주제별 장으로 구성되어 있다[1]:
- 연구 및 개발 (Research and Development) — 논문, 특허, 기반 모델 및 오픈소스 프로젝트의 트렌드.
- 기술적 성능 (Technical Performance) — benchmark, 인간 수준과의 비교, 멀티모달성.
- 책임 있는 AI (Responsible AI) — 사고, 안전성, 편향, 개인정보 보호.
- 경제 (Economy) — 투자, 노동 시장, 기업 도입, 로봇화.
- 과학 및 의학 (Science and Medicine) — 새로운 장: 과학 및 의료 응용 분야에서의 AI 혁신.
- 교육 (Education) — 인재 양성, 교육 프로그램, 교육에서의 ChatGPT.
- 정책 및 거버넌스 (Policy and Governance) — 법률, 규제, 국가 전략.
- 다양성 (Diversity) — AI 분야의 성별 및 민족적 다양성.
- 여론 (Public Opinion) — 국제 설문 조사 데이터에 기반한 AI에 대한 대중의 인식.
보고서의 핵심 결론 (Top 10)
보고서 저자들은 2024년의 열 가지 주요 논점을 선정하였다[1]:
1. AI는 일부 과제에서는 인간을 능가하지만, 모든 과제에서 그런 것은 아니다
인공지능 시스템은 이미지 분류(ImageNet), 시각적 추론(VQA), 영어 이해(SuperGLUE)를 포함한 여러 benchmark에서 인간 수준을 초월하였다. 그러나 AI는 올림피아드 수준의 수학(MATH), 시각적 일상 추론, 계획 수립 등 더 복잡한 과제에서는 여전히 인간에 미치지 못한다[1].
2. 산업계가 첨단 AI 연구를 주도한다
2023년 산업계는 51개의 주요 Machine Learning 모델을 개발한 반면, 학계는 15개에 그쳤다. 이 중 21개의 모델은 산업계와 학계의 협력으로 탄생하였으며, 이는 역대 최고 수치이다[1].
3. 첨단 모델의 훈련 비용이 급격히 증가하고 있다
AI Index와 Epoch AI의 추정에 따르면, GPT-4의 훈련 비용은 약 7,800만 달러, Google의 Gemini Ultra는 약 1억 9,100만 달러에 달한다[2]. 비교하자면, 2017년 최초 Transformer 모델의 훈련 비용은 약 900달러, 2019년 RoBERTa Large는 약 16만 달러였다[1].
4. 미국이 선도적인 AI 모델의 발원지로서 선두를 달린다
2023년, 61개의 주요 AI 모델이 미국 기관에서 개발되어 EU(21개 모델)와 중국(15개 모델)을 크게 앞섰다[1].
5. LLM 책임성에 대한 표준화된 평가가 심각하게 뒤처져 있다
AI Index 연구는 책임 있는 AI 보고 분야에서 표준화의 심각한 부재를 발견하였다. 주요 개발사인 OpenAI, Google, Anthropic은 각기 다른 책임 있는 AI benchmark로 자사 모델을 테스트하여 위험에 대한 체계적 비교를 어렵게 만들고 있다[1].
6. 생성형 AI에 대한 투자가 급속도로 증가하고 있다
AI 전체 민간 투자는 전반적으로 감소하였음에도 불구하고, 생성형 AI에 대한 투자는 2022년 대비 약 8배 증가하여 252억 달러에 달하였다. OpenAI, Anthropic, Hugging Face, Inflection이 대규모 투자 유치를 진행하였다[3].
7. AI가 업무 생산성과 질을 향상시킨다
2023년의 다수 연구에서 AI가 근로자들이 더 빠르고 높은 질로 업무를 수행하도록 돕고, 저숙련·고숙련 전문가 간의 격차를 줄이는 것으로 나타났다. 다만 일부 연구는 적절한 감독 없이 AI를 사용하면 생산성이 오히려 저하될 수 있다고 경고한다[1].
8. AI 덕분에 과학적 진보가 가속화되고 있다
2023년에는 AlphaDev(정렬 알고리즘 가속화), GNoME(신소재 발견), GraphCast(날씨 예측) 등 AI의 주요 과학적 응용 사례들이 발표되었다[1].
9. 미국에서 AI 관련 규범 행위의 수가 급증하였다
2023년에는 AI 관련 규범 행위가 25건 채택되어 전년 대비 56.3% 증가하였다. 비교하자면, 2016년에는 단 1건만 채택되었다[1].
10. 사람들은 AI의 영향에 대해 점점 더 인식하고 있으며, 동시에 더 많은 우려를 나타낸다
Ipsos 데이터에 따르면, AI가 향후 3~5년 내 자신의 삶에 중대한 영향을 미칠 것이라고 생각하는 응답자의 비율이 60%에서 66%로 증가하였다. 그 중 52%는 AI 제품 및 서비스에 대해 불안감을 표명하며, 이는 2022년 대비 13%포인트 증가한 수치이다. 미국에서는 Pew Research 데이터에 따르면 52%의 미국인이 AI에 대해 기대보다 우려가 크다고 응답하였으며(2022년에는 37%)[4][5].
제1장. 연구 및 개발
이 장은 논문, 특허, 첨단 AI 시스템, 기반 모델(foundation models), 학술 대회 및 오픈소스 소프트웨어 프로젝트의 트렌드를 분석한다[1].
논문
AI 관련 논문의 총 수는 계속 증가하고 있다: 2010년 약 88,000편에서 2022년 240,000편 이상으로 (거의 세 배 증가). 최근 1년간 증가율은 1.1%였다[1].
특허
전 세계 AI 분야의 특허 등록 건수가 급격히 증가하였다: 2021년에서 2022년 사이 62.7% 성장하였으며, 2010년 대비 31배 이상 증가하였다. 중국이 AI 특허 출원을 주도하고 있다: 2022년 특허 출원의 61.1%를 차지하였으며, 미국의 비중은 20.9%(2010년 54.1%에서 감소)였다[1].
첨단 모델
2023년에도 산업계가 첨단 모델 개발을 주도하였다. 149개의 기반 모델이 출시되었으며, 이는 2022년의 두 배에 해당한다. 이 중 65.7%가 오픈소스였다(2022년 44.4%, 2021년 33.3% 대비)[1].
훈련 비용. AI Index와 Epoch AI의 협력을 통해 모델 훈련 비용에 대한 보다 정밀한 추정치를 확보하였다. 비용 증가는 다음의 추이로 명확히 드러난다[2]:
| 모델 | 연도 | 훈련 비용 추정치 (USD) |
|---|---|---|
| Transformer | 2017 | ~930 |
| BERT-Large | 2018 | ~3,300 |
| RoBERTa Large | 2019 | ~160,000 |
| GPT-3 175B | 2020 | ~430만 |
| PaLM 540B | 2022 | ~1,240만 |
| Llama 2 70B | 2023 | ~390만 |
| GPT-4 | 2023 | ~7,800만 |
| Gemini Ultra | 2023 | ~1억 9,100만 |
국가별 소속. 2023년 61개의 주요 모델이 미국 기관, 21개가 EU, 15개가 중국 기관에서 개발되었다. 이는 첨단 AI 시스템 개발에서 미국의 선도적 역할을 확인해준다[1].
오픈소스 소프트웨어
GitHub의 AI 프로젝트 수는 꾸준히 증가하고 있다: 2011년 845개에서 2023년 약 180만 개로. 2023년에는 59.3%의 성장이 기록되었다. AI 프로젝트의 총 스타 수는 세 배로 늘어났다: 2022년 400만 개에서 2023년 1,220만 개로[1].
학술 대회
주요 AI 학술 대회(NeurIPS, ICML, ICLR 등)의 참석자 수는 계속 증가하여 이 분야에 대한 높아지는 관심을 반영하고 있다[1].
제2장. 기술적 성능
이 장은 언어 처리, 이미지 생성, 추론, 코딩 및 에이전트 행동 과제에서 AI 시스템의 발전을 분석한다[1].
AI 성능 현황
2023년 기준으로 AI는 이미지 분류(2015년 이후), 기초적인 텍스트 이해(2017년 이후), 시각적 추론(2020년 이후), 자연어 논리 추론(2021년 이후) 등 여러 과제 범주에서 인간 수준을 초월하였다. 그러나 올림피아드 수학(MATH) 및 계획 수립 등의 과제에서는 AI가 아직 인간에 미치지 못한다[1].
언어 모델
HELM. 스탠퍼드에서 개발한 Holistic Evaluation of Language Models(HELM) benchmark는 텍스트 이해, 수학, 법률적 추론을 포함한 10가지 시나리오에 걸쳐 LLM을 평가한다. 2024년 1월 기준 GPT-4가 mean win rate 0.96으로 선두를 달리고 있다[6].
MMLU. Massive Multitask Language Understanding(MMLU) benchmark는 57개의 주제 영역에 걸쳐 모델을 평가한다. Google의 Gemini Ultra가 처음으로 인간 기준선(89.8%)을 초월하여 90.0%를 기록하였으며, 이는 2022년 대비 14.8%포인트, 2019년 benchmark 도입 이래 57.6%포인트 향상된 수치이다[7].
Chatbot Arena. 2023년 출시된 이 플랫폼은 사용자들이 익명 모델의 생성 결과를 비교할 수 있게 해준다. 2024년 초 기준 GPT-4 Turbo가 200,000표 이상의 투표에서 가장 선호되는 모델로 인정받았다[1].
멀티모달성
전통적으로 AI 시스템은 단일 모달리티로 제한되어 있었다. 그러나 2023년에는 텍스트, 이미지, 경우에 따라 오디오까지 처리할 수 있는 강력한 멀티모달 모델인 Google Gemini와 OpenAI GPT-4가 등장하였다. MMMU(Massive Multi-discipline Multimodal Understanding) benchmark에서 Gemini Ultra가 59.4%로 선두를 기록하였으나, 이는 전문 인간 수준(82.6%)보다 현저히 낮다[8].
추론
GPQA. Graduate-Level Google-Proof Q&A benchmark는 구글 검색만으로는 답할 수 없는 생물학, 물리학, 화학 관련 448개의 어려운 문제를 포함한다. 검색 기능이 있는 GPT-4는 41.0%를 기록하였으며, 이는 전문가 수준(72.5%)보다 낮지만 비전문가 수준(30.5%)보다는 높다[9].
마음 이론 (BigToM). LLM의 타인의 믿음 모델링 능력을 테스트한 결과, GPT-4는 믿음과 행동의 직접적 추론 과제에서 인간 수준에 근접하고 있으나 믿음의 역추론 과제에서는 여전히 뒤처지고 있다[10].
코딩
HumanEval benchmark는 코드 생성 능력을 평가한다. 2023년 모델들은 지속적으로 성능을 향상시켰으며, 실제 소프트웨어 엔지니어링 문제 해결 능력을 평가하는 새로운 benchmark인 SWE-bench에서는 최고 모델들도 문제의 극히 일부만을 해결하여 향후 발전 가능성이 상당함을 보여주었다[1].
에이전트 행동
AI 시스템은 점점 더 에이전트 시나리오에서 테스트되고 있다. Voyager(Microsoft)는 Minecraft의 역동적인 환경에서 자율 학습 능력을 발휘하여 이전 모델 대비 3.3배 더 많은 고유 아이템을 수집하고, 2.3배 더 멀리 이동하며, 핵심 단계를 15.3배 빠르게 달성하였다[11]. MLAgentBench는 과학 연구를 위한 AI 에이전트가 잠재력을 보이지만 과제마다 결과가 크게 다름을 보여주었다[1].
LLM의 특성
창발적 행동. 2023년 한 연구는 모델 규모 확장 시 예측 불가능한 '창발적' 능력이 필연적으로 나타난다는 통념에 의문을 제기하였다. 선형적이고 연속적인 지표를 사용할 경우 이러한 능력은 상당 부분 사라지는 것으로 나타났다[12].
성능 저하. 스탠퍼드와 버클리의 연구에 따르면 GPT-4의 성능은 업데이트 사이에 크게 변화할 수 있다: 2023년 6월 버전은 코드 생성에서 3월 버전보다 42%포인트, 수학 과제에서 33%포인트 낮은 성능을 보였다[13].
자기 수정. DeepMind와 일리노이 대학교 연구자들은 LLM이 외부 지도 없이 스스로 추론을 수정하는 데 어려움을 겪는다는 것을 보여주었다: GPT-4의 성능은 자기 수정 시도 시 테스트된 모든 benchmark에서 저하되었다[1].
제3장. 책임 있는 AI
이 장은 책임 있는 AI의 핵심 측면인 개인정보 보호, 투명성, 안전성, 공정성을 다룬다[1].
AI 사고
AI Incident Database는 2023년 123건의 사고를 기록하였으며, 이는 2022년 대비 32.3% 증가한 수치이다. 2013년 이후 사고 수는 20배 이상 증가하였다. 이러한 증가는 AI 적용 범위의 확대와 그 윤리적 위험에 대한 인식 제고 모두에 기인한다[14].
책임 있는 AI benchmark의 표준화
5개 주요 개발사(OpenAI, Meta, Anthropic, Google, Mistral AI) 분석 결과 책임 있는 AI 평가를 위한 단일한 benchmark 세트가 존재하지 않음이 드러났다. 일반 능력 benchmark(MMLU, HellaSwag, ARC Challenge, HumanEval, GSM8K)는 널리 사용되지만, 책임 있는 AI benchmark(TruthfulQA, RealToxicityPrompts, ToxiGen, BOLD, BBQ)는 산발적으로 적용된다: TruthfulQA는 5개 개발사 중 3개만 사용하며, 한 개발사는 책임 있는 AI benchmark에 대한 테스트를 전혀 보고하지 않는다[1].
AI와 선거
2023년 연구에 따르면 사람들은 오디오 딥페이크를 73%의 경우에만 정확히 식별한다. 음성 생성 기술의 발전에 따라 인식 정확도는 더욱 낮아질 것으로 예상된다. 이는 정치 캠페인 조작의 위험을 초래하며, 정치인들이 타협적인 오디오 녹음을 조작물이라고 부정할 수 있는 기회(이른바 '거짓말쟁이 배당금')를 제공한다[15].
LLM의 정치적 편향에 대한 연구에서는 ChatGPT의 기본 응답이 민주당의 입장과 양의 상관관계를, 공화당의 입장과 음의 상관관계를 보이는 것으로 나타났다[16].
제4장. 경제
이 장은 투자, 고용, 기업의 AI 도입 및 로봇화 트렌드를 분석한다[1].
투자
전반적인 트렌드. 전체 기업의 AI 투자는 2023년 1,892억 달러로 감소하였다(2022년 대비 약 20% 하락). 그러나 10년 동안 투자 규모는 13배 증가하였다. 민간 투자는 2년 연속 감소하였으나, 2021~2022년보다는 낙폭이 작았다[3].
생성형 AI. 생성형 AI에 대한 투자는 252억 달러를 기록하여 2022년 대비 거의 9배, 2019년 대비 30배 증가하였다. 생성형 AI는 전체 민간 AI 투자의 4분의 1 이상을 차지하였다[3].
지역별 분포. 미국은 672억 달러의 투자로 중국(78억 달러)을 8.7배, 영국(38억 달러)을 17.8배 앞섰다. 한편 중국의 민간 투자는 44.2%, EU와 영국은 14.1% 감소한 반면, 미국은 22.1% 증가하였다[3].
스타트업. 투자를 유치한 신규 AI 기업 수는 1,812개로 증가하였다(40.6% 증가). 생성형 AI 분야에서는 99개의 신규 스타트업이 투자를 받았다(2022년 56개 대비)[3].
노동 시장
미국에서 AI 관련 구인 공고의 비중은 2022년 2.0%에서 2023년 1.6%로 감소하였다. 유사한 경향이 전 세계적으로 관찰된다. 이러한 감소는 대형 AI 기업들의 채용 축소와 기술 분야 구인 공고 비중 감소에 기인한다[1].
학계에서 산업계로의 AI 전문가 이동이 계속 가속화되고 있다: 2022년 AI 분야 신규 박사 학위 취득자의 70.7%가 산업계에 취업하였다(2011년 40.9% 대비), 반면 학계로 진출한 비율은 20.0%에 불과하였다(2011년 41.6% 대비)[1].
기업 도입
McKinsey 데이터에 따르면, 조직의 55%가 적어도 한 개의 사업 부서에서 AI(생성형 AI 포함)를 활용하고 있으며, 이는 2022년 50%, 2017년 20%에서 증가한 수치이다. 또한 42%의 조직이 AI 덕분에 비용이 절감되었다고 보고하였으며, 59%는 수익이 증가하였다고 응답하였다[17].
Fortune 500 기업들의 실적 발표에서 AI 언급 횟수는 394회에 달하여(전체 기업의 거의 80%) 2022년 266회에서 눈에 띄게 증가하였다. 가장 자주 언급된 주제(모든 통화의 19.7%)는 생성형 AI였다[1].
로봇공학
2022년에는 산업용 로봇 553,000대가 설치되었으며, 이는 2021년 대비 5.1% 증가하고 2012년 대비 세 배 이상 증가한 수치이다. 중국이 주도하고 있다: 2013년 일본을 추월한 이후 중국의 비중은 20.8%에서 2022년 전 세계 설치량의 52.4%로 증가하였다. 협동 로봇의 비중은 2017년 2.8%에서 2022년 9.9%로 증가하였다[18].
제5장. 과학 및 의학
보고서에 처음으로 포함된 이 장은 과학적 발견과 의료 혁신에서 AI의 역할을 다룬다[1].
2023년 과학적 성과
AlphaDev (DeepMind) — 기존 인간 기준보다 적은 수의 명령어로 정렬 알고리즘을 발견한 Reinforcement Learning 시스템이다. 발견된 알고리즘 중 일부는 C++ 표준 정렬 라이브러리(LLVM)에 포함되었으며, 이는 해당 라이브러리의 10년 이상 만의 첫 업데이트였다[19].
GraphCast (DeepMind) — 그래프 Neural Network 기반의 날씨 예측 시스템으로, 1분 이내에 10일 예보를 제공하며 유럽중기예보센터(ECMWF)의 선도적 HRES 모델링 시스템보다 높은 정확도를 달성한다[20].
GNoME (Google DeepMind) — 그래프 네트워크를 활용하여 신기능 소재를 가속 탐색하는 모델로, 로봇공학 및 반도체 산업의 발전에 매우 중요한 역할을 한다[21].
Synbot — 유기 분자의 자율 합성을 위한 AI 제어 화학 로봇으로, 기준값과 동등하거나 이를 초과하는 반응 수율을 달성하였다[22].
FlexiCubes (NVIDIA) — 컴퓨터 그래픽에서 3D 객체 생성 품질 향상을 위해 AI를 활용한 3D 메시 최적화 방법이다[23].
의학에서의 AI
임상 지식. 의료 AI 임상 지식 평가 benchmark인 MedQA에서 GPT-4 Medprompt 모델이 90.2%의 정확도를 달성하였으며, 이는 2022년 최고 결과 대비 22.6%포인트 향상된 수치이다. 2019년 benchmark 도입 이후 MedQA에서의 AI 성능은 거의 세 배로 증가하였다. 주목할 만한 점은 GPT-4 Medprompt가 fine-tuning 대신 prompt 엔지니어링을 활용하여 특화된 의료 모델들을 능가하였다는 것이다[24].
MediTron-70B — 오픈소스 의료 LLM으로, MedQA에서 70.2%를 기록하여 오픈소스 모델 중 최고 성능을 보여주었으나, 비공개 모델인 GPT-4 Medprompt 및 Med-PaLM 2의 성능에는 미치지 못하였다[25].
의료 혁신. 2023년의 주요 시스템으로는 SynthSR(저품질 MRI 스캔에서 뇌 구조 시각화 개선), ImmunoSEIRA(신경퇴행성 질환 진단을 위한 AI 적외선 센서), EVEscape(팬데믹 예방을 위한 바이러스 진화 예측), AlphaMissense(미스센스 돌연변이 분류) 등이 있다[1].
FDA 승인. 2022년 FDA는 AI 기반 의료 기기 139개를 승인하였으며, 이는 2021년 대비 12.1% 증가한 수치이다. 2012년 이후 이러한 승인 건수는 45배 이상 증가하였다[26].
제6장. 교육
이 장은 컴퓨터과학 및 AI 분야의 교육 트렌드를 살펴본다[1].
고등 교육
미국과 캐나다에서 컴퓨터과학 학부 졸업생 수는 계속 증가하고 있다. 석사 졸업생 수는 상대적으로 안정적이며, 박사 졸업생 수는 소폭 증가하고 있다. 2018년 이후 컴퓨터과학 석사 및 박사 졸업생 수는 다소 감소하였다[1].
모든 교육 수준에서 국제 학생의 비율이 감소하였으며, 특히 석사 과정에서 두드러진다. 전 세계적으로 AI 관련 영어 교육 프로그램 수는 2017년 이후 세 배로 증가하였다[1].
교육에서의 ChatGPT
Walton Foundation의 설문 데이터에 따르면, 교사의 88%와 학생의 79%가 ChatGPT이 교육 과정에 긍정적인 영향을 미친다고 생각한다. 교사의 76%와 학생의 65%는 ChatGPT을 교육에 통합하는 것이 중요하다고 여긴다[27].
제7장. 정책 및 거버넌스
이 장은 글로벌, 미국, 유럽 수준에서 AI 분야의 입법 및 규제 활동을 분석한다[1].
글로벌 트렌드
전 세계 입법 과정에서 AI 언급이 역대 최고 수준에 달하였다. 순수하게 장려하는 조치에서 제한적 입법으로의 전환이 관찰되며, 이는 규제 당국이 AI의 잠재적 위험에 대해 점점 더 주목하고 있음을 보여준다[1].
2023년 채택된 법률의 주제는 군사 및 국가 안보, 시민권, 무역, 교육, 노동 관계, 과학 및 기술을 포함하여 크게 확대되었다[1].
미국의 규제
AI 관련 규범 행위의 수는 2023년 25건에 달하였다(2022년 대비 56.3% 증가). 가장 일반적인 주제는 대외 무역 및 국제 금융이었다. 높은 수준 및 중간 수준의 AI 관련성을 가진 규범 행위의 비중이 전년도 대비 증가하였다[1].
2023년의 중요한 사건으로는 바이든 대통령의 AI에 관한 행정 명령(Executive Order on AI)을 들 수 있으며, 이는 특히 산업계와 학계 간의 균등한 기회 보장을 위한 국가 AI 연구 자원(National AI Research Resource) 창설을 목표로 하였다[28].
EU의 규제
유럽연합에서도 AI 관련 규범 행위의 수가 증가하는 유사한 추세가 관찰된다. 2023년의 중요한 성과는 세계 최초의 포괄적인 AI 법인 AI Act의 진전이었다[1].
제8장. 다양성
이 장은 AI 전문가들 사이의 성별 및 민족적 다양성을 조사한다. 일부 진전에도 불구하고, 여성과 소수 집단은 산업계와 학계 모두에서 AI 분야에서 여전히 크게 과소 대표되고 있다[1].
제9장. 여론
이 장은 국제 설문 조사와 소셜 미디어 데이터를 바탕으로 AI에 대한 사회적 인식을 분석한다[1].
국제 설문 조사
인식과 우려. Ipsos 데이터에 따르면, AI가 향후 3~5년 내 자신의 삶에 중대한 영향을 미칠 것이라고 생각하는 응답자 비율이 66%(60%에서 증가)에 달하였다. 또한 52%가 AI 제품에 대해 불안감을 표명하였다(2022년 대비 13%포인트 증가)[4].
경제적 기대. 응답자의 37%만이 AI가 자신의 업무를 개선할 것이라고 생각하며, 34%는 경제를 개선할 것이라고, 32%는 노동 시장에 긍정적 영향을 미칠 것이라고 응답하였다[4].
세대별 차이. 젊은 세대가 훨씬 더 낙관적이다: Z세대의 59%가 AI가 엔터테인먼트를 개선할 것이라고 생각하는 반면, 베이비붐 세대는 40%에 그쳤다. 소득과 교육 수준이 높은 사람들도 더 낙관적이다[1].
ChatGPT 인지도. 토론토 대학교의 국제 설문 데이터에 따르면, 응답자의 63%가 ChatGPT을 알고 있으며, 그 중 약 절반이 적어도 일주일에 한 번 이상 사용한다[29].
소셜 미디어 데이터
2023년 소셜 미디어 게시물 700만 건 이상에 대한 Quid의 분석 결과, GraphCast와 Claude 2.1 모델이 가장 높은 긍정적 감성 점수(net sentiment score)를 기록하였다. GPT-4는 1분기에 가장 많은 주목을 받았으며, 연말로 갈수록 초점이 Gemini와 Grok으로 이동하였다[1].
2023년 주요 AI 모델
보고서는 여러 핵심 모델의 등장을 기록하고 있다[1]:
| 모델 | 개발사 | 유형 | 날짜 | 중요성 |
|---|---|---|---|---|
| GPT-4 | OpenAI | LLM, 멀티모달 | 2023년 3월 | 가장 강력한 LLM 중 하나; HELM 선두 |
| PaLM 2 | LLM | 2023년 5월 | 향상된 다국어 능력 | |
| Llama 2 | Meta | LLM (오픈소스) | 2023년 7월 | 선도적인 오픈소스 모델; 7B/13B/70B 버전 |
| Claude 2 / 2.1 | Anthropic | LLM | 2023년 7월 / 11월 | 최대 200K token의 컨텍스트 창 |
| Mistral 7B | Mistral AI | LLM (오픈소스) | 2023년 9월 | 소형 고성능 모델 |
| DALL-E 3 | OpenAI | 이미지 생성 | 2023년 10월 | 향상된 품질 및 prompt 준수 |
| Gemini / Gemini Ultra | LLM, 멀티모달 | 2023년 12월 | MMLU에서 인간을 처음으로 능가한 LLM | |
| Mixtral 8×7B | Mistral AI | LLM (MoE, 오픈소스) | 2023년 12월 | Mixture-of-Experts 아키텍처 |
| Midjourney v6 | Midjourney | 이미지 생성 | 2023년 12월 | 향상된 품질 및 직관적인 prompt |
| Whisper v3 | OpenAI | 음성 인식 | 2023년 11월 | 향상된 정확도, 확장된 언어 지원 |
방법론
보고서는 다양한 출처의 데이터를 활용한다[1]:
- 논문 및 특허: OpenAlex, WIPO, USPTO, Epoch AI 데이터.
- benchmark: Papers With Code, CRFM(HELM), 특화 리더보드.
- 투자: Quid(Capital IQ, Crunchbase), 800만 개 이상의 기업 데이터.
- 노동 시장: Lightcast, LinkedIn, Stack Overflow.
- 기업 활동: McKinsey & Company, Seeking Alpha(실적 발표).
- 로봇공학: International Federation of Robotics(IFR).
- 규제: Federal Register(미국), EUR-Lex(EU), Govini.
- 여론: Ipsos, Pew Research Center, University of Toronto(GPO-AI), Quid(소셜 미디어).
- 교육: CRA Taulbee Survey, Informatics Europe, Studyportals, Code.org, Walton Foundation.
- 의학: FDA, Papers With Code(MedQA).
모델 훈련 비용 추정치는 하드웨어의 종류 및 수량, 훈련 기간, 클라우드 임대 가격 분석을 바탕으로 Epoch AI와 공동으로 작성되었다[2].
저자진
보고서는 공동 책임자 레이 페로(Ray Perrault)와 잭 클라크(Jack Clark)의 지휘 하에 광범위한 연구자 및 파트너 기관의 참여로 작성되었다. AI Index는 스탠퍼드 HAI(인간 중심 인공지능) 연구소의 프로젝트이다[1].
외부 링크
- Stanford HAI — AI Index Report 2024 (전문): https://aiindex.stanford.edu/report/
- Epoch AI — 훈련 비용 및 컴퓨팅 트렌드 데이터: https://epochai.org/
- Papers With Code — benchmark 및 리더보드: https://paperswithcode.com/
- CRFM HELM — Holistic Evaluation of Language Models: https://crfm.stanford.edu/helm/
- AI Incident Database: https://incidentdatabase.ai/
- International Federation of Robotics: https://ifr.org/
- McKinsey Global Survey on AI: https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
참고 문헌
- Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/
- Epoch AI (2023). AI Training Cost Estimates and Compute Trends. https://epochai.org/
- Liang, P. et al. (2022). Holistic Evaluation of Language Models. https://arxiv.org/abs/2211.09110
- Hendrycks, D. et al. (2021). Measuring Massive Multitask Language Understanding. https://arxiv.org/abs/2009.03300
- Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. https://arxiv.org/abs/2311.16502
- Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
- Gandhi, K. et al. (2023). Understanding Social Reasoning in Language Models with Language Models. https://arxiv.org/abs/2306.15448
- Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? https://arxiv.org/abs/2304.15004
- Chen, L. et al. (2023). How Is ChatGPT's Behavior Changing over Time? https://arxiv.org/abs/2307.09009
- Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. https://arxiv.org/abs/2305.16291
- Mankowitz, D. J. et al. (2023). Faster sorting algorithms discovered using deep reinforcement learning. Nature. https://doi.org/10.1038/s41586-023-06004-9
- Lam, R. et al. (2023). Learning skillful medium-range global weather forecasting. Science. https://doi.org/10.1126/science.adi2336
- Merchant, A. et al. (2023). Scaling deep learning for materials discovery. Nature. https://doi.org/10.1038/s41586-023-06735-9
- Ha, T. et al. (2023). AI-driven robotic chemist for autonomous synthesis of organic molecules. Science Advances. https://doi.org/10.1126/sciadv.adj0461
- Shen, T. et al. (2023). Flexible Isosurface Extraction for Gradient-Based Mesh Optimization. ACM Transactions on Graphics. https://doi.org/10.1145/3592430
- Nori, H. et al. (2023). Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine. https://arxiv.org/abs/2311.16452
- Chen, Z. et al. (2023). MEDITRON-70B: Scaling Medical Pretraining for Large Language Models. https://arxiv.org/abs/2311.16079
- Mai, K. T. et al. (2023). Warning: Humans Cannot Reliably Detect Speech Deepfakes. https://arxiv.org/abs/2301.07829
- Motoki, F. et al. (2023). More Human than Human: Measuring ChatGPT Political Bias. https://doi.org/10.1007/s11127-023-01097-2
- McKinsey & Company (2023). The State of AI in 2023: Generative AI's Breakout Year. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
- International Federation of Robotics (2023). World Robotics Report 2023. https://ifr.org/worldrobotics/
- The White House (2023). Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence. https://www.whitehouse.gov/briefing-room/presidential-actions/2023/10/30/executive-order-on-the-safe-secure-and-trustworthy-development-and-use-of-artificial-intelligence/
- Fleming, S. L. et al. (2023). MedAlign: A Clinician-Generated Dataset for Instruction Following With Electronic Medical Records. https://arxiv.org/abs/2308.14089
- Iglesias, J. E. et al. (2023). SynthSR: A public AI tool to turn heterogeneous clinical brain scans into high-resolution T1-weighted images for 3D morphometry. Science Advances. https://doi.org/10.1126/sciadv.add3607
- Cheng, J. et al. (2023). Accurate Proteome-Wide Missense Variant Effect Prediction With AlphaMissense. Science. https://doi.org/10.1126/science.adg7492
주석
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/
- ↑ 2.0 2.1 2.2 Epoch AI (2023). AI Training Cost Estimates. https://epochai.org/
- ↑ 3.0 3.1 3.2 3.3 3.4 Quid (2023). AI Investment Data. https://quid.com/
- ↑ 4.0 4.1 4.2 Ipsos (2023). Global Perceptions of AI Survey. https://www.ipsos.com/
- ↑ Pew Research Center (2023). Public Views on AI. https://www.pewresearch.org/
- ↑ Liang, P. et al. (2022). Holistic Evaluation of Language Models. https://arxiv.org/abs/2211.09110
- ↑ Hendrycks, D. et al. (2021). Measuring Massive Multitask Language Understanding. https://arxiv.org/abs/2009.03300
- ↑ Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. https://arxiv.org/abs/2311.16502
- ↑ Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
- ↑ Gandhi, K. et al. (2023). Understanding Social Reasoning in Language Models with Language Models. https://arxiv.org/abs/2306.15448
- ↑ Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. https://arxiv.org/abs/2305.16291
- ↑ Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? https://arxiv.org/abs/2304.15004
- ↑ Chen, L. et al. (2023). How Is ChatGPT's Behavior Changing over Time? https://arxiv.org/abs/2307.09009
- ↑ AI Incident Database (2023). https://incidentdatabase.ai/
- ↑ Mai, K. T. et al. (2023). Warning: Humans Cannot Reliably Detect Speech Deepfakes. https://arxiv.org/abs/2301.07829
- ↑ Motoki, F. et al. (2023). More Human than Human: Measuring ChatGPT Political Bias. https://doi.org/10.1007/s11127-023-01097-2
- ↑ McKinsey & Company (2023). The State of AI in 2023: Generative AI's Breakout Year. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
- ↑ International Federation of Robotics (2023). World Robotics Report 2023. https://ifr.org/worldrobotics/
- ↑ Mankowitz, D. J. et al. (2023). Faster sorting algorithms discovered using deep reinforcement learning. Nature. https://doi.org/10.1038/s41586-023-06004-9
- ↑ Lam, R. et al. (2023). Learning skillful medium-range global weather forecasting. Science. https://doi.org/10.1126/science.adi2336
- ↑ Merchant, A. et al. (2023). Scaling deep learning for materials discovery. Nature. https://doi.org/10.1038/s41586-023-06735-9
- ↑ Ha, T. et al. (2023). AI-driven robotic chemist for autonomous synthesis of organic molecules. Science Advances. https://doi.org/10.1126/sciadv.adj0461
- ↑ Shen, T. et al. (2023). Flexible Isosurface Extraction for Gradient-Based Mesh Optimization. ACM Transactions on Graphics. https://doi.org/10.1145/3592430
- ↑ Nori, H. et al. (2023). Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine. https://arxiv.org/abs/2311.16452
- ↑ Chen, Z. et al. (2023). MEDITRON-70B: Scaling Medical Pretraining for Large Language Models. https://arxiv.org/abs/2311.16079
- ↑ U.S. Food and Drug Administration (2023). Artificial Intelligence and Machine Learning (AI/ML)-Enabled Medical Devices. https://www.fda.gov/medical-devices/software-medical-device-samd/artificial-intelligence-and-machine-learning-aiml-enabled-medical-devices
- ↑ Impact Research / Walton Family Foundation (2023). ChatGPT and Education Survey. https://www.waltonfamilyfoundation.org/
- ↑ The White House (2023). Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence. https://www.whitehouse.gov/briefing-room/presidential-actions/2023/10/30/executive-order-on-the-safe-secure-and-trustworthy-development-and-use-of-artificial-intelligence/
- ↑ Global Public Opinion on AI Survey, University of Toronto (2023). https://www.mediatechdemocracy.com/