The 2017 AI Index Report (KO)
AI Index Report 2017 — AI Index 프로젝트의 첫 번째(창간) 연례 보고서로, 2017년 11월에 발표되었습니다[1]. 이 프로젝트는 스탠퍼드 대학교의 One Hundred Year Study on AI (AI100) 이니셔티브의 일환으로 창설되었으며, 인공지능 분야의 활동과 발전을 추적하는 개방형 비영리 프로젝트입니다. 2017년 보고서는 AI의 현황에 관한 데이터를 체계적으로 집계하고 시각화하려는 최초의 시도로, 학계와 산업계의 활동 규모, AI 시스템의 기술적 성능, 파생 지표 및 인간 수준을 향한 진전을 포괄적으로 다루었습니다. 저자들은 AI 기술의 현황에 관한 적절한 데이터 없이는 사회가 인공지능과 관련된 논의와 의사결정에서 "눈을 감고 비행하는" 상태라고 강조합니다[1].
배경 및 목표
2017년에 이르러 인공지능은 세계적인 담론의 전면에 부상하여 실무자, 산업계 리더, 정책 입안자 및 일반 대중의 주목을 받게 되었습니다. AI 분야는 너무나 빠르게 발전하여 전문가들조차 그 발전을 이해하고 추적하는 데 어려움을 겪고 있었습니다. AI Index는 추측이나 일화적 증거가 아닌 데이터에 기반한 AI에 관한 정보화된 대화를 위한 도구로 구상되었습니다[1].
프로젝트의 아이디어는 2015년 AI100 운영위원회의 논의 과정에서 탄생하였습니다[2]. 보고서는 인터넷에서 자유롭게 이용 가능한 데이터와 독자적인 데이터를 집계하는 동시에 기존 데이터 계열의 조합으로부터 새로운 지표를 도출합니다. 보고서 생성에 사용된 모든 데이터는 aiindex.org 사이트에 공개됩니다[1].
보고서 구성
2017년 보고서는 네 가지 주요 데이터 섹션과 여러 토론 섹션으로 구성되어 있습니다[1]:
- 활동 규모 (Volume of Activity) — "얼마나 많은가"에 관한 지표: 논문 발표, 강좌 수강, 학술대회 참가, 스타트업, 투자, 채용 공고, 로봇 수입, 오픈소스 소프트웨어, 대중적 관심.
- 기술적 성능 (Technical Performance) — "얼마나 잘하는가"에 관한 지표: 컴퓨터 비전, 자연어 처리, 음성 인식, 정리 증명, SAT 문제 풀이.
- 파생 지표 (Derivative Measures) — 트렌드 간의 상호 관계, "학계-산업계" 역학 관계, AI 활력 지수 (AI Vibrancy Index).
- 인간 수준을 향하여? (Towards Human-Level Performance?) — AI가 인간 수준에 근접하거나 이를 능가한 성과의 목록.
- 빠진 것은 무엇인가? (What's Missing?) — 보고서의 한계 인정과 향후 연구 방향.
- 전문가 포럼 (Expert Forum) — AI 분야 주요 전문가들의 논평.
활동 규모
학술 논문
Scopus 데이터베이스(Elsevier 출판사)에서 컴퓨터 과학 분야의 주제어 "Artificial Intelligence"로 색인된 AI 관련 과학 논문 수가 1996년 이후 9배 이상 증가하였습니다[3]. 비교를 위해 살펴보면, 같은 기간 컴퓨터 과학 분야 전체 논문 수는 약 6배 증가하였는데, 이는 AI 논문의 증가가 단순히 정보과학 전반에 대한 관심 확대가 아니라 인공지능에 대한 구체적인 관심 증가에 기인함을 보여줍니다[1].
보고서 작성 시점을 기준으로 Scopus 데이터베이스에는 주제어 "Artificial Intelligence"를 포함한 컴퓨터 과학 분야 논문이 20만 편 이상, 컴퓨터 과학 전체 논문이 약 500만 편 수록되어 있었으며, 색인된 전체 문서는 약 7천만 건에 달하였습니다[3].
강좌 수강
인공지능 및 Machine Learning 입문 강좌의 학생 수는 급격한 성장세를 보였습니다. 스탠퍼드 대학교의 AI 입문 강좌 수강생 수는 1996년 이후 11배 증가하였습니다[1]. Machine Learning(ML)은 최근 AI 성과에서 ML 기법의 특히 빠른 수강생 증가와 핵심적 역할로 인해 AI의 하위 분야로 별도 분류되었습니다.
캘리포니아 대학교 버클리, 카네기멜런 대학교, 조지아 공과대학교, 일리노이 대학교 어바나-샴페인, 매사추세츠 공과대학교, 워싱턴 대학교 등 다른 주요 대학에서도 유사한 추세가 관찰되었습니다[1]. 보고서 저자들은 이 데이터가 고등교육 현황의 좁은 단면만을 나타내며 더 넓은 범위의 교육 기관을 반드시 대표하지는 않는다고 지적합니다.
학술대회 참가
주요 AI 학술대회(AAAI, AAMAS, ACL, CP, CVPR, ECAI, ICAPS, ICRA, ICLR, ICML, IJCAI, IROS, KR, NIPS, UAI)의 참가자 수 데이터는 연구 초점이 기호적 추론에서 Machine Learning 및 딥러닝으로 이동하고 있음을 확인시켜 주었습니다[1]. Machine Learning 학술대회(NIPS, ICML, ICLR)는 가장 큰 참가자 증가세를 보인 반면, 기호적 방법론 학술대회(KR, CP, ICAPS)는 꾸준하지만 규모가 더 작은 커뮤니티를 유지하며 지속적인 발전을 이어갔습니다[1].
AI 스타트업
벤처 투자를 받으며 AI 시스템을 개발하는 미국 스타트업의 수는 2000년 이후 14배 증가하였습니다[4][5]. AI 기업 식별을 위해 Crunchbase의 카테고리(Artificial Intelligence, Machine Learning, Natural Language Processing, Computer Vision, Facial Recognition, Image Recognition, Speech Recognition, Semantic Search, Semantic Web, Text Analytics, Virtual Assistant, Visual Search, Predictive Analytics, Intelligent System)를 활용하고, VentureSource 데이터베이스와 교차 검증하였습니다[1].
벤처 투자
미국 AI 스타트업에 대한 연간 벤처 투자 규모는 2000년 이후 6배 증가하였습니다[5]. 데이터는 모든 투자 단계를 포함하며 VentureSource 데이터베이스를 기반으로 Sand Hill Econometrics가 집계하였습니다[1].
노동 시장
두 개의 주요 온라인 채용 플랫폼인 Indeed.com과 Monster.com의 데이터는 AI 전문가에 대한 수요가 크게 증가하고 있음을 보여주었습니다[6][7].
Indeed.com: 미국 내 플랫폼에서 AI 관련 기술을 요구하는 채용 공고의 비율은 2013년 이후 4.5배 증가하였습니다[6]. 캐나다와 영국에서도 유사한 빠른 성장세가 관찰되었으나, 절대 규모 면에서는 각각 미국 시장의 5%와 27% 수준이었습니다[1].
Monster.com: 요구 기술별(Machine Learning, 컴퓨터 비전, 자연어 처리 등) AI 채용 공고의 절대 건수 분석도 꾸준한 성장을 확인하였습니다. 하나의 채용 공고가 여러 기술을 동시에 요구할 수 있었습니다[7].
로봇 수입
국제로봇연맹(IFR)이 작성한 연간 World Robotics Report 데이터는 북미와 세계 전체에서 산업용 로봇 수입이 꾸준히 증가하고 있음을 보여주었습니다[8]. 보고서 저자들은 로봇 중 어느 정도가 "AI"로 분류될 수 있는 소프트웨어를 사용하는지, AI 발전이 산업용 로봇 사용 증가에 얼마나 기여하는지를 쉽게 파악할 방법이 없다고 지적합니다[1].
오픈소스 소프트웨어
GitHub 플랫폼에서 AI 프레임워크에 대한 개발자들의 관심이 크게 증가하였습니다. 주요 Machine Learning 및 딥러닝 패키지인 TensorFlow, Scikit-Learn, Keras, PyTorch, Caffe, MXNet, CNTK, Theano의 스타(Stars) 수가 급격히 증가하였습니다[9]. Google의 TensorFlow와 Scikit-Learn이 가장 인기 있는 패키지로 선정되었으며, 스타 수와 포크(Forks) 수의 추세는 거의 동일하였습니다[1].
대중의 관심: 미디어 감성 분석
TrendKite 서비스의 데이터를 기반으로 "Artificial Intelligence"라는 용어를 포함한 대중 매체 기사의 감성 분석 결과, 긍정적 기사와 부정적 기사의 비율 변화가 나타났습니다[10]. TrendKite의 분류 시스템은 영어 기사(보도자료, 재무 뉴스, 부고 제외)를 "긍정적", "부정적", "중립적" 카테고리로 분류하였습니다[1].
기술적 성능
기술적 성능 섹션은 컴퓨터 비전, 자연어 처리, 음성 인식, 정리 증명, SAT 문제 풀이 과제에서 AI 시스템의 발전을 추적합니다[1].
컴퓨터 비전
Object Detection - 객체 탐지
ImageNet 데이터셋 기반의 Large Scale Visual Recognition Challenge(LSVRC) 대회에서 이미지 인식 오류율이 2010년부터 2017년까지 28.5%에서 2.5% 미만으로 감소하였습니다[11]. 비교를 위해 살펴보면, 인간의 오류율은 약 5%로 추정되며[12], 즉 2017년에 이르러 AI 시스템은 이 benchmark에서 이미 인간 수준을 크게 능가하였습니다. ImageNet 대회는 2017년에 종료되었습니다[1].
Visual Question Answering - 시각적 질의응답
VQA 1.0 dataset — 이미지에 관한 질문에 개방형 답변을 생성하는 과제 — 에서 AI 시스템은 꾸준한 발전을 보였습니다[13]. 저자들은 VQA 1.0 dataset이 이미 VQA 2.0으로 대체되었으며, 원본 버전에 얼마나 더 많은 관심이 기울여질지 불분명하다고 지적하였습니다[1].
자연어 처리
Parsing - 구문 분석
Penn Treebank의 Wall Street Journal 섹션 23으로 구성된 표준 테스트 세트에서 자동 파서들은 F1 지표의 꾸준한 향상을 보였습니다[14]. 결과는 40단어 미만의 문장과 전체 문장 세트 모두에 대해 기록되었습니다[1].
Machine Translation - 기계 번역
영어-독일어 뉴스 번역 과제를 다루는 연례 Workshop on Machine Translation(WMT) 대회에서 최고 성능 시스템들은 BLEU 지표 기준으로 전반적인 상승 추세를 보였습니다[15]. BLEU 지표는 기계 번역을 여러 인간 번역과 자동으로 비교하는 방법으로, 0에서 1 사이의 값을 갖는 수정된 정밀도(precision) 방식입니다. BLEU는 전문가의 번역 품질 평가와 상관관계가 있지만 corpus 간 비교에는 사용할 수 없으며, 시스템 간 비교도 오해를 불러일으킬 수 있습니다[1].
2017년 BLEU 점수는 2016년에 비해 눈에 띄게 낮아졌으나(2015년 수준보다는 높았음), 이는 기계 번역 시스템의 실제 품질 저하보다는 테스트 세트의 특성에 기인하는 것으로 분석됩니다[15].
Question Answering - 질의응답
Stanford Question Answering Dataset(SQuAD) — 500편 이상의 기사와 10만 쌍 이상의 질문-답변으로 구성 — 에서 AI 시스템은 정답과 정확히 일치하는 답변의 비율을 측정하는 Exact Match(EM) 지표에서 빠른 향상을 보였습니다[16]. SQuAD에서 인간의 성능 수준은 82.3%였습니다[1]. SQuAD 점수는 2016년 6월 dataset 생성 이후 급격히 상승하였습니다.
음성 인식
전화 통화 음성 인식 과제인 Switchboard Hub5'00 표준 dataset에서 Microsoft와 IBM은 2017년 "인간 동등 수준"에 근접한 성능을 달성하였습니다[17]. 문장 길이로 정규화된 오류 수(대체, 삭제, 삽입)를 측정하는 Word Error Rate(WER) 지표는 수년에 걸쳐 지속적으로 감소하였습니다. 인간의 정확한 오류율에 대해서는 이견이 있었으며, 5.1%, 5.9% 또는 5% 미만의 값들이 언급되었습니다. 보고서에서는 5.1%를 기준치로 사용하였습니다[1].
저자들은 Switchboard dataset의 장기 사용으로 인해 AI 시스템이 특정 데이터에 크게 과적합될 수 있다는 우려를 표명하였습니다[1].
정리 증명
Thousands of Problems for Theorem Provers(TPTP) 문제 세트에서는 평균 "처리 가능성(tractability)" — 현대 자동 정리 증명기(ATP)가 해당 문제를 풀 수 있는 비율 — 이 추적되었습니다[18]. TPTP v5.0.0(2010년) 이후 업데이트되지 않은 문제의 하위 집합이 분석되었습니다. 이 지표는 특이성이 있는데, 새로운 문제는 잘 풀지만 다른 시스템이 풀 수 있는 문제를 잘 못 푸는 강력한 신규 ATP 시스템의 등장이 평균 처리 가능성을 낮출 수 있습니다[1].
SAT 문제 풀이
SAT Competition의 산업용 문제 인스턴스에서 해결된 문제의 비율 증가가 기록되었습니다[19]. 연구자 Holger Hoos와 Kevin Leyton-Brown은 2007년 이후 대회에 출품된 1,076개의 문제 인스턴스에 대해 69개의 풀이기를 테스트하였으며, 공정한 비교를 위해 동일한 하드웨어에서 모든 풀이기를 실행하였습니다[1]. 저자들은 일부 개선이 알고리즘적 혁신이 아닌 공학적 성과를 반영할 수 있다고 지적하였습니다[1].
파생 지표
"학계-산업계" 역학 관계
학계와 산업계의 AI 활동 간 상호 관계를 조사하기 위해 세 가지 대표적인 지표가 선택되었습니다: AI 논문 수, 스탠퍼드의 AI 및 ML 입문 강좌 총 수강생 수, AI 스타트업에 대한 벤처 투자 규모. 모든 지표는 2000년을 기준으로 정규화되었습니다[1].
분석 결과, 초기에는 학계 활동(논문 발표 및 강좌 수강)이 꾸준한 발전을 이끌었습니다. 2010년경부터 투자자들이 이 분야에 주목하기 시작하였고, 2013년에는 전체 활동의 급격한 증가를 주도하는 원동력이 되었습니다. 이후 학계는 산업계의 "열기"를 따라잡게 되었습니다[1].
AI Vibrancy Index - AI 활력 지수
AI Vibrancy Index는 논문 발표, 강좌 수강, 벤처 투자의 정규화된 지표를 집계하여 AI 분야의 "활력"을 정량화하는 실험적인 복합 지표입니다[1]. 이 지수는 시간에 따른 정규화 지표들의 평균으로 계산되며, 세 가지 구성 요소 모두의 동시 증가를 반영하여 급격한 상승을 보였습니다. 저자들은 이러한 파생 지표들이 AI Index 데이터에 대한 추가 분석에 대한 관심을 불러일으키기를 기대한다고 밝혔습니다[1].
인간 수준을 향하여
보고서는 컴퓨터 시스템이 인간 수준의 성능에 도달하거나 이를 능가한 신뢰할 수 있는 사례들을 목록으로 정리하면서 몇 가지 중요한 주의사항을 함께 제시하였습니다[1].
비교의 핵심적 한계: 기계는 좁은 전문 과제에서 인간을 능가하는 경우가 많지만, 조건이 조금만 변형되어도 성능이 급격히 저하될 수 있습니다. 예를 들어, 한자를 읽는 사람은 아마도 중국어를 이해하고, 중국 문화에 대해 어느 정도 알며, 중국 식당에서 요리를 추천할 수 있을 것입니다. AI의 경우 이러한 각각의 과제는 완전히 별개의 시스템을 필요로 합니다[1].
주요 성과의 이정표
| 성과 | 연도 | 설명 |
|---|---|---|
| 오셀로 | 1980년대 / 1997 | 1989년 BILL 프로그램(Kai-Fu Lee, Sanjoy Mahajan)이 미국 최강 플레이어 Brian Rose에게 56–8로 승리하였습니다. 1997년에는 Logistello 프로그램이 현 세계 챔피언과의 6게임 매치에서 전승하였습니다[1]. |
| 체커스 | 1995 | Chinook 프로그램이 현 세계 챔피언을 물리쳤습니다. 자가 학습 체커스 프로그램의 초기 개발은 1952년부터 Arthur Samuel이 시작하였습니다[1]. |
| 체스 | 1997 | IBM Deep Blue가 세계 챔피언 Garry Kasparov를 꺾었습니다. 1950년대에 일부 학자들은 컴퓨터가 1967년까지 세계 챔피언을 이길 것이라고 예측한 바 있습니다[20]. 2017년에는 스마트폰의 체스 프로그램이 그랜드마스터 수준으로 실행될 수 있게 되었습니다[1]. |
| Jeopardy! | 2011 | IBM Watson 시스템이 전 챔피언 Brad Rutter와 Ken Jennings를 이기고 100만 달러의 상금을 획득하였습니다[1]. |
| Atari 게임 | 2015 | Google DeepMind 팀은 Reinforcement Learning 시스템을 사용하여 49개의 Atari 게임을 학습시켜 대부분(예: Breakout)에서 인간 수준을 달성하였으나, 일부 게임(예: Montezuma's Revenge)은 여전히 한계를 보였습니다[21]. |
| 객체 탐지 (ImageNet) | 2016 | ImageNet 이미지 자동 분류 오류율이 2010년 28%에서 3% 미만으로 감소하였으며, 인간의 오류율은 약 5%입니다[12]. |
| 바둑 | 2016–2017 | AlphaGo(Google DeepMind)가 2016년 3월 이세돌에게 4–1로 승리하였고, 이후 AlphaGo Master가 2017년 3월 커제를 물리쳤습니다. 2017년 10월에는 AlphaGo Zero가 기존 AlphaGo를 100–0으로 압도하였습니다[22][23]. |
| 피부암 분류 | 2017 | 2,032가지 질환의 임상 이미지 129,450장으로 훈련된 AI 시스템이 21명의 피부과 전문의에 상응하는 피부암 분류 역량을 보여주었습니다[24]. |
| 음성 인식 (Switchboard) | 2017 | Microsoft와 IBM이 Switchboard dataset의 음성 인식 과제에서 "인간 동등 수준"에 근접한 성능을 달성하였습니다[17]. |
| 포커 | 2017 | Libratus 프로그램(CMU)이 120,000판의 무제한 Texas Hold'em 토너먼트에서 4명의 최고 수준 플레이어를 물리쳤습니다. DeepStack 프로그램(앨버타 대학교)은 각 11명의 전문가와 3,000판 이상 대결하여 통계적으로 유의미한 우위를 입증하였습니다[25]. |
| Ms. Pac-Man | 2017 | Maluuba 팀(Microsoft에 인수됨)이 Atari 2600에서 최고 점수 999,900점을 달성하는 AI 시스템을 개발하였습니다[1]. |
보고서에서 빠진 것
저자들은 창간 보고서의 몇 가지 중요한 한계를 솔직하게 인정하였습니다[1]:
기술적 성능
많은 중요한 기술 분야가 포함되지 못하였습니다: 대화 시스템(표준화된 benchmark 부재), 계획, 로봇공학에서의 지속적 제어, 상식 추론(common sense reasoning), 추천 시스템, 표준화 테스트 등. 저자들은 발전 추적이 일반적으로 좋은 결과가 나오는 분야에서 이루어지기 때문에 AI 현황 평가에 낙관적 편향이 발생한다고 경고하였습니다[1].
국제적 범위
다른 국가에서의 상당한 AI 활동에도 불구하고 보고서가 지나치게 미국 중심적임을 인정하였습니다. 중국의 투자 및 활동 수준은 "놀랍다"고 평가되었으나 창간 보고서의 범위를 벗어난다고 언급하였습니다[1].
다양성과 포용성
보고서에는 성별, 인종, 젠더, 민족, 성적 지향 또는 기타 특성에 따른 데이터 분류가 포함되지 않았습니다. 저자들은 AI에 관한 논의에 누가 참여하고 미래의 AI 연구 및 배포에 영향을 미치는 권력을 누가 보유하는지에 관한 질문이 기술 및 벤처 산업의 권력 역학, 그리고 더 넓은 체계적 차별 세력과 밀접하게 연관되어 있음을 인정하였습니다[1].
정부 및 기업 투자
벤처 투자 데이터는 미국만을 포함하였으며 AI 연구개발에 대한 전체 투자의 극히 일부를 나타냈습니다. 정부 및 기업 투자에 관한 데이터는 제외되었습니다[1].
특정 산업에 대한 영향
의료, 자동차, 금융, 교육 및 기타 분야에 대한 AI 영향 지표가 제시되지 않았습니다[1].
사회적 위험 완화
AI 안전성, 예측 가능성, 알고리즘 공정성, 개인정보 보호, 자동화의 윤리적 결과에 관한 문제들이 다루어지지 않았습니다[1].
전문가 포럼
보고서는 학계, 산업계, 정부, 미디어를 대표하는 주요 전문가들의 논평을 포함하였습니다[1].
바버라 그로스 (하버드)
바버라 그로스는 AI 시스템의 성능만이 아니라 AI와 인간의 상호작용 품질과 개인 및 사회 차원에서 AI 시스템이 인간에게 미치는 영향을 고려하는 지표 개발의 중요성을 강조하였습니다. 그녀는 보고서의 공백을 지적하였는데, 자연어 처리 섹션에 구문 분석, 기계 번역, 질의응답은 포함되었지만 대화 상대의 정신 상태 고려가 필요한 대화 시스템은 포함되지 않았다는 점을 언급하였습니다. 그로스는 또한 윤리적 측면을 포함한 AI 강좌의 비율과 특정 AI 시스템을 과연 만들어야 하는지의 여부를 고민하는 기업의 수를 추적할 것을 촉구하였습니다[1].
에릭 호르비츠 (Microsoft)
에릭 호르비츠는 창간 보고서 발간을 더 넓은 커뮤니티를 대화에 참여시키는 중요한 단계라고 평가하였습니다. 그는 파생 지표 섹션과 AI Vibrancy Index의 가치를 인정하면서, 기업 내 AI 인재의 채용, 구성 및 보상 데이터와 대조하여 이를 검증할 것을 제안하였습니다. 호르비츠는 "어린아이도 보여주는" 상식 추론(common sense reasoning)의 발전을 추적하는 것의 중요성을 특별히 강조하면서, 이것이 현재 AI 기술의 역량 밖에 있다고 지적하였습니다[2].
카이푸 리 (Sinovation Ventures)
카이푸 리는 보고서의 국제적 범위 공백을 보완하여 중국 AI 현황에 대한 개요를 제시하였습니다. 그는 중국이 미국이나 인도보다 세 배 많은 휴대폰 및 인터넷 사용자를 보유하고 있으며, 생성 데이터 규모의 격차는 세 배를 훨씬 상회한다고 지적하였습니다. 중국인들은 미국인보다 50배 더 많은 모바일 결제를 하고, 음식 배달 규모는 10배이며, Didi는 이미 데이터를 교통 관리 시스템과 통합하기 시작하였습니다. 리는 세 개의 컴퓨터 비전 대회에서 Google, Microsoft, Facebook, CMU를 제치고 1위를 차지한 중국 스타트업 Face++를 예로 들었습니다. 그는 2017년 7월 중국 국무원의 2030년까지 AI 혁신의 세계적 중심지가 되겠다는 계획을 언급하며 AI에서의 미중 양강 체제는 불가피할 뿐 아니라 이미 도래하였다고 예측하였습니다[1].
앤드루 응 (Coursera, 스탠퍼드)
앤드루 응은 AI를 "새로운 전기"에 비유하며 수많은 산업을 변혁시키고 있다고 설명하였습니다. 그는 딥러닝이 AI 하위 분야를 변혁하는 순서를 설명하였습니다: 먼저 음성 인식, 다음 컴퓨터 비전, 이후 NLP(챗봇 전성기로 이어짐), 그리고 로봇공학(새로운 제조 가능성)의 순서입니다. 응은 AI 분야에서 보다 현명한 정책을 가진 국가들이 더 빠르게 발전할 것이며, 잘못 설계된 정책을 가진 국가들은 뒤처질 위험이 있다고 강조하였습니다[1].
다니엘라 루스 (MIT)
다니엘라 루스는 AI가 긍정적 변화의 벡터로서 기후변화 대응, 교육 민주화, 자율주행차, 개인 맞춤형 의료에 이르기까지 낙관적인 시각을 제시하였습니다. 그녀는 일반적인 인식과 달리 AI와 로봇공학의 생산성 향상이 단조로운 업무로부터 인간을 해방시켜, AI가 일자리를 줄이는 것이 아니라 더 만족스러운 일자리로 이어질 것이라고 강조하였습니다[1].
세바스티안 스런 (스탠퍼드, Udacity)
세바스티안 스런은 역사적 유사성을 제시하였습니다: 증기기관 발명 이전에는 대부분의 사람들이 육체적 힘으로 정의되는 농부였습니다. 기계는 농부를 "슈퍼인간"으로 바꾸었고 — 미국 농부 한 명이 155명을 먹여 살리며 미국 인구의 2% 미만이 농업에 종사합니다. 마찬가지로 AI는 우리의 반복적인 업무 패턴을 학습하여 우리가 "슈퍼인간"이 되도록 도울 수 있습니다. 스런은 전례 없는 인간 창의성의 시대의 도래를 예측하면서도, "평생 학습자"가 되어 변화에 적응해야 할 필요성에 대해 경고하였습니다[1].
마이클 울드리지 (옥스퍼드)
마이클 울드리지는 핵심 질문을 제기하였습니다: "AI 거품"이 존재하며 이것이 (1996–2001년 닷컴 거품처럼) 붕괴될 것인지 아니면 조용히 꺼질 것인지? 그의 주요 우려는 대규모 투기적 투자 이후의 실망으로 인한 새로운 "AI 겨울"이었습니다. 그러나 그는 신중한 낙관론을 표명하였습니다: 이전 주기들과 달리, 현재의 거품 아래에는 실질적인 내용이 존재한다 — AI 시스템은 지속적인 발전을 보이고 있으며 대기업들은 AI 기법을 생산적으로 활용하는 법을 배웠습니다. 울드리지는 또한 일반 AI(General AI)를 향한 발전을 어떻게 측정할 것인지의 문제를 제기하면서, 자신도 다른 누구도 그 측정 방법을 모른다고 인정하였습니다[1].
메건 스미스와 수전 알트체커
전 미국 CTO 메건 스미스와 수전 알트체커(유엔 NGO 연락 서비스)는 다양성과 포용성의 최우선적 중요성을 강조하였습니다. 그들은 "대규모의 의식적·무의식적 편견, 상당한 차별적 문화 패턴, 체계적 배제의 학습된 행동"으로 인해 대화와 프로젝트 팀에서 인류의 대다수가 배제되고 있다고 지적하였습니다. 저자들은 Algorithmic Justice League, 유엔에 대한 무기 AI 청원, CS for All 운동, AI4All 이니셔티브 등 몇 가지 핵심 이니셔티브를 언급하였습니다[1].
방법론
보고서는 여러 출처의 데이터를 활용하였습니다[1]:
- 논문 발표: Elsevier Scopus — 약 7천만 건의 문서를 포함하는 데이터베이스; 1996년부터 컴퓨터 과학 분야의 주제어 "Artificial Intelligence"로 검색[3].
- 강좌 수강: UC Berkeley, Carnegie Mellon, Georgia Tech, UIUC, MIT, Stanford, University of Washington의 대학 기록[1].
- 학술대회 참가: 15개 학술대회(AAAI, AAMAS, ACL, CP, CVPR, ECAI, ICAPS, ICRA, ICLR, ICML, IJCAI, IROS, KR, NIPS, UAI) 주최 측 제공 데이터[1].
- 스타트업 및 투자: Crunchbase(카테고리별 기업 식별을 위한 API), VentureSource(벤처 투자 데이터), Sand Hill Econometrics(집계)[4][5].
- 노동 시장: Indeed.com(국가별 AI 채용 공고 비율), Monster.com / CEB TalentNeuron(기술별 채용 공고 절대 건수)[6][7].
- 로봇 수입: International Federation of Robotics, World Robotics Report[8].
- GitHub: Google BigQuery를 통한 GitHub Archive — AI 프레임워크 저장소의 WatchEvent 건수 집계[9].
- 미디어 감성: TrendKite — 보도자료, 재무 뉴스, 부고를 필터링한 영어 기사 분류[10].
- Benchmark: LSVRC ImageNet, VQA 1.0, Penn Treebank, WMT / EuroMatrix, SQuAD, Switchboard Hub5'00, TPTP, SAT Competition[1].
운영진 및 저자
AI Index 2017 프로젝트는 운영위원회의 지도 하에 작성되었습니다[1]:
- 요아브 쇼함 (Yoav Shoham, 스탠퍼드 대학교) — 위원장
- 레이먼드 페로 (Raymond Perrault, SRI International)
- 에릭 브린욜프슨 (Erik Brynjolfsson, MIT)
- 잭 클라크 (Jack Clark, OpenAI)
- 캘빈 르개식 (Calvin LeGassick) — 프로젝트 매니저
자문위원회에는 Michael Bowling, Ernie Davis, Julia Hirschberg, Eric Horvitz, Karen Levy, Alan Mackworth, Tom Mitchell, Sandy Pentland, Chris Ré, Daniela Rus, Sebastian Thrun, Hal Varian, Toby Walsh가 포함되었습니다[1].
파트너 기관으로는 Allen Institute for Artificial Intelligence, Crunchbase, Electronic Frontier Foundation, Elsevier, EuroMatrix, Google Brain, Indeed.com, Monster.com, Sand Hill Econometrics, Sinovation Ventures, TrendKite, VentureSource가 참여하였습니다. 초기 재정 지원은 Google, Microsoft, Bytedance(Toutiao)가 제공하였으나, AI Index는 자체적인 독립성을 강조하며 이러한 조직들의 견해를 반드시 반영하지는 않는다고 밝혔습니다[1].
역사적 의의
2017년 창간 AI Index 보고서는 이후의 연례 보고서 시리즈의 기반을 마련하였으며, 시간이 지남에 따라 초기의 네 개 섹션에서 2024년 보고서의 아홉 개 주제별 챕터로 범위가 크게 확대되었습니다. 2017년 보고서의 "What's Missing" 섹션에서 솔직하게 인정한 많은 공백들이 순차적으로 보완되었습니다: 국제적 범위(2018년 보고서부터), 다양성 데이터, 정부 투자, 산업별 영향, 그리고 책임 있는 AI 및 규제[26]. AI Index 프로젝트는 이후 2019년에 설립된 스탠퍼드 HAI(Human-Centered Artificial Intelligence) 연구소의 산하로 이전되었습니다[1].
참조
- AI Index 2017 Annual Report (전문): https://aiindex.stanford.edu/2017-report/
- One Hundred Year Study on AI (AI100): https://ai100.stanford.edu/
- Stanford HAI — Human-Centered Artificial Intelligence: https://hai.stanford.edu/
- Elsevier Scopus: https://www.scopus.com/
- ImageNet / LSVRC: http://www.image-net.org/challenges/LSVRC/
- SQuAD — Stanford Question Answering Dataset: https://rajpurkar.github.io/SQuAD-explorer/
- TPTP — Thousands of Problems for Theorem Provers: http://www.tptp.org/
- SAT Competition: http://www.satcompetition.org/
- EFF AI Progress Metrics: https://www.eff.org/ai/metrics
- International Federation of Robotics: https://ifr.org/
- GitHub Archive: https://www.gharchive.org/
- Crunchbase: https://www.crunchbase.com/
참고 문헌
- AI Index Steering Committee (2017). AI Index 2017 Annual Report. https://aiindex.stanford.edu/2017-report/
- Russakovsky, O. et al. (2015). ImageNet Large Scale Visual Recognition Challenge. International Journal of Computer Vision. https://arxiv.org/abs/1409.0575
- Rajpurkar, P. et al. (2016). SQuAD: 100,000+ Questions for Machine Comprehension of Text. https://arxiv.org/abs/1606.05250
- Silver, D. et al. (2016). Mastering the game of Go with deep neural networks and tree search. Nature, 529. https://doi.org/10.1038/nature16961
- Silver, D. et al. (2017). Mastering the game of Go without human knowledge. Nature, 550. https://doi.org/10.1038/nature24270
- Mnih, V. et al. (2015). Human-level control through deep reinforcement learning. Nature, 518. https://doi.org/10.1038/nature14236
- Esteva, A. et al. (2017). Dermatologist-level classification of skin cancer with deep neural networks. Nature, 542. https://doi.org/10.1038/nature21056
- Brown, N. & Sandholm, T. (2017). Superhuman AI for heads-up no-limit poker: Libratus beats top professionals. Science, 359(6374). https://doi.org/10.1126/science.aao1733
- Campbell, M. et al. (2002). Deep Blue. Artificial Intelligence, 134(1–2). https://doi.org/10.1016/S0004-3702(01)00129-1
- Marcus, M. et al. (1993). Building a Large Annotated Corpus of English: The Penn Treebank. Computational Linguistics, 19(2).
- International Federation of Robotics (2017). World Robotics Report. https://ifr.org/worldrobotics/
주석
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 1.47 1.48 1.49 1.50 1.51 1.52 1.53 1.54 1.55 1.56 1.57 1.58 1.59 1.60 AI Index Steering Committee (2017). AI Index 2017 Annual Report. https://aiindex.stanford.edu/2017-report/
- ↑ 2.0 2.1 Horvitz, E. (2017). Commentary in AI Index 2017 Annual Report. https://aiindex.stanford.edu/2017-report/
- ↑ 3.0 3.1 3.2 Elsevier Scopus Database (2017). https://www.scopus.com/
- ↑ 4.0 4.1 Crunchbase (2017). AI-related startup data. https://www.crunchbase.com/
- ↑ 5.0 5.1 5.2 VentureSource / Sand Hill Econometrics (2017). Venture-backed AI company data.
- ↑ 6.0 6.1 6.2 Indeed.com (2017). AI job growth data. https://www.indeed.com/
- ↑ 7.0 7.1 7.2 Monster.com / CEB TalentNeuron (2017). AI job openings data. https://www.monster.com/
- ↑ 8.0 8.1 International Federation of Robotics (2017). World Robotics Report. https://ifr.org/worldrobotics/
- ↑ 9.0 9.1 GitHub Archive / Google BigQuery (2017). GitHub AI project statistics. https://www.gharchive.org/
- ↑ 10.0 10.1 TrendKite (2017). Media sentiment analysis data. https://www.trendkite.com/
- ↑ LSVRC ImageNet Competition (2010–2017). http://www.image-net.org/challenges/LSVRC/
- ↑ 12.0 12.1 Russakovsky, O. et al. (2015). ImageNet Large Scale Visual Recognition Challenge. International Journal of Computer Vision. https://arxiv.org/abs/1409.0575
- ↑ VQA Dataset (2017). http://www.visualqa.org/
- ↑ Marcus, M. et al. (1993). Building a Large Annotated Corpus of English: The Penn Treebank. Computational Linguistics, 19(2). https://catalog.ldc.upenn.edu/LDC99T42
- ↑ 15.0 15.1 Conference on Machine Translation / EuroMatrix (2017). WMT News Translation Task. http://www.statmt.org/wmt17/
- ↑ Rajpurkar, P. et al. (2016). SQuAD: 100,000+ Questions for Machine Comprehension of Text. https://arxiv.org/abs/1606.05250
- ↑ 17.0 17.1 Electronic Frontier Foundation (2017). AI Progress Metrics. https://www.eff.org/ai/metrics
- ↑ Sutcliffe, G. (2017). The TPTP Problem Library. http://www.tptp.org/
- ↑ SAT Competition (2017). http://www.satcompetition.org/
- ↑ Campbell, M. et al. (2002). Deep Blue. Artificial Intelligence, 134(1–2). https://doi.org/10.1016/S0004-3702(01)00129-1
- ↑ Mnih, V. et al. (2015). Human-level control through deep reinforcement learning. Nature, 518. https://doi.org/10.1038/nature14236
- ↑ Silver, D. et al. (2016). Mastering the game of Go with deep neural networks and tree search. Nature, 529. https://doi.org/10.1038/nature16961
- ↑ Silver, D. et al. (2017). Mastering the game of Go without human knowledge. Nature, 550. https://doi.org/10.1038/nature24270
- ↑ Esteva, A. et al. (2017). Dermatologist-level classification of skin cancer with deep neural networks. Nature, 542. https://doi.org/10.1038/nature21056
- ↑ Brown, N. & Sandholm, T. (2017). Superhuman AI for heads-up no-limit poker: Libratus beats top professionals. Science, 359(6374). https://doi.org/10.1126/science.aao1733
- ↑ Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/