The 2017 AI Index Report (PL)
AI Index Report 2017 — pierwszy (inauguracyjny) doroczny raport projektu AI Index, opublikowany w listopadzie 2017 roku[1]. Projekt został utworzony w ramach inicjatywy One Hundred Year Study on AI (AI100) przy Uniwersytecie Stanforda i stanowi otwarty, niekomercyjny projekt śledzenia aktywności i postępów w dziedzinie sztucznej inteligencji. Raport z 2017 roku był pierwszą próbą systematycznego agregowania i wizualizowania danych o stanie SI, obejmując wolumeny działalności w akademii i przemyśle, techniczną wydajność systemów SI, metryki pochodne oraz postęp w kierunku poziomu ludzkiego. Autorzy podkreślają, że bez odpowiednich danych o stanie technologii SI społeczeństwo „leci w ciemno" w dyskusjach i procesach decyzyjnych związanych ze sztuczną inteligencją[1].
Przesłanki i cele
Do 2017 roku sztuczna inteligencja wysunęła się na pierwszy plan globalnego dyskursu, przyciągając uwagę praktyków, liderów branży, polityków i szerokiej opinii publicznej. Dziedzina SI rozwijała się tak dynamicznie, że nawet eksperci mieli trudności ze zrozumieniem i śledzeniem postępów. AI Index został pomyślany jako narzędzie do prowadzenia świadomej rozmowy o SI, opartej na danych, a nie na domysłach czy anegdotycznych świadectwach[1].
Pomysł na projekt zrodził się podczas dyskusji Stałego Komitetu AI100 w 2015 roku[2]. Raport agreguje zarówno swobodnie dostępne dane z internetu, jak i dane oryginalne, a także wyprowadza nowe metryki z kombinacji istniejących szeregów. Wszystkie dane wykorzystane do wygenerowania raportu są publikowane w otwartym dostępie na stronie aiindex.org[1].
Struktura raportu
Raport z 2017 roku składa się z czterech głównych sekcji danych oraz kilku sekcji dyskusyjnych[1]:
- Wolumen działalności (Volume of Activity) — metryki „ile": publikacje, nabory na kursy, frekwencja na konferencjach, startupy, finansowanie, oferty pracy, import robotów, oprogramowanie open source, zainteresowanie publiczne.
- Wydajność techniczna (Technical Performance) — metryki „jak dobrze": computer vision, przetwarzanie języka naturalnego, rozpoznawanie mowy, dowodzenie twierdzeń, rozwiązywanie zadań SAT.
- Metryki pochodne (Derivative Measures) — wzajemne powiązania między trendami, dynamika „akademia — przemysł", indeks żywotności SI (AI Vibrancy Index).
- W kierunku poziomu ludzkiego? (Towards Human-Level Performance?) — katalog osiągnięć, w których SI zbliżyła się do poziomu ludzkiego lub go przekroczyła.
- Czego brakuje? (What's Missing?) — uznanie ograniczeń raportu i kierunki przyszłych prac.
- Forum ekspertów (Expert Forum) — komentarze czołowych ekspertów w dziedzinie SI.
Wolumen działalności
Publikacje akademickie
Liczba artykułów naukowych z zakresu SI, opublikowanych i zaindeksowanych w bazie danych Scopus (wydawnictwo Elsevier) ze słowem kluczowym „Artificial Intelligence" w dziedzinie „Computer Science", wzrosła ponad 9-krotnie od 1996 roku[3]. Dla porównania: ogólna liczba publikacji z dziedziny informatyki w tym samym okresie zwiększyła się około 6-krotnie, co świadczy o tym, że wzrost publikacji dotyczących SI nie wynika jedynie z ogólnego rozszerzenia zainteresowania informatyką, lecz przede wszystkim z rosnącej uwagi poświęcanej sztucznej inteligencji[1].
W momencie sporządzania raportu baza Scopus zawierała ponad 200 000 artykułów z dziedziny informatyki ze słowem kluczowym „Artificial Intelligence" oraz prawie 5 milionów artykułów z informatyki ogółem, z łącznej liczby około 70 milionów zaindeksowanych dokumentów[3].
Nabory na kursy
Nabory studentów na kursy wprowadzające z zakresu sztucznej inteligencji i Machine Learning wykazywały gwałtowny wzrost. Na Uniwersytecie Stanforda nabór na kurs wprowadzający z SI wzrósł 11-krotnie od 1996 roku[1]. Machine Learning (ML) jako poddziedzina SI została wyodrębniona osobno ze względu na szczególnie szybki wzrost naborów oraz kluczową rolę technik ML w niedawnych osiągnięciach SI.
Podobne tendencje zaobserwowano na innych wiodących uczelniach: Uniwersytecie Kalifornijskim w Berkeley, Uniwersytecie Carnegie Mellona, Georgia Tech, Uniwersytecie Illinois w Urbana-Champaign, Massachusetts Institute of Technology oraz Uniwersytecie Waszyngtońskim[1]. Autorzy raportu zauważają, że dane te stanowią jedynie wąski wycinek krajobrazu szkolnictwa wyższego i niekoniecznie są reprezentatywne dla szerszego grona uczelni.
Frekwencja na konferencjach
Dane dotyczące frekwencji na wiodących konferencjach SI (AAAI, AAMAS, ACL, CP, CVPR, ECAI, ICAPS, ICRA, ICLR, ICML, IJCAI, IROS, KR, NIPS, UAI) potwierdziły przesunięcie fokusu badawczego od rozumowania symbolicznego ku Machine Learning i deep learning[1]. Konferencje poświęcone Machine Learning (NIPS, ICML, ICLR) notowały najwyższy wzrost frekwencji, podczas gdy konferencje zajmujące się metodami symbolicznymi (KR, CP, ICAPS) utrzymywały stabilną, choć skromniejszą społeczność, nadal osiągającą stały postęp[1].
Startupy w branży SI
Liczba aktywnych amerykańskich startupów opracowujących systemy SI z finansowaniem venture capital wzrosła 14-krotnie od 2000 roku[4][5]. Do identyfikacji firm SI wykorzystano kategorie Crunchbase (Artificial Intelligence, Machine Learning, Natural Language Processing, Computer Vision, Facial Recognition, Image Recognition, Speech Recognition, Semantic Search, Semantic Web, Text Analytics, Virtual Assistant, Visual Search, Predictive Analytics, Intelligent System) z późniejszą weryfikacją krzyżową w bazie VentureSource[1].
Finansowanie venture capital
Wolumen rocznych inwestycji venture capital w amerykańskie startupy z dziedziny SI wzrósł 6-krotnie od 2000 roku[5]. Dane obejmują wszystkie etapy finansowania i zostały zagregowane przez firmę Sand Hill Econometrics na podstawie bazy VentureSource[1].
Rynek pracy
Dane dwóch największych platform ogłoszeń o pracę — Indeed.com i Monster.com — wykazały znaczący wzrost popytu na specjalistów z dziedziny SI[6][7].
Indeed.com: Udział ofert pracy wymagających umiejętności w zakresie SI na platformie w USA wzrósł 4,5-krotnie od 2013 roku[6]. Podobny szybki wzrost odnotowano w Kanadzie i Wielkiej Brytanii, choć pod względem bezwzględnej wielkości ich rynki stanowiły odpowiednio 5% i 27% rynku amerykańskiego[1].
Monster.com: Analiza bezwzględnej liczby ofert pracy związanych z SI w podziale na wymagane umiejętności (Machine Learning, computer vision, przetwarzanie języka naturalnego i inne) również potwierdziła stały wzrost. Jedna oferta mogła jednocześnie wymagać kilku umiejętności[7].
Import robotów
Dane z dorocznego raportu World Robotics Report, przygotowanego przez Międzynarodową Federację Robotyki (IFR), wykazały stały wzrost importu robotów przemysłowych zarówno do Ameryki Północnej, jak i w skali globalnej[8]. Autorzy raportu zauważają, że nie istnieje prosty sposób ustalenia, jaki procent robotów wykorzystuje oprogramowanie kwalifikowane jako „SI" i w jakim stopniu osiągnięcia w dziedzinie SI przyczyniają się do wzrostu wykorzystania robotów przemysłowych[1].
Oprogramowanie open source
Zainteresowanie deweloperów frameworkami SI na platformie GitHub wykazało znaczący wzrost. Liczba gwiazdek (Stars) dla głównych pakietów Machine Learning i deep learning — TensorFlow, Scikit-Learn, Keras, PyTorch, Caffe, MXNet, CNTK i Theano — gwałtownie rosła[9]. TensorFlow od Google oraz Scikit-Learn zostały wyróżnione jako najpopularniejsze pakiety, przy czym trendy dotyczące liczby gwiazdek i forków (Forks) były niemal identyczne[1].
Zainteresowanie publiczne: wydźwięk mediów
Analiza wydźwięku publikacji w popularnych mediach zawierających termin „Artificial Intelligence", na podstawie danych serwisu TrendKite, wykazała dynamikę stosunku artykułów pozytywnych do negatywnych[10]. Klasyfikator TrendKite przypisywał anglojęzyczne artykuły (z wyłączeniem informacji prasowych, wiadomości finansowych i nekrologów) do kategorii „pozytywne", „negatywne" i „neutralne"[1].
Wydajność techniczna
Sekcja wydajności technicznej śledzi postępy systemów SI w zadaniach z zakresu computer vision, przetwarzania języka naturalnego, rozpoznawania mowy, dowodzenia twierdzeń i rozwiązywania zadań SAT[1].
Computer Vision
Wykrywanie obiektów (Object Detection)
W konkursie Large Scale Visual Recognition Challenge (LSVRC) opartym na zbiorze danych ImageNet współczynnik błędów w rozpoznawaniu obrazów spadł z 28,5% do poniżej 2,5% w latach 2010–2017[11]. Dla porównania: poziom błędu ludzkiego szacowany jest na około 5%[12], co oznacza, że do 2017 roku systemy SI istotnie przewyższyły poziom ludzki na tym benchmarku. Konkurs ImageNet zakończył się w 2017 roku[1].
Wizualne pytania i odpowiedzi (Visual Question Answering)
Na zbiorze danych VQA 1.0 — zadaniu formułowania otwartych odpowiedzi na pytania dotyczące obrazów — systemy SI wykazywały stały postęp[13]. Autorzy zauważali, że zbiór danych VQA 1.0 został już wyparty przez VQA 2.0 i nie było jasne, ile uwagi zostanie poświęcone oryginalnej wersji[1].
Przetwarzanie języka naturalnego
Parsowanie składniowe (Parsing)
Na standardowym zbiorze testowym — sekcji 23 korpusu Wall Street Journal z Penn Treebank — automatyczne parsery wykazywały stały wzrost metryki F1[14]. Wyniki były rejestrowane zarówno dla zdań krótszych niż 40 słów, jak i dla pełnego zbioru zdań[1].
Tłumaczenie maszynowe (Machine Translation)
W dorocznym konkursie Workshop on Machine Translation (WMT) dotyczącym tłumaczenia wiadomości między językiem angielskim a niemieckim najlepsze systemy wykazywały ogólny trend wzrostowy w metryce BLEU[15]. Metryka BLEU — automatyczna metoda porównywania tłumaczenia maszynowego z kilkoma tłumaczeniami wykonanymi przez ludzi — stanowi zmodyfikowaną wersję precyzji (precision) z wartościami od 0 do 1. Choć BLEU koreluje z ekspercką oceną jakości tłumaczenia, nie można jej używać do porównań między korpusami, a porównania między systemami mogą być mylące[1].
W 2017 roku wyniki BLEU wyraźnie spadły w porównaniu z 2016 rokiem (choć pozostawały wyższe niż w 2015 roku), co prawdopodobnie wynikało ze specyfiki zbioru testowego, a nie rzeczywistego pogorszenia jakości systemów tłumaczenia maszynowego[15].
Pytania i odpowiedzi (Question Answering)
Na zbiorze danych Stanford Question Answering Dataset (SQuAD) — ponad 500 artykułów i 100 000 par pytanie-odpowiedź — systemy SI wykazywały szybki wzrost metryki Exact Match (EM), mierzącej odsetek odpowiedzi dokładnie pokrywających się z wzorcowymi[16]. Poziom wydajności ludzkiej na SQuAD wynosił 82,3%[1]. Wyniki na SQuAD gwałtownie rosły od momentu utworzenia zbioru w czerwcu 2016 roku.
Rozpoznawanie mowy
Na standardowym zbiorze danych Switchboard Hub5'00 — zadaniu rozpoznawania mowy z rozmów telefonicznych — Microsoft i IBM w 2017 roku osiągnęły wydajność zbliżoną do „parytetu ludzkiego"[17]. Metryka Word Error Rate (WER) — liczba błędów (podstawień, usunięć i wstawień słów) znormalizowana względem długości zdania — spadała na przestrzeni wielu lat. Istniały rozbieżności co do dokładnego poziomu błędu ludzkiego: podawano wartości 5,1% i 5,9%, a nawet poniżej 5%. W raporcie zastosowano próg 5,1%[1].
Autorzy zwracali uwagę na obawy, że długotrwałe korzystanie ze zbioru Switchboard może prowadzić do znacznego przeuczenia systemów SI na konkretnych danych[1].
Dowodzenie twierdzeń
Na zbiorze zadań Thousands of Problems for Theorem Provers (TPTP) śledzono średnią „traktowalność" (tractability) — odsetek współczesnych automatycznych dowodzicieli twierdzeń (ATP) zdolnych do rozwiązania danego zadania[18]. Analizowano podzbiór zadań, które nie były aktualizowane od wersji TPTP v5.0.0 (rok 2010). Metryka ma pewną osobliwość: pojawienie się nowych, wydajnych systemów ATP, dobrze radzących sobie z nowymi zadaniami, ale słabo z tymi, które rozwiązują inne systemy, może prowadzić do obniżenia średniej traktowalności[1].
Rozwiązywanie zadań SAT
Na przemysłowych instancjach zadań z konkursu SAT Competition rejestrowano wzrost odsetka rozwiązanych zadań[19]. Badacze Holger Hoos i Kevin Leyton-Brown przetestowali 69 solwerów na 1076 instancjach zadań zgłoszonych do konkursu od 2007 roku, uruchamiając wszystkie solwery na tym samym sprzęcie w celu zapewnienia rzetelnego porównania[1]. Autorzy zaznaczali, że część usprawnień może odzwierciedlać osiągnięcia inżynieryjne, a nie przełomy algorytmiczne[1].
Metryki pochodne
Dynamika „akademia — przemysł"
Do zbadania wzajemnych relacji między aktywnością SI w akademii i przemyśle wybrano trzy reprezentatywne metryki: liczbę publikacji dotyczących SI, łączny nabór na kursy wprowadzające z SI i ML na Stanfordzie oraz wolumen inwestycji venture capital w startupy SI. Wszystkie metryki zostały znormalizowane względem roku 2000[1].
Analiza wykazała, że początkowo aktywność akademicka (publikacje i nabory na kursy) zapewniała stały postęp. Mniej więcej od 2010 roku inwestorzy zaczęli zwracać uwagę na tę dziedzinę, a do 2013 roku stali się motorem gwałtownego wzrostu ogólnej aktywności. Po tym czasie akademia dogoniła „entuzjazm" przemysłu[1].
Indeks żywotności SI (AI Vibrancy Index)
AI Vibrancy Index to eksperymentalna metryka złożona, agregująca znormalizowane wskaźniki publikacji, naborów na kursy i inwestycji venture capital w celu ilościowego określenia „żywotności" SI jako dziedziny[1]. Indeks obliczany był jako średnia znormalizowanych metryk w czasie i wykazywał gwałtowny wzrost odzwierciedlający jednoczesne zwiększenie się wszystkich trzech składowych. Autorzy wyrazili nadzieję, że tego rodzaju metryki pochodne wzbudzą zainteresowanie dalszą analizą danych AI Index[1].
W kierunku poziomu ludzkiego
Raport skatalogował wiarygodne przypadki, w których systemy komputerowe osiągnęły lub przekroczyły poziom wydajności ludzkiej, opatrując je szeregiem istotnych zastrzeżeń[1].
Kluczowe ograniczenia porównania: maszyny często przewyższają ludzi w wąsko wyspecjalizowanych zadaniach, jednak wydajność może gwałtownie spadać przy najmniejszej modyfikacji warunków. Przykładowo, człowiek czytający chińskie znaki prawdopodobnie rozumie też język chiński, wie coś o chińskiej kulturze i potrafi polecić dania w chińskiej restauracji. Dla SI każde z tych zadań wymagałoby zupełnie odrębnego systemu[1].
Kamienie milowe osiągnięć
| Osiągnięcie | Rok | Opis |
|---|---|---|
| Othello | lata 80. / 1997 | W 1989 roku program BILL (Kai-Fu Lee, Sanjoy Mahajan) pokonał czołowego amerykańskiego gracza Briana Rose'a (56–8). W 1997 roku program Logistello wygrał wszystkie partie meczu złożonego z sześciu gier z ówczesnym mistrzem świata[1]. |
| Warcaby | 1995 | Program Chinook pokonał ówczesnego mistrza świata. Pierwsze programy do gry w warcaby z elementem samouczenia się tworzył Arthur Samuel od 1952 roku[1]. |
| Szachy | 1997 | IBM Deep Blue pokonał mistrza świata Garriego Kasparowa. Niektórzy naukowcy w latach 50. przewidywali, że komputer pokona mistrza świata do 1967 roku[20]. Do 2017 roku szachowe programy na smartfonach grały na poziomie arcymistrza[1]. |
| Jeopardy! | 2011 | System IBM Watson pokonał byłych zwycięzców teleturnieju Brada Ruttera i Kena Jenningsa, zdobywając główną nagrodę w wysokości 1 miliona dolarów[1]. |
| Gry Atari | 2015 | Zespół Google DeepMind wykorzystał system uczenia ze wzmocnieniem do nauki gry w 49 gier Atari, osiągając poziom ludzki w większości z nich (np. Breakout), choć niektóre gry (np. Montezuma's Revenge) pozostawały poza zasięgiem[21]. |
| Wykrywanie obiektów (ImageNet) | 2016 | Współczynnik błędów automatycznej klasyfikacji obrazów ImageNet spadł z 28% (2010) do poniżej 3%, przy poziomie ludzkim wynoszącym około 5%[12]. |
| Go | 2016–2017 | AlphaGo (Google DeepMind) pokonał Lee Sedola 4–1 w marcu 2016 roku, następnie AlphaGo Master pokonał Ke Jie w marcu 2017 roku. W październiku 2017 roku AlphaGo Zero pokonał oryginalnego AlphaGo wynikiem 100–0[22][23]. |
| Klasyfikacja raka skóry | 2017 | System SI wytrenowany na 129 450 klinicznych obrazach 2 032 chorób wykazał poziom kompetencji w klasyfikacji raka skóry porównywalny z 21 certyfikowanymi dermatologami[24]. |
| Rozpoznawanie mowy (Switchboard) | 2017 | Microsoft i IBM osiągnęły wydajność zbliżoną do „parytetu ludzkiego" w zadaniu rozpoznawania mowy na zbiorze Switchboard[17]. |
| Poker | 2017 | Program Libratus (CMU) pokonał czterech czołowych graczy w turnieju złożonym z 120 000 partii Texas Hold'em bez limitu stawek. Program DeepStack (Uniwersytet Alberty) dowiódł statystycznej istotności swojej przewagi nad 11 profesjonalistami w ponad 3 000 partiach każdy[25]. |
| Ms. Pac-Man | 2017 | Zespół Maluuba (przejęty przez Microsoft) stworzył system SI osiągający maksymalny wynik 999 900 punktów na Atari 2600[1]. |
Czego brakuje w raporcie
Autorzy szczerze przyznali się do szeregu istotnych ograniczeń inauguracyjnego raportu[1]:
Wydajność techniczna
Nie objęto wielu ważnych obszarów technicznych: systemów dialogowych (dla których brakowało standaryzowanych benchmarków), planowania, ciągłego sterowania w robotyce, rozumowania zdroworozsądkowego (common sense reasoning), systemów rekomendacyjnych, standaryzowanych testów. Autorzy ostrzegali, że śledzenie postępów odbywa się zazwyczaj w obszarach przynoszących dobre wyniki, co tworzy optymistyczne przesunięcie w ocenie stanu SI[1].
Zasięg międzynarodowy
Raport uznano za nadmiernie amerykanocentryczny, mimo znaczącej aktywności SI w innych krajach. Poziom inwestycji i aktywności w Chinach określono jako „zdumiewający", lecz wykraczający poza zakres inauguracyjnego raportu[1].
Różnorodność i inkluzywność
Raport nie zawierał podziału danych według płci, rasy, tożsamości płciowej, przynależności etnicznej, orientacji seksualnej ani innych cech. Autorzy przyznali, że pytania o to, kto uczestniczy w rozmowach o SI i kto posiada władzę wpływania na przyszłe badania oraz wdrożenia SI, są ściśle powiązane z dynamiką władzy w branży technologicznej i venture capital, a także z szerszymi systemowymi siłami dyskryminacji[1].
Inwestycje publiczne i korporacyjne
Dane dotyczące finansowania venture capital obejmowały jedynie USA i stanowiły bardzo małą część łącznych inwestycji w badania i rozwój w dziedzinie SI. Brakowało danych o nakładach publicznych i korporacyjnych[1].
Wpływ na poszczególne branże
Nie przedstawiono metryk wpływu SI na służbę zdrowia, motoryzację, finanse, edukację i inne sektory[1].
Ograniczanie ryzyk społecznych
Nie omówiono kwestii bezpieczeństwa SI, przewidywalności, sprawiedliwości algorytmów, prywatności i etycznych konsekwencji automatyzacji[1].
Forum ekspertów
Raport zawierał komentarze czołowych ekspertów reprezentujących akademię, przemysł, rząd i media[1].
Barbara Grosz (Harvard)
Barbara Grosz podkreśliła wagę opracowania metryk uwzględniających nie tylko wydajność systemów SI w izolacji, lecz także jakość interakcji SI z ludźmi oraz wpływ systemów SI na ludzi zarówno indywidualnie, jak i w społeczeństwie. Zwróciła uwagę na lukę w raporcie: sekcja dotycząca przetwarzania języka naturalnego obejmowała parsowanie, tłumaczenie maszynowe i wyszukiwanie odpowiedzi, ale nie zawierała systemów dialogowych, które wymagają uwzględnienia stanu mentalnego rozmówcy. Grosz wezwała również do śledzenia odsetka kursów z SI uwzględniających aspekty etyczne oraz liczby firm zastanawiających się, czy w ogóle należy tworzyć dany system SI[1].
Eric Horvitz (Microsoft)
Eric Horvitz nazwał publikację inauguracyjnego raportu kluczowym krokiem w angażowaniu szerszej społeczności w dialog. Docenił wartość sekcji metryk pochodnych i AI Vibrancy Index, proponując ich walidację poprzez zestawienie z danymi dotyczącymi zatrudnienia, struktury i wynagrodzeń talentów SI w korporacjach. Horvitz szczególnie podkreślił znaczenie śledzenia postępów w obszarze rozumowania zdroworozsądkowego (common sense reasoning), „które demonstruje nawet małe dziecko", lecz pozostaje poza zasięgiem współczesnych technologii SI[2].
Kai-Fu Lee (Sinovation Ventures)
Kai-Fu Lee uzupełnił lukę raportu w zakresie zasięgu międzynarodowego, przedstawiając przegląd stanu SI w Chinach. Zauważył, że Chiny mają trzy razy więcej telefonów komórkowych i użytkowników internetu niż USA czy Indie, a przepaść w wolumenach generowanych danych znacznie przekracza czynnik trzy: Chińczycy dokonują płatności mobilnych 50 razy częściej niż Amerykanie, wolumen dostaw jedzenia jest 10 razy większy, a firma Didi już rozpoczęła integrację danych z systemami zarządzania ruchem. Lee przywołał przykład chińskiego startupu Face++, który zajął pierwsze miejsce w trzech konkursach z zakresu computer vision, wyprzedzając Google, Microsoft, Facebook i CMU. Wskazał na plan Rady Państwa ChRL z lipca 2017 roku, zakładający uczynienie Chin światowym centrum innowacji w dziedzinie SI do 2030 roku, i przewidział, że amerykańsko-chińska duopolia w SI jest nie tylko nieuchronna, ale już nastąpiła[1].
Andrew Ng (Coursera, Stanford)
Andrew Ng określił SI jako „nową elektryczność", transformującą wiele branż. Opisał sekwencję transformacji poddziedzin SI przez deep learning: najpierw rozpoznawanie mowy, następnie computer vision, potem NLP (co prowadzi do rozkwitu chatbotów), a dalej robotyka (nowe możliwości produkcyjne). Ng podkreślił, że kraje prowadzące mądrzejszą politykę w zakresie SI będą rozwijać się szybciej, a kraje ze źle przemyślanymi regulacjami ryzykują pozostanie w tyle[1].
Daniela Rus (MIT)
Daniela Rus przedstawiła optymistyczne spojrzenie na SI jako wektor pozytywnych zmian: od walki ze zmianami klimatu i demokratyzacji edukacji po autonomiczne pojazdy i spersonalizowaną opiekę zdrowotną. Podkreśliła, że wbrew powszechnemu przekonaniu SI doprowadzi do powstania bardziej satysfakcjonujących, a nie mniej licznych miejsc pracy, ponieważ wzrost produktywności dzięki SI i robotyce uwolni ludzi od monotonnych zadań[1].
Sebastian Thrun (Stanford, Udacity)
Sebastian Thrun przeprowadził historyczne porównanie: przed wynalezieniem silnika parowego większość ludzi była rolnikami, definiowanymi przez siłę fizyczną. Maszyny zamieniły rolników w „nadludzi" — jeden amerykański rolnik żywi 155 osób, a mniej niż 2% ludności USA pracuje w rolnictwie. Analogicznie, SI może nauczyć się wzorców naszej powtarzalnej pracy i pomóc nam stać się „nadludźmi". Thrun przepowiedział nadejście ery bezprecedensowej ludzkiej kreatywności, ale ostrzegł przed koniecznością zostania „uczniami przez całe życie" i dostosowania się do zmian[1].
Michael Wooldridge (Oxford)
Michael Wooldridge postawił centralne pytanie: czy istnieje „bańka SI" i czy pęknie ona (podobnie jak bańka dot-comów z lat 1996–2001), czy też cicho się spuści? Jego główną obawą była nowa „zima SI", wywołana rozczarowaniem po masowych spekulacyjnych inwestycjach. Wyraził jednak ostrożny optymizm: w odróżnieniu od poprzednich cykli, pod obecną bańką istnieje realna substancja — systemy SI wykazują stały postęp, a duże firmy nauczyły się produktywnie wykorzystywać techniki SI. Wooldridge poruszył też kwestię pomiaru postępu w kierunku ogólnej SI (General AI), zauważając, że ani on, ani nikt inny nie wie, jak to zmierzyć[1].
Megan Smith i Susan Alzner
Była Chief Technology Officer USA Megan Smith i Susan Alzner (Biuro Łączności z NGO przy ONZ) podkreśliły pierwszorzędne znaczenie różnorodności i inkluzywności. Wskazały, że z rozmowy i zespołów projektowych wykluczona jest większość ludzkości wskutek „masowych świadomych i nieświadomych uprzedzeń, znaczących dyskryminacyjnych wzorców kulturowych oraz wyuczonego zachowania systemowego wykluczenia". Autorki powołały się na szereg kluczowych inicjatyw: Algorithmic Justice League, petycję do ONZ w sprawie uzbrojenia SI, ruch CS for All, inicjatywę AI4All[1].
Metodologia
Raport korzystał z danych pochodzących z wielu źródeł[1]:
- Publikacje: Elsevier Scopus — baza danych obejmująca prawie 70 milionów dokumentów; zapytania według słowa kluczowego „Artificial Intelligence" w dziedzinie „Computer Science" dla okresu od 1996 roku[3].
- Nabory na kursy: Rejestry uczelni — UC Berkeley, Carnegie Mellon, Georgia Tech, UIUC, MIT, Stanford, University of Washington[1].
- Frekwencja na konferencjach: Dane od organizatorów 15 konferencji (AAAI, AAMAS, ACL, CP, CVPR, ECAI, ICAPS, ICRA, ICLR, ICML, IJCAI, IROS, KR, NIPS, UAI)[1].
- Startupy i finansowanie: Crunchbase (API do identyfikacji firm według kategorii), VentureSource (dane dotyczące finansowania venture capital), Sand Hill Econometrics (agregacja)[4][5].
- Rynek pracy: Indeed.com (udział ofert pracy w SI według krajów), Monster.com / CEB TalentNeuron (bezwzględna liczba ofert pracy według umiejętności)[6][7].
- Import robotów: International Federation of Robotics, World Robotics Report[8].
- GitHub: GitHub Archive poprzez Google BigQuery — zliczanie zdarzeń WatchEvent dla repozytoriów frameworków SI[9].
- Wydźwięk mediów: TrendKite — klasyfikacja anglojęzycznych artykułów z filtrowaniem informacji prasowych, wiadomości finansowych i nekrologów[10].
- Benchmarki: LSVRC ImageNet, VQA 1.0, Penn Treebank, WMT / EuroMatrix, SQuAD, Switchboard Hub5'00, TPTP, SAT Competition[1].
Kierownictwo i zespół autorski
Projekt AI Index 2017 został przygotowany pod kierownictwem komitetu sterującego[1]:
- Yoav Shoham (Uniwersytet Stanforda) — przewodniczący
- Raymond Perrault (SRI International)
- Erik Brynjolfsson (MIT)
- Jack Clark (OpenAI)
- Calvin LeGassick — menedżer projektu
Komitet doradczy obejmował Michaela Bowlinga, Erniego Davisa, Julię Hirschberg, Erica Horvitza, Karen Levy, Alana Mackwortha, Toma Mitchella, Sandy'ego Pentlanda, Chrisa Ré, Danielę Rus, Sebastiana Thruna, Hala Variana i Toby'ego Walsha[1].
Wśród organizacji partnerskich znalazły się: Allen Institute for Artificial Intelligence, Crunchbase, Electronic Frontier Foundation, Elsevier, EuroMatrix, Google Brain, Indeed.com, Monster.com, Sand Hill Econometrics, Sinovation Ventures, TrendKite, VentureSource. Finansowanie startowe zapewnili Google, Microsoft i Bytedance (Toutiao), jednak AI Index podkreśla swoją niezależność i zaznacza, że niekoniecznie odzwierciedla poglądy tych organizacji[1].
Znaczenie historyczne
Inauguracyjny raport AI Index z 2017 roku położył podwaliny pod późniejszą serię dorocznych raportów, które z czasem znacznie rozszerzyły swój zakres — od początkowych czterech sekcji do dziewięciu tematycznych rozdziałów w raporcie z 2024 roku. Wiele luk szczerze przyznanych w sekcji „What's Missing" raportu z 2017 roku zostało sukcesywnie wypełnionych: zasięg międzynarodowy (począwszy od raportu z 2018 roku), dane dotyczące różnorodności, inwestycji publicznych, wpływu na sektory, a także odpowiedzialna SI i regulacje[26]. Projekt AI Index przeszedł następnie pod egidę Stanfordzkiego Instytutu HAI (Human-Centered Artificial Intelligence), utworzonego w 2019 roku[1].
Odnośniki
- AI Index 2017 Annual Report (pełny tekst): https://aiindex.stanford.edu/2017-report/
- One Hundred Year Study on AI (AI100): https://ai100.stanford.edu/
- Stanford HAI — Human-Centered Artificial Intelligence: https://hai.stanford.edu/
- Elsevier Scopus: https://www.scopus.com/
- ImageNet / LSVRC: http://www.image-net.org/challenges/LSVRC/
- SQuAD — Stanford Question Answering Dataset: https://rajpurkar.github.io/SQuAD-explorer/
- TPTP — Thousands of Problems for Theorem Provers: http://www.tptp.org/
- SAT Competition: http://www.satcompetition.org/
- EFF AI Progress Metrics: https://www.eff.org/ai/metrics
- International Federation of Robotics: https://ifr.org/
- GitHub Archive: https://www.gharchive.org/
- Crunchbase: https://www.crunchbase.com/
Literatura
- AI Index Steering Committee (2017). AI Index 2017 Annual Report. https://aiindex.stanford.edu/2017-report/
- Russakovsky, O. et al. (2015). ImageNet Large Scale Visual Recognition Challenge. International Journal of Computer Vision. https://arxiv.org/abs/1409.0575
- Rajpurkar, P. et al. (2016). SQuAD: 100,000+ Questions for Machine Comprehension of Text. https://arxiv.org/abs/1606.05250
- Silver, D. et al. (2016). Mastering the game of Go with deep neural networks and tree search. Nature, 529. https://doi.org/10.1038/nature16961
- Silver, D. et al. (2017). Mastering the game of Go without human knowledge. Nature, 550. https://doi.org/10.1038/nature24270
- Mnih, V. et al. (2015). Human-level control through deep reinforcement learning. Nature, 518. https://doi.org/10.1038/nature14236
- Esteva, A. et al. (2017). Dermatologist-level classification of skin cancer with deep neural networks. Nature, 542. https://doi.org/10.1038/nature21056
- Brown, N. & Sandholm, T. (2017). Superhuman AI for heads-up no-limit poker: Libratus beats top professionals. Science, 359(6374). https://doi.org/10.1126/science.aao1733
- Campbell, M. et al. (2002). Deep Blue. Artificial Intelligence, 134(1–2). https://doi.org/10.1016/S0004-3702(01)00129-1
- Marcus, M. et al. (1993). Building a Large Annotated Corpus of English: The Penn Treebank. Computational Linguistics, 19(2).
- International Federation of Robotics (2017). World Robotics Report. https://ifr.org/worldrobotics/
Przypisy
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 1.47 1.48 1.49 1.50 1.51 1.52 1.53 1.54 1.55 1.56 1.57 1.58 1.59 1.60 AI Index Steering Committee (2017). AI Index 2017 Annual Report. https://aiindex.stanford.edu/2017-report/
- ↑ 2.0 2.1 Horvitz, E. (2017). Commentary in AI Index 2017 Annual Report. https://aiindex.stanford.edu/2017-report/
- ↑ 3.0 3.1 3.2 Elsevier Scopus Database (2017). https://www.scopus.com/
- ↑ 4.0 4.1 Crunchbase (2017). AI-related startup data. https://www.crunchbase.com/
- ↑ 5.0 5.1 5.2 VentureSource / Sand Hill Econometrics (2017). Venture-backed AI company data.
- ↑ 6.0 6.1 6.2 Indeed.com (2017). AI job growth data. https://www.indeed.com/
- ↑ 7.0 7.1 7.2 Monster.com / CEB TalentNeuron (2017). AI job openings data. https://www.monster.com/
- ↑ 8.0 8.1 International Federation of Robotics (2017). World Robotics Report. https://ifr.org/worldrobotics/
- ↑ 9.0 9.1 GitHub Archive / Google BigQuery (2017). GitHub AI project statistics. https://www.gharchive.org/
- ↑ 10.0 10.1 TrendKite (2017). Media sentiment analysis data. https://www.trendkite.com/
- ↑ LSVRC ImageNet Competition (2010–2017). http://www.image-net.org/challenges/LSVRC/
- ↑ 12.0 12.1 Russakovsky, O. et al. (2015). ImageNet Large Scale Visual Recognition Challenge. International Journal of Computer Vision. https://arxiv.org/abs/1409.0575
- ↑ VQA Dataset (2017). http://www.visualqa.org/
- ↑ Marcus, M. et al. (1993). Building a Large Annotated Corpus of English: The Penn Treebank. Computational Linguistics, 19(2). https://catalog.ldc.upenn.edu/LDC99T42
- ↑ 15.0 15.1 Conference on Machine Translation / EuroMatrix (2017). WMT News Translation Task. http://www.statmt.org/wmt17/
- ↑ Rajpurkar, P. et al. (2016). SQuAD: 100,000+ Questions for Machine Comprehension of Text. https://arxiv.org/abs/1606.05250
- ↑ 17.0 17.1 Electronic Frontier Foundation (2017). AI Progress Metrics. https://www.eff.org/ai/metrics
- ↑ Sutcliffe, G. (2017). The TPTP Problem Library. http://www.tptp.org/
- ↑ SAT Competition (2017). http://www.satcompetition.org/
- ↑ Campbell, M. et al. (2002). Deep Blue. Artificial Intelligence, 134(1–2). https://doi.org/10.1016/S0004-3702(01)00129-1
- ↑ Mnih, V. et al. (2015). Human-level control through deep reinforcement learning. Nature, 518. https://doi.org/10.1038/nature14236
- ↑ Silver, D. et al. (2016). Mastering the game of Go with deep neural networks and tree search. Nature, 529. https://doi.org/10.1038/nature16961
- ↑ Silver, D. et al. (2017). Mastering the game of Go without human knowledge. Nature, 550. https://doi.org/10.1038/nature24270
- ↑ Esteva, A. et al. (2017). Dermatologist-level classification of skin cancer with deep neural networks. Nature, 542. https://doi.org/10.1038/nature21056
- ↑ Brown, N. & Sandholm, T. (2017). Superhuman AI for heads-up no-limit poker: Libratus beats top professionals. Science, 359(6374). https://doi.org/10.1126/science.aao1733
- ↑ Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/