The 2017 AI Index Report (TR)
AI Index Report 2017 — AI Index projesinin ilk (kurucu) yıllık raporu olup Kasım 2017'de yayımlanmıştır[1]. Proje, Stanford Üniversitesi bünyesindeki One Hundred Year Study on AI (AI100) girişimi kapsamında oluşturulmuş olup yapay zeka alanındaki etkinlikleri ve ilerlemeyi izlemeye yönelik açık ve kâr amacı gütmeyen bir proje niteliği taşımaktadır. 2017 yılı raporu, yapay zekanın durumuna ilişkin verileri sistematik biçimde derleme ve görselleştirme yönünde ilk girişimi temsil etmekte; akademi ve sektördeki faaliyet hacimlerini, YZ sistemlerinin teknik performansını, türev metrikleri ve insan düzeyine doğru ilerlemeyi kapsamaktadır. Yazarlar, YZ teknolojilerinin durumuna ilişkin uygun veriler olmaksızın toplumun yapay zeka ile ilgili tartışmalarda ve karar alma süreçlerinde «körü körüne uçtuğunu» vurgulamaktadır[1].
Ön Koşullar ve Hedefler
2017 yılına gelindiğinde yapay zeka, uygulayıcıların, sektör liderlerinin, politikacıların ve geniş kamuoyunun dikkatini çekerek küresel söylemin ön saflarına çıkmıştı. YZ alanı o denli hızlı gelişiyordu ki uzmanlar bile ilerlemeyi kavramakta ve takip etmekte güçlük çekiyordu. AI Index, tahminlere veya anekdot niteliğindeki kanıtlara değil, verilere dayalı bilinçli bir YZ tartışması için bir araç olarak tasarlandı[1].
Proje fikri, 2015 yılındaki AI100 Daimi Komitesi tartışmaları sırasında ortaya çıktı[2]. Rapor, internette serbestçe erişilebilen verilerin yanı sıra özgün verileri de bir araya getirmekte ve mevcut serilerin kombinasyonlarından yeni metrikler türetmektedir. Raporun oluşturulmasında kullanılan tüm veriler, aiindex.org adresinde kamuya açık olarak yayımlanmaktadır[1].
Raporun Yapısı
2017 yılı raporu, dört ana veri bölümünden ve birkaç tartışma bölümünden oluşmaktadır[1]:
- Faaliyet Hacmi (Volume of Activity) — «ne kadar» metrikleri: yayınlar, kurslara kayıt, konferans katılımı, girişimler, finansman, iş ilanları, robot ithalatı, açık kaynak yazılım, kamuoyu ilgisi.
- Teknik Performans (Technical Performance) — «ne kadar iyi» metrikleri: bilgisayarlı görü, doğal dil işleme, konuşma tanıma, teorem ispatlama, SAT sorunlarını çözme.
- Türev Metrikler (Derivative Measures) — eğilimler arasındaki ilişkiler, «akademi — sektör» dinamiği, YZ Canlılık Endeksi (AI Vibrancy Index).
- İnsan Düzeyine Doğru mu? (Towards Human-Level Performance?) — YZ'nin insan düzeyine yaklaştığı veya onu geçtiği başarıların kataloğu.
- Ne Eksik? (What's Missing?) — raporun sınırlamalarının kabul edilmesi ve gelecekteki çalışmaların yönleri.
- Uzman Forumu (Expert Forum) — önde gelen YZ uzmanlarının yorumları.
Faaliyet Hacmi
Akademik Yayınlar
Elsevier yayınevinin Scopus veri tabanında «Computer Science» konu alanında «Artificial Intelligence» anahtar sözcüğüyle yayımlanan ve dizinlenen YZ makalelerinin sayısı 1996'dan bu yana 9 kattan fazla artmıştır[3]. Karşılaştırma amacıyla belirtmek gerekirse, aynı dönemde bilgisayar bilimi alanındaki toplam yayın sayısı yaklaşık 6 kat artmış olup bu durum, YZ yayınlarındaki büyümenin yalnızca genel bilişim alanına olan ilginin genişlemesinden değil, özellikle yapay zekaya yönelik artan ilgiden kaynaklandığına işaret etmektedir[1].
Raporun hazırlandığı dönemde Scopus veri tabanı, genel 70 milyonluk dizinlenmiş belge hacminden «Artificial Intelligence» anahtar sözcüğüne sahip 200.000'den fazla bilgisayar bilimi makalesi ve toplamda yaklaşık 5 milyon bilgisayar bilimi makalesi içermekteydi[3].
Kurslara Öğrenci Kaydı
Yapay zeka ve Machine Learning alanındaki giriş düzeyi kurslarına öğrenci kaydı hızlı bir büyüme sergiliyordu. Stanford Üniversitesi'nde YZ giriş kursuna kayıt 1996'dan bu yana 11 kat artmıştır[1]. Machine Learning (ML), özellikle hızlı büyüyen kayıt oranları ve ML tekniklerinin son YZ başarılarındaki kritik rolü nedeniyle YZ'nin bir alt alanı olarak ayrı bir başlık altında ele alındı.
Benzer eğilimler diğer önde gelen üniversitelerde de gözlemlendi: California Üniversitesi Berkeley, Carnegie Mellon Üniversitesi, Georgia Tech Teknoloji Enstitüsü, Illinois Üniversitesi Urbana-Champaign, Massachusetts Teknoloji Enstitüsü ve Washington Üniversitesi[1]. Rapor yazarları, bu verilerin yükseköğretim ortamının yalnızca küçük bir kesitini temsil ettiğini ve daha geniş bir kurum yelpazesi için zorunlu olarak temsil niteliği taşımadığını belirtmektedir.
Konferans Katılımı
Önde gelen YZ konferanslarına (AAAI, AAMAS, ACL, CP, CVPR, ECAI, ICAPS, ICRA, ICLR, ICML, IJCAI, IROS, KR, NIPS, UAI) ait katılım verileri, araştırma odağının sembolik akıl yürütmeden Machine Learning ve Deep Learning'e doğru kaydığını doğruladı[1]. Machine Learning konferansları (NIPS, ICML, ICLR) en belirgin katılım artışını sergilerken sembolik yöntem konferansları (KR, CP, ICAPS) istikrarlı ama daha mütevazı bir toplulukla süregelen kümülatif ilerleme kaydetti[1].
YZ Alanındaki Girişimler
Girişim sermayesi finansmanıyla YZ sistemleri geliştiren aktif Amerikan girişimlerinin sayısı 2000 yılından bu yana 14 kat artmıştır[4][5]. YZ şirketlerini tanımlamak için Crunchbase kategorileri (Artificial Intelligence, Machine Learning, Natural Language Processing, Computer Vision, Facial Recognition, Image Recognition, Speech Recognition, Semantic Search, Semantic Web, Text Analytics, Virtual Assistant, Visual Search, Predictive Analytics, Intelligent System) kullanılmış ve ardından VentureSource veri tabanıyla çapraz doğrulama yapılmıştır[1].
Girişim Sermayesi Finansmanı
Amerikan YZ girişimlerine yönelik yıllık girişim sermayesi yatırımlarının hacmi 2000 yılından bu yana 6 kat artmıştır[5]. Veriler tüm finansman aşamalarını kapsamakta olup Sand Hill Econometrics tarafından VentureSource veri tabanına dayalı olarak derlenmiştir[1].
İş Gücü Piyasası
İki büyük çevrimiçi iş ilanı platformunun —Indeed.com ve Monster.com— verileri, YZ uzmanlarına yönelik talebin önemli ölçüde arttığını ortaya koymuştur[6][7].
Indeed.com: ABD'deki platformda YZ becerisi gerektiren iş ilanlarının payı 2013'ten bu yana 4,5 kat artmıştır[6]. Kanada ve Birleşik Krallık'ta da benzer hızlı bir büyüme gözlemlenmiş olmakla birlikte mutlak büyüklük açısından söz konusu pazarlar sırasıyla Amerikan pazarının %5'i ve %27'si düzeyindeydi[1].
Monster.com: Gereken beceriler (Machine Learning, bilgisayarlı görü, doğal dil işleme vb.) bazında YZ iş ilanlarının mutlak sayısına ilişkin analiz de istikrarlı büyümeyi doğruladı. Bir iş ilanı aynı anda birden fazla beceri gerektirebiliyordu[7].
Robot İthalatı
Uluslararası Robotik Federasyonu (IFR) tarafından hazırlanan World Robotics Report yıllık raporunun verileri, hem Kuzey Amerika'ya hem de dünya geneline yönelik endüstriyel robot ithalatında istikrarlı bir büyüme olduğunu ortaya koydu[8]. Rapor yazarları, robotların yüzde kaçının «YZ» olarak nitelendirilen yazılım kullandığını ve YZ alanındaki gelişmelerin endüstriyel robot kullanımındaki artışa ne ölçüde katkıda bulunduğunu belirlemenin kolay bir yolunun bulunmadığını belirtmektedir[1].
Açık Kaynak Yazılım
GitHub platformunda YZ framework'lerine yönelik geliştirici ilgisi önemli bir büyüme gösterdi. Başlıca Machine Learning ve Deep Learning paketleri —TensorFlow, Scikit-Learn, Keras, PyTorch, Caffe, MXNet, CNTK ve Theano— için yıldız (Stars) sayısı hızla artmaktaydı[9]. Google'ın TensorFlow'u ve Scikit-Learn, yıldız ve fork (Forks) sayısı trendlerinin neredeyse özdeş olduğu en popüler paketler olarak öne çıktı[1].
Kamuoyu İlgisi: Medya Tonu
TrendKite servisinin verilerine dayanılarak «Artificial Intelligence» terimini içeren popüler medya yayınlarının tonunun analizi, olumlu ve olumsuz makalelerin oranındaki dinamiği ortaya koydu[10]. TrendKite sınıflandırıcısı, İngilizce makaleleri (basın bültenleri, finansal haberler ve nekrologlar hariç) «olumlu», «olumsuz» ve «tarafsız» kategorilerine ayırıyordu[1].
Teknik Performans
Teknik performans bölümü, YZ sistemlerinin bilgisayarlı görü, doğal dil işleme, konuşma tanıma, teorem ispatlama ve SAT sorunlarını çözme görevlerindeki ilerlemeyi izlemektedir[1].
Bilgisayarlı Görü
Nesne Tespiti (Object Detection)
ImageNet veri kümesine dayalı Large Scale Visual Recognition Challenge (LSVRC) yarışmasında görüntü tanımadaki hata oranı 2010'dan 2017'ye kadar %28,5'ten %2,5'in altına geriledi[11]. Karşılaştırma amacıyla belirtmek gerekirse insan hata oranı yaklaşık %5 olarak değerlendirilmektedir[12]; yani 2017 itibarıyla YZ sistemleri bu benchmark'ta insan düzeyini önemli ölçüde geride bırakmıştı. ImageNet yarışması 2017 yılında sona erdi[1].
Görsel Soru-Cevap (Visual Question Answering)
Görüntülerle ilgili sorulara açık uçlu yanıtlar üretme görevi olan VQA 1.0 veri kümesinde YZ sistemleri istikrarlı bir ilerleme sergiledi[13]. Yazarlar, VQA 1.0 veri kümesinin halihazırda VQA 2.0 tarafından geride bırakıldığını ve orijinal sürüme ileride ne kadar ilgi gösterileceğinin belirsiz olduğunu belirtti[1].
Doğal Dil İşleme
Sözdizimsel Ayrıştırma (Parsing)
Penn Treebank'ın Wall Street Journal bölüm 23 standart test kümesinde otomatik ayrıştırıcılar F1 metriğinde istikrarlı bir artış gösterdi[14]. Sonuçlar hem 40 sözcükten kısa cümleler hem de tam cümle kümesi için kaydedildi[1].
Makine Çevirisi (Machine Translation)
İngilizce ve Almanca arasındaki haber çevirisi görevine yönelik yıllık Workshop on Machine Translation (WMT) yarışmasında en iyi sistemler BLEU metriğinde genel bir yükseliş trendi sergiledi[15]. Makine çevirisini birden fazla insan çevirisiyle karşılaştıran otomatik bir yöntem olan BLEU metriği, 0 ile 1 arasında değer alan değiştirilmiş bir doğruluk (precision) sürümüdür. BLEU, çeviri kalitesine ilişkin uzman değerlendirmeleriyle korelasyon gösterse de derlemler arasında karşılaştırma yapmak için kullanılamaz ve sistemler arasındaki karşılaştırmalar yanıltıcı olabilir[1].
2017 yılında BLEU puanları 2016 yılına kıyasla belirgin biçimde düştü (ancak 2015 düzeyinin üzerinde kaldı); bu durum büyük olasılıkla test kümesinin özelliklerinden kaynaklanmakta olup makine çevirisi sistemlerinin kalitesinin gerçek anlamda düştüğünü göstermemektedir[15].
Soru-Cevap (Question Answering)
500'den fazla makale ve 100.000'den fazla soru-cevap çifti içeren Stanford Question Answering Dataset (SQuAD) veri kümesinde YZ sistemleri, yanıtların referans yanıtlarla tam olarak eşleşme yüzdesini ölçen Exact Match (EM) metriğinde hızlı bir artış gösterdi[16]. SQuAD'daki insan performansı düzeyi %82,3 idi[1]. SQuAD puanları, veri kümesinin Haziran 2016'da oluşturulmasından bu yana hızla yükseliyordu.
Konuşma Tanıma
Telefon görüşmelerinden konuşma tanıma görevi olan Switchboard Hub5'00 standart veri kümesinde Microsoft ve IBM 2017 yılında «insan paritesine» yakın performansa ulaştı[17]. Yıllardır düşmekte olan Word Error Rate (WER) metriği —cümle uzunluğuna normalize edilmiş hata sayısı (sözcük değiştirme, silme ve ekleme)— söz konusu gelişmeyi yansıtıyordu. İnsan hata oranının tam düzeyi konusunda %5,1 ve %5,9 ile hatta %5'in altı gibi değerler öne sürülüp anlaşmazlık yaşandı. Raporda %5,1 eşiği kullanıldı[1].
Yazarlar, Switchboard veri kümesinin uzun süredir kullanılmasının YZ sistemlerinde söz konusu verilere özgü ciddi aşırı uyuma (overfitting) yol açabileceği endişesini dile getirdi[1].
Teorem İspatlama
Thousands of Problems for Theorem Provers (TPTP) görev kümesinde, mevcut otomatik teorem ispatlayıcıların (ATP) bir görevi çözebilen oranı olan ortalama «çözülebilirlik» (tractability) izlendi[18]. TPTP v5.0.0 sürümünden (2010) bu yana güncellenmemiş görevlerin alt kümesi analiz edildi. Metriklerin kendine özgü bir özelliği bulunmaktadır: yeni görevleri iyi çözen ancak diğer sistemlerin çözebileceği görevlerde zayıf kalan yeni ve güçlü ATP sistemlerinin ortaya çıkması ortalama çözülebilirliğin düşmesine neden olabilir[1].
SAT Sorunlarını Çözme
SAT yarışmasındaki endüstriyel sorun örneklerinde çözülen sorunların yüzdesinde bir artış kaydedildi[19]. Araştırmacılar Holger Hoos ve Kevin Leyton-Brown, 2007'den bu yana yarışmada sunulan 1.076 sorun örneği üzerinde 69 çözücüyü test etti; doğru karşılaştırma yapabilmek için tüm çözücüler aynı donanımda çalıştırıldı[1]. Yazarlar, iyileştirmelerin bir bölümünün algoritmik atılımlar yerine mühendislik başarılarını yansıtabileceğini belirtti[1].
Türev Metrikler
«Akademi — Sektör» Dinamiği
Akademi ve sektördeki YZ etkinliği arasındaki ilişkiyi araştırmak amacıyla üç temsili metrik seçildi: YZ yayın sayısı, Stanford'daki YZ ve ML giriş kurslarına toplam kayıt ve YZ girişimlerine yönelik girişim sermayesi yatırımları hacmi. Tüm metrikler 2000 yılına göre normalize edildi[1].
Analiz, başlangıçta akademik etkinliğin (yayınlar ve kurslara kayıt) istikrarlı bir ilerleme sağladığını ortaya koydu. Yaklaşık 2010'dan itibaren yatırımcılar alana ilgi duymaya başladı; 2013 yılına gelindiğinde ise toplam etkinliğin keskin biçimde artmasının itici gücü haline geldiler. Bu sürecin ardından akademi sektörün «coşkunluğunu» yakaladı[1].
YZ Canlılık Endeksi (AI Vibrancy Index)
AI Vibrancy Index, YZ'yi bir alan olarak niceliksel biçimde değerlendirmek amacıyla yayınların, kurslara kaydın ve girişim sermayesi yatırımlarının normalize göstergelerini bir araya getiren deneysel bir bileşik metriktir[1]. Endeks, zaman içindeki normalize metriklerin ortalaması olarak hesaplanmış ve üç bileşenin tamamındaki eş zamanlı artışı yansıtarak keskin bir yükseliş sergilemiştir. Yazarlar, bu tür türev metriklerin AI Index verilerinin daha ileri analizine ilgi uyandıracağını umduklarını ifade etti[1].
İnsan Düzeyine Doğru
Rapor, bilgisayar sistemlerinin insan düzeyinde performansa ulaştığı veya onu geçtiğine dair güvenilir vakaları bir dizi önemli çekince eşliğinde katalogladı[1].
Karşılaştırmanın temel sınırlılıkları: Makineler çoğu zaman dar kapsamlı görevlerde insanları geride bırakmakta, ancak koşullarda en küçük bir değişiklikte performans aniden düşebilmektedir. Örneğin Çince karakterleri okuyabilen bir insan büyük olasılıkla Çince konuşmayı da anlar, Çin kültürü hakkında bir şeyler bilir ve bir Çin restoranında yemek önerebilir. YZ için bu görevlerin her biri tamamen ayrı bir sistem gerektirir[1].
Başarı Kilometre Taşları
| Başarı | Yıl | Açıklama |
|---|---|---|
| Othello | 1980'ler / 1997 | 1989 yılında BILL programı (Kai-Fu Lee, Sanjoy Mahajan), önde gelen Amerikalı oyuncu Brian Rose'u 56–8 yendi. 1997 yılında Logistello programı, mevcut dünya şampiyonuna karşı altı oyunluk maçın tümünü kazandı[1]. |
| Dama | 1995 | Chinook programı mevcut dünya şampiyonunu yendi. Kendi kendine öğrenen ilk dama programları Arthur Samuel tarafından 1952'den itibaren oluşturuldu[1]. |
| Satranç | 1997 | IBM Deep Blue, dünya şampiyonu Garry Kasparov'u yendi. Bazı bilim insanları 1950'lerde bir bilgisayarın 1967 yılına kadar dünya şampiyonunu yeneceğini öngörmüştü[20]. 2017 itibarıyla akıllı telefonlardaki satranç programları grandmaster düzeyinde oynuyordu[1]. |
| Jeopardy! | 2011 | IBM Watson sistemi, yarışmanın eski şampiyonları Brad Rutter ve Ken Jennings'i yenerek 1 milyon dolarlık büyük ödülü kazandı[1]. |
| Atari Oyunları | 2015 | Google DeepMind ekibi, 49 Atari oyununu oynamayı öğrenmek için Reinforcement Learning sistemini kullandı; oyunların büyük çoğunluğunda (örneğin Breakout) insan düzeyine ulaşıldı, ancak bazı oyunlar (örneğin Montezuma's Revenge) hâlâ erişilemez kalmaya devam etti[21]. |
| Nesne Tespiti (ImageNet) | 2016 | ImageNet görüntü sınıflandırmasındaki otomatik hata oranı %28'den (2010) %3'ün altına inerken insan düzeyi yaklaşık %5'tir[12]. |
| Go | 2016–2017 | AlphaGo (Google DeepMind) Mart 2016'da Lee Sedol'ü 4–1 yendi; ardından AlphaGo Master Mart 2017'de Ke Jie'yi yendi. Ekim 2017'de AlphaGo Zero, orijinal AlphaGo'yu 100–0 yendi[22][23]. |
| Deri Kanseri Sınıflandırması | 2017 | 2.032 hastalığa ait 129.450 klinik görüntü üzerinde eğitilen YZ sistemi, deri kanseri sınıflandırmasında 21 sertifikalı dermatologa eşdeğer yetkinlik gösterdi[24]. |
| Konuşma Tanıma (Switchboard) | 2017 | Microsoft ve IBM, Switchboard veri kümesindeki konuşma tanıma görevinde «insan paritesine» yakın performansa ulaştı[17]. |
| Poker | 2017 | Libratus programı (CMU), limitsiz bahisli Texas Hold'em'in 120.000 elden oluşan turnuvasında dört üst düzey oyuncuyu yendi. DeepStack programı (Alberta Üniversitesi) ise her biri 3.000'den fazla elde oynayarak 11 profesyonel üzerindeki üstünlüğünü istatistiksel olarak anlamlı biçimde kanıtladı[25]. |
| Ms. Pac-Man | 2017 | Maluuba (Microsoft tarafından satın alındı) ekibi, Atari 2600'de 999.900 puanlık maksimum skora ulaşan bir YZ sistemi geliştirdi[1]. |
Raporda Eksik Olanlar
Yazarlar, kurucu raporun bir dizi önemli sınırlılığını açıkça kabul etti[1]:
Teknik Performans
Pek çok önemli teknik alan kapsam dışında kaldı: diyalog sistemleri (standardize edilmiş benchmark'ların bulunmadığı), planlama, robotik alanında sürekli kontrol, sağduyu akıl yürütmesi (common sense reasoning), öneri sistemleri, standardize testler. Yazarlar, ilerlemenin takibinin genellikle iyi sonuçların elde edildiği alanlarda yürütüldüğünü, bunun da YZ'nin durumuna ilişkin değerlendirmede iyimser bir sapma yarattığı konusunda uyardı[1].
Uluslararası Kapsam
Rapor, diğer ülkelerdeki önemli YZ etkinliğine karşın aşırı Amerikan merkezli bulundu. Çin'deki yatırım ve etkinlik düzeyi «çarpıcı» olarak nitelendirildi, ancak bunun kurucu raporun kapsamı dışında olduğu belirtildi[1].
Çeşitlilik ve Kapsayıcılık
Rapor cinsiyet, ırk, toplumsal cinsiyet, etnisite, cinsel yönelim veya diğer özellikler bazında veri dökümü içermiyordu. Yazarlar, YZ tartışmalarına kimin katıldığı ve geleceğin YZ araştırmaları ile konuşlandırmasını etkileme gücüne kimin sahip olduğuna ilişkin soruların teknoloji ve girişim sermayesi sektörlerindeki güç dinamikleriyle ve daha geniş kapsamlı sistemik ayrımcılık güçleriyle yakından bağlantılı olduğunu kabul etti[1].
Kamu ve Kurumsal Yatırımlar
Girişim sermayesi finansmanına ilişkin veriler yalnızca ABD'yi kapsıyor ve YZ araştırma-geliştirme alanındaki toplam yatırımların çok küçük bir bölümünü temsil ediyordu. Kamu ve kurumsal yatırımlara dair veriler mevcut değildi[1].
Belirli Sektörlere Etkisi
YZ'nin sağlık, otomotiv, finans, eğitim ve diğer sektörlere etkisine ilişkin metrikler sunulmadı[1].
Toplumsal Risklerin Azaltılması
YZ güvenliği, öngörülebilirlik, algoritma adaleti, gizlilik ve otomasyonun etik sonuçlarına ilişkin konular ele alınmadı[1].
Uzman Forumu
Rapor, akademi, sektör, hükümet ve medyayı temsil eden önde gelen uzmanların yorumlarını içeriyordu[1].
Barbara Grosz (Harvard)
Barbara Grosz, yalnızca boşlukta YZ sistemlerinin performansını değil, aynı zamanda YZ'nin insanlarla etkileşim kalitesini ve YZ sistemlerinin insanlar üzerindeki etkisini hem bireysel hem de toplumsal düzeyde ele alan metriklerin geliştirilmesinin önemine dikkat çekti. Raporun bir eksiğine parmak bastı: Doğal dil işleme bölümü sözdizimsel ayrıştırma, makine çevirisi ve soru-cevap sistemlerini kapsıyordu, ancak muhatabın zihinsel durumunun göz önünde bulundurulmasını gerektiren diyalog sistemlerini içermiyordu. Grosz aynı zamanda YZ kurslarının etik boyutlara ayrılan oranının ve bir YZ sisteminin gerçekten oluşturulup oluşturulmaması gerektiğini sorgulayan şirket sayısının takip edilmesi çağrısında bulundu[1].
Eric Horvitz (Microsoft)
Eric Horvitz, kurucu raporun yayımlanmasını daha geniş topluluğun diyaloga dahil edilmesinde kritik bir adım olarak nitelendirdi. Türev metrikler bölümünün ve AI Vibrancy Index'in değerini vurgulayarak bunların şirketlerdeki YZ yeteneklerinin işe alım, bileşim ve ücretlendirme verileriyle karşılaştırılarak doğrulanmasını önerdi. Horvitz, «küçük bir çocuğun bile sergilediği» ama günümüz YZ teknolojilerinin erişemediği sağduyu akıl yürütmesi (common sense reasoning) alanındaki ilerlemenin takibinin önemine özellikle dikkat çekti[2].
Kai-Fu Lee (Sinovation Ventures)
Kai-Fu Lee, raporun uluslararası kapsamındaki boşluğu doldurarak Çin'deki YZ durumuna genel bir bakış sundu. Çin'in ABD veya Hindistan'dan üç kat daha fazla cep telefonu kullanıcısına ve internet kullanıcısına sahip olduğunu, üretilen veri hacmindeki uçurumun ise fiilen üç faktörü çok aştığını belirtti: Çinliler Amerikalılardan 50 kat daha fazla mobil ödeme yapıyor, yemek teslimat hacmi 10 kat daha büyük ve Didi verilerini trafik yönetim sistemleriyle entegre etmeye başlıyor. Lee, Google, Microsoft, Facebook ve CMU'yu geride bırakarak üç bilgisayarlı görü yarışmasında birinci olan Çinli girişim Face++'ı örnek gösterdi. Çin Devlet Konseyinin Temmuz 2017 tarihli ve 2030 yılına kadar YZ alanında küresel inovasyon merkezi olma hedefini öngören planına dikkat çekti ve ABD-Çin YZ düopolisinin yalnızca kaçınılmaz olmadığını, halihazırda gerçekleşmiş olduğunu öngördü[1].
Andrew Ng (Coursera, Stanford)
Andrew Ng, YZ'yi pek çok sektörü dönüştüren «yeni elektrik» olarak tanımladı. YZ alt alanlarının Deep Learning tarafından dönüştürülme sırasını şöyle açıkladı: önce konuşma tanıma, ardından bilgisayarlı görü, ardından NLP (bu da sohbet botlarının yükselişine yol açıyor) ve sonrasında robotik (yeni üretim olanakları). Ng, YZ alanında daha akılcı politikalara sahip ülkelerin daha hızlı ilerlediğini, kötü tasarlanmış önlemler alan ülkelerin ise geride kalma riskiyle karşı karşıya olduğunu vurguladı[1].
Daniela Rus (MIT)
Daniela Rus, iklim değişikliğiyle mücadeleden eğitimin demokratikleşmesine, otonom araçlardan kişiselleştirilmiş sağlık hizmetlerine uzanan bir perspektifle YZ'nin olumlu değişimin bir vektörü olarak iyimser bir tablosunu çizdi. Yaygın kanının aksine, YZ'nin daha az sayıda değil, daha tatmin edici işlere yol açacağını vurguladı; zira YZ ve robotiğin sağlayacağı verimlilik artışı insanları tekrarlayan görevlerden kurtaracaktır[1].
Sebastian Thrun (Stanford, Udacity)
Sebastian Thrun tarihsel bir paralellik kurdu: Buhar makinesinin icadından önce insanların büyük çoğunluğu fiziksel güçle tanımlanan çiftçilerdi. Makineler çiftçileri «süperinsanlara» dönüştürdü —bir Amerikalı çiftçi 155 kişiyi besliyor ve ABD nüfusunun %2'sinden azı tarımda çalışıyor. Benzer biçimde, YZ tekrarlayan çalışmamızın örüntülerini öğrenerek bize «süperinsan» olmamızda yardımcı olabilir. Thrun, eşi görülmemiş insan yaratıcılığı çağının başlayacağını öngördü; ancak «ömür boyu öğrenci» olmanın ve değişime uyum sağlamanın zorunluluğu konusunda uyardı[1].
Michael Wooldridge (Oxford)
Michael Wooldridge merkezi soruyu gündeme taşıdı: Ortada bir «YZ balonu» var mıdır ve bu balon patlayacak mıdır (1996–2001 nokta-com balonuna benzer biçimde) yoksa yavaşça söner mi? Temel kaygısı, büyük çaplı spekülatif yatırımların ardından gelen hayal kırıklığının tetikleyeceği yeni bir «YZ kışı» idi. Bununla birlikte ihtiyatlı bir iyimserlik de sergiledi: Önceki döngülerin aksine mevcut balonun altında gerçek bir özün bulunduğu —YZ sistemlerinin sürekli ilerleme sergilediği ve büyük şirketlerin YZ tekniklerini verimli biçimde kullanmayı öğrendiği— gözlemlendi. Wooldridge ayrıca genel YZ (General AI) yönünde ilerlemenin nasıl ölçüleceği sorusunu da gündeme getirdi ve ne kendisinin ne de başka birinin bunu nasıl ölçeceğini bilmediğini belirtti[1].
Megan Smith ve Susan Alzner
Eski ABD Baş Teknoloji Sorumlusu Megan Smith ve Susan Alzner (BM STK İrtibat Servisi), çeşitlilik ve kapsayıcılığın birincil önemini vurguladı. Tartışmadan ve proje ekiplerinden insanlığın büyük çoğunluğunun «kitlesel bilinçli ve bilinçdışı önyargı, önemli ayrımcı kültürel örüntüler ve sistemik dışlanmanın öğrenilmiş davranışı» nedeniyle dışlandığına dikkat çektiler. Yazarlar bir dizi önemli girişime atıfta bulundu: Algorithmic Justice League, BM'ye yapay zeka silahlanmasına ilişkin dilekçe, CS for All hareketi, AI4All girişimi[1].
Metodoloji
Rapor, çok sayıda kaynaktan yararlandı[1]:
- Yayınlar: Elsevier Scopus — yaklaşık 70 milyon belgeden oluşan veri tabanı; 1996'dan itibaren «Computer Science» konu alanında «Artificial Intelligence» anahtar sözcüğüne yönelik sorgular[3].
- Kurslara Kayıt: Üniversite kayıtları — UC Berkeley, Carnegie Mellon, Georgia Tech, UIUC, MIT, Stanford, University of Washington[1].
- Konferans Katılımı: 15 konferansın organizatörlerinden alınan veriler (AAAI, AAMAS, ACL, CP, CVPR, ECAI, ICAPS, ICRA, ICLR, ICML, IJCAI, IROS, KR, NIPS, UAI)[1].
- Girişimler ve Finansman: Crunchbase (şirketleri kategorilere göre tanımlamak için API), VentureSource (girişim sermayesi finansmanı verileri), Sand Hill Econometrics (derleme)[4][5].
- İş Gücü Piyasası: Indeed.com (ülkelere göre YZ iş ilanlarının payı), Monster.com / CEB TalentNeuron (becerilere göre mutlak iş ilanı sayısı)[6][7].
- Robot İthalatı: International Federation of Robotics, World Robotics Report[8].
- GitHub: Google BigQuery üzerinden GitHub Archive — YZ framework deposları için WatchEvent sayısı[9].
- Medya Tonu: TrendKite — basın bültenleri, finansal haberler ve nekrologların filtrelenmesiyle İngilizce makalelerin sınıflandırılması[10].
- Benchmark'lar: LSVRC ImageNet, VQA 1.0, Penn Treebank, WMT / EuroMatrix, SQuAD, Switchboard Hub5'00, TPTP, SAT Competition[1].
Yönetim ve Yazar Ekibi
AI Index 2017 projesi, bir yönetim komitesinin gözetiminde hazırlandı[1]:
- Yoav Shoham (Stanford Üniversitesi) — başkan
- Raymond Perrault (SRI International)
- Erik Brynjolfsson (MIT)
- Jack Clark (OpenAI)
- Calvin LeGassick — proje yöneticisi
Danışma komitesi şu isimleri kapsıyordu: Michael Bowling, Ernie Davis, Julia Hirschberg, Eric Horvitz, Karen Levy, Alan Mackworth, Tom Mitchell, Sandy Pentland, Chris Re, Daniela Rus, Sebastian Thrun, Hal Varian ve Toby Walsh[1].
Ortak kuruluşlar arasında şunlar yer aldı: Allen Institute for Artificial Intelligence, Crunchbase, Electronic Frontier Foundation, Elsevier, EuroMatrix, Google Brain, Indeed.com, Monster.com, Sand Hill Econometrics, Sinovation Ventures, TrendKite, VentureSource. Başlangıç finansmanını Google, Microsoft ve Bytedance (Toutiao) sağladı; ancak AI Index bağımsızlığını vurgulayarak bu kuruluşların görüşlerini yansıtmak zorunda olmadığını belirtti[1].
Tarihsel Önemi
2017 tarihli kurucu AI Index raporu, zamanla kapsamı önemli ölçüde genişleyen —başlangıçtaki dört bölümden 2024 raporu itibarıyla dokuz tematik bölüme çıkan— sonraki yıllık raporlar serisinin temelini attı. 2017 raporu «What's Missing» bölümünde dürüstçe kabul edilen pek çok eksiklik giderek giderildi: uluslararası kapsam (2018 raporundan itibaren), çeşitlilik verileri, kamu yatırımları, sektörlere etkisi, sorumlu YZ ve düzenleme[26]. AI Index projesi daha sonra 2019 yılında kurulan Stanford HAI (Human-Centered Artificial Intelligence) enstitüsü bünyesine geçti[1].
Literatür
- AI Index Steering Committee (2017). AI Index 2017 Annual Report. https://aiindex.stanford.edu/2017-report/
- Russakovsky, O. et al. (2015). ImageNet Large Scale Visual Recognition Challenge. International Journal of Computer Vision. https://arxiv.org/abs/1409.0575
- Rajpurkar, P. et al. (2016). SQuAD: 100,000+ Questions for Machine Comprehension of Text. https://arxiv.org/abs/1606.05250
- Silver, D. et al. (2016). Mastering the game of Go with deep neural networks and tree search. Nature, 529. https://doi.org/10.1038/nature16961
- Silver, D. et al. (2017). Mastering the game of Go without human knowledge. Nature, 550. https://doi.org/10.1038/nature24270
- Mnih, V. et al. (2015). Human-level control through deep reinforcement learning. Nature, 518. https://doi.org/10.1038/nature14236
- Esteva, A. et al. (2017). Dermatologist-level classification of skin cancer with deep neural networks. Nature, 542. https://doi.org/10.1038/nature21056
- Brown, N. & Sandholm, T. (2017). Superhuman AI for heads-up no-limit poker: Libratus beats top professionals. Science, 359(6374). https://doi.org/10.1126/science.aao1733
- Campbell, M. et al. (2002). Deep Blue. Artificial Intelligence, 134(1–2). https://doi.org/10.1016/S0004-3702(01)00129-1
- Marcus, M. et al. (1993). Building a Large Annotated Corpus of English: The Penn Treebank. Computational Linguistics, 19(2).
- International Federation of Robotics (2017). World Robotics Report. https://ifr.org/worldrobotics/
Kaynakça
- AI Index 2017 Annual Report (tam metin): https://aiindex.stanford.edu/2017-report/
- One Hundred Year Study on AI (AI100): https://ai100.stanford.edu/
- Stanford HAI — Human-Centered Artificial Intelligence: https://hai.stanford.edu/
- Elsevier Scopus: https://www.scopus.com/
- ImageNet / LSVRC: http://www.image-net.org/challenges/LSVRC/
- SQuAD — Stanford Question Answering Dataset: https://rajpurkar.github.io/SQuAD-explorer/
- TPTP — Thousands of Problems for Theorem Provers: http://www.tptp.org/
- SAT Competition: http://www.satcompetition.org/
- EFF AI Progress Metrics: https://www.eff.org/ai/metrics
- International Federation of Robotics: https://ifr.org/
- GitHub Archive: https://www.gharchive.org/
- Crunchbase: https://www.crunchbase.com/
Notlar
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 1.47 1.48 1.49 1.50 1.51 1.52 1.53 1.54 1.55 1.56 1.57 1.58 1.59 1.60 AI Index Steering Committee (2017). AI Index 2017 Annual Report. https://aiindex.stanford.edu/2017-report/
- ↑ 2.0 2.1 Horvitz, E. (2017). Commentary in AI Index 2017 Annual Report. https://aiindex.stanford.edu/2017-report/
- ↑ 3.0 3.1 3.2 Elsevier Scopus Database (2017). https://www.scopus.com/
- ↑ 4.0 4.1 Crunchbase (2017). AI-related startup data. https://www.crunchbase.com/
- ↑ 5.0 5.1 5.2 VentureSource / Sand Hill Econometrics (2017). Venture-backed AI company data.
- ↑ 6.0 6.1 6.2 Indeed.com (2017). AI job growth data. https://www.indeed.com/
- ↑ 7.0 7.1 7.2 Monster.com / CEB TalentNeuron (2017). AI job openings data. https://www.monster.com/
- ↑ 8.0 8.1 International Federation of Robotics (2017). World Robotics Report. https://ifr.org/worldrobotics/
- ↑ 9.0 9.1 GitHub Archive / Google BigQuery (2017). GitHub AI project statistics. https://www.gharchive.org/
- ↑ 10.0 10.1 TrendKite (2017). Media sentiment analysis data. https://www.trendkite.com/
- ↑ LSVRC ImageNet Competition (2010–2017). http://www.image-net.org/challenges/LSVRC/
- ↑ 12.0 12.1 Russakovsky, O. et al. (2015). ImageNet Large Scale Visual Recognition Challenge. International Journal of Computer Vision. https://arxiv.org/abs/1409.0575
- ↑ VQA Dataset (2017). http://www.visualqa.org/
- ↑ Marcus, M. et al. (1993). Building a Large Annotated Corpus of English: The Penn Treebank. Computational Linguistics, 19(2). https://catalog.ldc.upenn.edu/LDC99T42
- ↑ 15.0 15.1 Conference on Machine Translation / EuroMatrix (2017). WMT News Translation Task. http://www.statmt.org/wmt17/
- ↑ Rajpurkar, P. et al. (2016). SQuAD: 100,000+ Questions for Machine Comprehension of Text. https://arxiv.org/abs/1606.05250
- ↑ 17.0 17.1 Electronic Frontier Foundation (2017). AI Progress Metrics. https://www.eff.org/ai/metrics
- ↑ Sutcliffe, G. (2017). The TPTP Problem Library. http://www.tptp.org/
- ↑ SAT Competition (2017). http://www.satcompetition.org/
- ↑ Campbell, M. et al. (2002). Deep Blue. Artificial Intelligence, 134(1–2). https://doi.org/10.1016/S0004-3702(01)00129-1
- ↑ Mnih, V. et al. (2015). Human-level control through deep reinforcement learning. Nature, 518. https://doi.org/10.1038/nature14236
- ↑ Silver, D. et al. (2016). Mastering the game of Go with deep neural networks and tree search. Nature, 529. https://doi.org/10.1038/nature16961
- ↑ Silver, D. et al. (2017). Mastering the game of Go without human knowledge. Nature, 550. https://doi.org/10.1038/nature24270
- ↑ Esteva, A. et al. (2017). Dermatologist-level classification of skin cancer with deep neural networks. Nature, 542. https://doi.org/10.1038/nature21056
- ↑ Brown, N. & Sandholm, T. (2017). Superhuman AI for heads-up no-limit poker: Libratus beats top professionals. Science, 359(6374). https://doi.org/10.1126/science.aao1733
- ↑ Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/