The 2022 AI Index Report (BG)
AI Index Report 2022 — петото годишно издание на доклада AI Index, изготвено от Станфордския институт за човекоцентриран изкуствен интелект (Stanford HAI)[1]. Докладът за 2022 година е най-обемният към момента на публикуване и излиза в период на мащабно внедряване на ИИ системи в икономиката. Изданието за първи път съдържа отделна глава с задълбочен анализ на техническата етика на ИИ, обширен преглед на роботиката, основан на глобално проучване сред изследователи, както и данни за законодателни инициативи в областта на ИИ в 25 държави по света. Докладът проследява, систематизира и визуализира данни, свързани с изкуствения интелект, предоставяйки обективна и внимателно верифицирана информация за политици, изследователи, ръководители, журналисти и широката общественост.
Структура на доклада
Докладът за 2022 година се състои от пет тематични глави и приложение[1]:
- Изследвания и разработки (Research and Development) — тенденции в публикациите, патентите, конференциите и софтуера с отворен код.
- Техническа производителност (Technical Performance) — benchmark-ове в компютърното зрение, обработката на език, реч, препоръчителни системи, Reinforcement Learning, хардуер и роботика.
- Техническа етика на ИИ (Technical AI Ethics) — нова глава: метрики за справедливост и предубеждения, токсичност на езикови модели, мултимодални изкривявания, проверка на факти и правдивост.
- Икономика и образование (The Economy and Education) — пазар на труда, инвестиции, корпоративно внедряване на ИИ и подготовка на кадри.
- Политика и управление на ИИ (AI Policy and Governance) — законодателство, регулиране и национални стратегии.
Ключови изводи на доклада
Авторите на доклада са откроили редица основни тези за 2022 година[1]:
1. Частните инвестиции в ИИ рязко нараснаха, а концентрацията на капитал се засили
Частните инвестиции в ИИ през 2021 година възлязоха на около 93,5 млрд. долара — повече от двойно спрямо показателя за 2020 година. При това броят на новофинансираните ИИ компании продължи да намалява: от 1 051 през 2019 година и 762 през 2020 година до 746 през 2021 година. Ако през 2020 година само 4 рунда на финансиране надвишиха 500 млн. долара, то през 2021 година такива рундове вече имаше 15[2].
2. САЩ и Китай доминират в международното сътрудничество в областта на ИИ
Въпреки нарастващото геополитическо напрежение, САЩ и Китай показаха най-голям брой съвместни публикации в областта на ИИ за периода 2010–2021 г., увеличявайки обема на сътрудничеството петкратно от 2010 година. Този тандем произведе 2,7 пъти повече публикации от следващата двойка — Великобритания и Китай[3].
3. Езиковите модели стават по-мощни, но и по-предубедени
Големите езикови модели установяваха нови рекорди на технически benchmark-ове, но данните показаха, че по-големите модели възпроизвеждат в по-голяма степен предубежденията от обучителните данни. Моделът с 280 млрд. параметъра (Gopher, DeepMind, 2021) демонстрира с 29% по-висока предизвикана токсичност в сравнение с модела със 117 млн. параметъра, смятан за авангарден през 2018 година[4].
4. Разцвет на етиката на ИИ
Изследванията в областта на справедливостта и прозрачността на ИИ преживяха взривен ръст от 2014 година: броят на профилните публикации на етически конференции се увеличи петкратно. Алгоритмичната справедливост и предубежденията престанаха да бъдат чисто академична тема и се превърнаха в мейнстрийм направление на изследванията. Изследователите с индустриална принадлежност увеличаваха своя принос на етическите конференции с 71% годишно[1].
5. ИИ става по-достъпен и по-производителен
От 2018 година насам стойността на обучението на система за класификация на изображения намаля с 63,6%, а времето за обучение се подобри с 94,4%. Аналогична тенденция към намаляване на разходите и ускоряване на обучението се наблюдаваше и в другите категории задачи на MLPerf: препоръки, разпознаване на обекти и обработка на език[5].
6. Данните като ключов ресурс
Най-добрите резултати на технически benchmark-ове все по-често се постигаха чрез използването на допълнителни обучителни данни. Към 2021 година 9 от 10 авангардни ИИ системи на разгледаните benchmark-ове бяха обучени с използването на допълнителни данни. Тази тенденция неявно облагодетелства компаниите от частния сектор, разполагащи с достъп до обширни dataset-и[1].
7. Законодателството за ИИ по целия свят стремглаво нараства
Анализът на AI Index за 25 държави показа, че броят на приетите закони, съдържащи термина „изкуствен интелект", е нараснал от 1 през 2016 година до 18 през 2021 година. Лидери за 2021 година станаха Испания, Великобритания и САЩ — по три приети закона всяка[1].
8. Роботизираните манипулатори стават по-евтини
Проучването на AI Index показа, че медианната цена на роботизираните манипулатори е намаляла с 46,2% за пет години — от 42 000 долара през 2017 година до 22 600 долара през 2021 година, правейки изследванията в областта на роботиката по-достъпни[1].
9. Мултимодалните модели наследяват мултимодални предубеждения
Мултимодалните модели за език и зрение (като CLIP) установиха нови рекорди в задачите за класификация на изображения и генериране на изображения по текстово описание, но те също така възпроизвеждаха социални стереотипи и предубеждения. Експериментите с CLIP показаха, че изображенията на чернокожи хора погрешно се класифицираха като „нечовешки" повече от двойно по-често в сравнение с изображенията на представители на всяка друга раса[6].
10. Движение към по-общо Reinforcement Learning
През последното десетилетие ИИ системите успешно усвояваха тесни задачи на Reinforcement Learning (например шах — най-добрият шахматен двигател надмина максималния рейтинг на Магнус Карлсен с 24%). Обаче през последните две години ИИ системите също подобриха резултатите си с 129% в по-общи задачи на Reinforcement Learning (Procgen), при които се изисква действие в нови, непознати среди[1].
Глава 1. Изследвания и разработки
Главата анализира тенденциите в публикациите, патентите, конференциите и отворения софтуер[1].
Публикации
Общият брой англоезични публикации в областта на ИИ продължи да расте и достигна 334 500 през 2021 година[3].
По вид публикация. През 2021 година бяха издадени повече от 56 700 публикации в репозитории (arXiv и др.), което отразява нарастващата роля на предварителните публикации (препринти) в ИИ изследванията[1].
По географско разпределение. През 2021 година Китай продължи да лидира по съвкупен брой публикации в списания, конференции и репозитории — с 63,2% повече от САЩ. При това САЩ запазваха доминиращото лидерство по брой цитирания на конференционни и репозиторни публикации[3]:
| Показател | Китай | ЕС + Великобритания | САЩ |
|---|---|---|---|
| Дял на конференционните публикации (2021) | 27,6% | 19,0% | 16,9% |
| Дял на конференционните цитирания (2021) | 15,3% | 23,3% | 29,5% |
| Дял на репозиторните публикации (2021) | 16,6% | 23,9% | 32,5% |
| Дял на репозиторните цитирания (2021) | 16,4% | 20,1% | 38,6% |
Междусекторно сътрудничество. От 2010 до 2021 година най-голям брой съвместни ИИ публикации бяха произведени от колаборации между образователни и нестопански организации, след това — между частни компании и образователни институции, а също между образователни и държавни институции[1].
Патенти
Броят на подадените патентни заявки в областта на ИИ през 2021 година надмина повече от 30 пъти показателя от 2015 година при среден годишен темп на растеж от 76,9%. По регионално разпределение Източна Азия и Тихоокеанският регион доминираха с дял от 62,1% от патентните заявки. Китай подаваше патентни заявки три пъти повече от САЩ — 87 343 заявки при 1 407 одобрени патента през 2021 година[3].
Конференции
Посещаемостта на водещите ИИ конференции през 2021 година се запази на нивото от 2020 година — над 88 000 участника по целия свят. Повечето конференции продължиха да се провеждат в дистанционен формат поради пандемията от COVID-19. Само ICRA и EMNLP използваха хибриден формат[1].
Глава 2. Техническа производителност
Главата представя разширен анализ на напредъка в компютърното зрение, обработката на език, реч, препоръчителни системи, Reinforcement Learning, хардуер и роботика[1].
Компютърно зрение
ImageNet. Точността на класификацията на изображения в ImageNet продължаваше да расте. Системите, използващи допълнителни обучителни данни, демонстрираха значително по-високи резултати. През 2021 година моделът CoAtNet, обучен върху ImageNet-21K + JFT, постигна top-1 accuracy от 90,88%, което съществено надвишава човешкото ниво (около 94,9% по top-5)[1].
Специализирани подзадачи. През 2021 година се наблюдаваше нарастващ интерес към специализирани подзадачи на компютърното зрение — медицинска сегментация на изображения и идентификация на лица с маски. Например, ако преди 2020 година само 3 изследователски труда тестваха системи на benchmark-а Kvasir-SEG (медицинска визуализация), то през 2021 година такива трудове вече имаше 25[1].
Визуално здраво разсъждение (VCR). До края на 2021 година най-добрият резултат на benchmark-а Visual Commonsense Reasoning беше 72,0 — ръст от 63,6% от 2018 година, въпреки че системите все още значително отстъпваха на човешкото ниво. Подобренията ставаха все по-маргинални, указвайки на необходимост от нови подходи[1].
Обработка на естествен език
SuperGLUE. На върха на класацията на SuperGLUE се намираше моделът SS-MoE с резултат 91,0, надвишаващ човешкото ниво (89,8). Стремителният напредък на SuperGLUE свидетелстваше за необходимостта от разработване на по-сложни езикови benchmark-ове[7].
SQuAD. ИИ системите надминаха човешкото ниво на benchmark-а SQuAD 2.0 по разбиране на прочетен текст с 1–5%, но при по-сложни задачи, като абдуктивен логически извод на естествен език (aNLI), човекът все още изпреварваше ИИ, въпреки че разривът се стесни от 9 п.п. през 2019 година до 1 п.п. през 2021 година[1].
Машинен превод. Броят на комерсиално достъпните системи за машинен превод продължаваше да расте, а качеството на превода за основните езикови двойки (WMT 2014) стабилно се подобряваше[8].
Разпознаване на реч
На benchmark-а LibriSpeech (Test-Clean) показателят за грешки при разпознаване на думи (WER) продължаваше да намалява, приближавайки се до човешкото ниво. Напредък беше постигнат и при по-сложни dataset-и за реч[1].
Reinforcement Learning
Atari-57. Системите за Reinforcement Learning продължаваха да се усъвършенстват при класическите задачи на Arcade Learning Environment. Моделът MuZero (DeepMind) оставаше един от водещите[1].
Procgen. На benchmark-а Procgen, тестващ способността за обобщение в нови среди, ИИ системите подобриха резултата си с 129% за две години, което указваше на движение към по-общи агенти[1].
Шах. Най-добрият шахматен програмен двигател надмина максималния ELO рейтинг на Магнус Карлсен с 24%[9].
Хардуер и разходи за обучение
MLPerf. Данните от benchmark-а MLPerf показаха устойчиво намаляване на времето за обучение при едновременен ръст на броя използвани ускорители. Разривът между средния брой ускорители при лидерите и всички участници нарасна 9 пъти от 2018 до 2021 година, което свидетелстваше за нарастващи изисквания към хардуерните ресурси[5].
Разходи за обучение на ImageNet. Разходите за обучение на високопроизводителна система за класификация на изображения до 93% точност намаляха от 1 112,6 долара през 2017 година до 4,6 долара през 2021 година — спад от 223 пъти за четири години[1].
Роботика
Цени на манипулаторите. Проучването на AI Index, проведено сред 509 професори по роботика от 67 университета по света, установи намаляване на медианната цена на роботизирания манипулатор с 46,2% — от 42 000 долара през 2017 година до 22 600 долара през 2021 година[1].
ИИ умения в роботиката. 67% от анкетираните професори по роботика съобщиха за използването на дълбоко обучение, а 46% — на Reinforcement Learning в своите изследвания[1].
Глава 3. Техническа етика на ИИ
Включената за първи път в доклада глава предоставя задълбочен анализ на метриките за справедливост и предубеждения, токсичността на езикови модели, мултимодалните изкривявания, а също въпросите за проверка на факти и правдивост на ИИ[1].
Мета-анализ на метриките за справедливост и предубеждения
Броят на метриките за измерване на предубежденията и справедливостта на ИИ устойчиво нарастваше от 2018 година. Метриките се делят на два основни типа: benchmark dataset-и (например StereoSet, CrowS-Pairs), измерващи вътрешното поведение на модела, и диагностични метрики (например демографски паритет, равенство на възможностите), оценяващи въздействието на модела върху конкретни групи от населението[1].
Токсичност на езиковите модели
RealToxicityPrompts. Токсичността на езиковите модели съществено зависеше от обучителните данни. Моделите, обучени върху текст, почистен от токсично съдържание (например C4 с филтриране), бяха значително по-малко токсични в сравнение с моделите, обучени върху нефилтрирано интернет съдържание[10].
Мащаб и токсичност. Анализът на модела Gopher (DeepMind, 280 млрд. параметъра) показа, че по-големите модели с по-голяма вероятност генерират токсични продължения при съответните prompt-ове, но едновременно с това по-добре разпознават токсично съдържание[4].
Детоксикация. Методите за детоксикация на езикови модели (DAPT, PPLM, GeDi) последователно водеха до влошаване на производителността, като непропорционално по-силно — при афроамерикански английски и текстове, съдържащи споменавания на малцинства[11].
Стереотипи и предубеждения
StereoSet измерваше стереотипните предубеждения по оси пол, раса, религия и професия. CrowS-Pairs оценяваше степента на стереотипното предубеждение в маскирани езикови модели. Winogender и WinoBias тестваха половото предубеждение в задачи за кореференция, а WinoMT — в машинния превод[1].
Мултимодални предубеждения (CLIP)
Моделът CLIP (Contrastive Language-Image Pretraining, OpenAI) демонстрира впечатляващи резултати при класификацията на изображения, но наследи предубеждения по пол, раса и възраст от обучителните данни (400 млн. двойки „изображение–текст" от интернет). Ключови открития[1]:
- Дискредитиращ вред: при добавяне на нечовешки и криминални категории към класификацията, изображенията на чернокожи хора погрешно се отнасяха към нечовешки категории в 14% от случаите — двойно повече, отколкото за другите раси.
- Полово предубеждение: етикетите „бавачка" и „домашна работничка" се асоциираха с жени, „затворник" и „мафиот" — с мъже.
- Разпространение на предубеждения: предубежденията на CLIP се пренасяха в dataset-а LAION-400M, куриран с помощта на embedding-и на CLIP, засягайки всички последващи приложения.
Проверка на факти и правдивост
TruthfulQA. Анализът на няколко семейства езикови модели на benchmark-а TruthfulQA показа, че мащабирането на базовите модели (семейство GPT-3) водеше до намаляване на правдивостта. Обаче моделите, дообучени с помощта на обратна връзка от хора (InstructGPT, WebGPT), ставаха по-правдиви при мащабиране[12].
FEVER. На benchmark-а FEVER (Fact Extraction and VERification) системите за автоматична проверка на факти продължаваха да се усъвършенстват, въпреки че все още отстъпваха на човешкото ниво[1].
Тенденции на етическите конференции
Анализът на публикациите на конференцията FAccT (Fairness, Accountability, and Transparency) и тематичните уъркшопове на NeurIPS разкри ръст на трудовете по интерпретируемост, обяснимост, каузални разсъждения, поверителност, събиране на данни, справедливост и предубеждения. Изследователите с индустриална принадлежност съществено увеличиха своя принос на тези платформи[1].
Глава 4. Икономика и образование
Главата изследва тенденциите на пазара на труда, в инвестициите, корпоративното внедряване на ИИ и подготовката на кадри[1].
Пазар на труда
Наемане на ИИ специалисти. Според данните на LinkedIn, Нова Зеландия показа най-голям ръст на наемането на ИИ специалисти — 2,42 пъти от 2016 до 2021 година, следвана от Хонконг (1,56×), Ирландия (1,28×), Люксембург (1,26×) и Швеция (1,24×)[13].
Свободни работни места. Според данните на Emsi Burning Glass, Сингапур лидираше по дял на ИИ позиции сред всички свободни работни места — 2,33%, следван от САЩ (0,90%), Канада (0,78%) и Великобритания (0,74%). В САЩ най-голям брой ИИ позиции се наблюдаваше в Калифорния (повече от 2,35 пъти повече, отколкото в Тексас), а най-голям дял на ИИ позиции — в щата Вашингтон (окръг Колумбия)[14].
Инвестиции
Общи тенденции. Съвкупните корпоративни инвестиции в ИИ през 2021 година достигнаха рекордните 176,5 млрд. долара, от които частните инвестиции възлязоха на 93,5 млрд. (ръст повече от двойно спрямо 2020 година), сливанията и поглъщанията — около 72 млрд., публичните предлагания — около 9,5 млрд.[2]
Регионално разпределение. САЩ лидираха с частни инвестиции от около 52,9 млрд. долара — повече от три пъти повече от Китай (17,2 млрд.). Великобритания зае третото място (4,65 млрд.), следвана от Израел (2,4 млрд.) и Германия (1,98 млрд.)[2].
| Държава | Частни инвестиции 2021 (млрд. USD) | Частни инвестиции 2013–2021 (млрд. USD) |
|---|---|---|
| САЩ | 52,9 | 149,0 |
| Китай | 17,2 | 61,9 |
| Великобритания | 4,65 | 10,8 |
| Израел | 2,4 | 6,1 |
| Германия | 1,98 | 3,9 |
| Индия | 1,87 | 10,8 |
Отраслов фокус. Най-голям обем частни инвестиции през 2021 година привлече областта „управление на данни, обработка и облак" — 2,6 пъти повече от 2020 година, следвани от „медицина и здравеопазване" (11,29 млрд.) и „финтех" (10,26 млрд.)[2].
Концентрация на капитал. Средният размер на сделката за частно инвестиране в ИИ през 2021 година нарасна с 81,1% в сравнение с 2020 година. При това броят на новофинансираните ИИ компании намаляваше трета поредна година (от върха от 2018 година)[2].
Корпоративно внедряване
Според данните на McKinsey, средното ниво на внедряване на ИИ от организациите през 2021 година е 56% (ръст от 6 п.п. спрямо 2020 година). Лидираше Индия (65%), следвана от развитите страни от Азиатско-тихоокеанския регион (64%), развиващите се пазари (57%) и Северна Америка (55%)[15].
Управление на рисковете. Усилията за решаване на етичните проблеми на ИИ в индустрията оставаха ограничени: въпреки че 29% от респондентите на McKinsey признаваха „справедливостта и равенството" за рискове при внедряването на ИИ, само 19% предприемаха стъпки за тяхното намаляване. Аналогично, 41% признаваха „обяснимостта" за риск, но само 27% работеха за нейното осигуряване[15].
Образование
Бакалавърска степен. Броят на завършилите бакалавърска степен по информатика в Северна Америка (в университети, присъждащи докторски степени) нарасна 3,5 пъти от 2010 до 2020 година, достигайки над 31 000 души — ръст от 11,6% в сравнение с 2019 година[16].
Докторантура. През 2020 година всеки пети завършил PhD по информатика се е специализирал в ИИ/Machine Learning — най-популярната специализация за последното десетилетие. Броят на PhD с тази специализация нарасна с 72,05% от 2010 до 2020 година[16].
Глава 5. Политика и управление на ИИ
Главата анализира законодателната и регулаторната активност в сферата на ИИ на глобално ниво и в разрез на отделни държави[1].
Глобално законодателство
Анализът на AI Index обхвана законодателни инициативи в 25 държави. За периода 2016–2021 година бяха приети 55 закона, съдържащи споменаване на „изкуствен интелект". Растежът беше рязък: от 1 закон през 2016 година до 18 през 2021 година[1].
Лидери по брой приети закони (2016–2021):
| Държава | Закони (2016–2021) | Закони (2021) |
|---|---|---|
| САЩ | 13 | 3 |
| Русия | 6 | 2 |
| Белгия | 5 | 2 |
| Испания | 5 | 3 |
| Великобритания | 5 | 3 |
| Франция | 4 | 1 |
| Италия | 3 | 1 |
Сред приетите закони: канадският Budget Implementation Act (2017) с отпускане на 125 млн. долара за стратегия за ИИ; руският Федерален закон от 24.04.2020 г. № 123-ФЗ за експериментален правен режим за ИИ в Москва; американският IOGAN Act (2020) за финансиране на изследвания на deepfake; белгийският декрет за създаване на етичен комитет за ИИ инструменти (2021)[1].
Законодателство в САЩ
На федерално ниво броят на предложените ИИ законопроекти нарасна от 1 през 2015 година до 130 през 2021 година, но само 2% от тях бяха приети. На ниво щати броят на предложените законопроекти нарасна от 2 през 2012 година до 131 през 2021 година, като делът на приетите е 20% (26 от 131)[17].
Масачузетс предложи най-голям брой ИИ законопроекти на ниво щати (40 от 2012 година), следван от Хавай (35) и Ню Джърси (32)[17].
Споменавания на ИИ в парламентарни документи
Споменаванията на ИИ в правителствените протоколи на 25 държави нараснаха 7,7 пъти за шест години (2016–2021), достигайки 1 323 през 2021 година. Великобритания доминираше с 939 споменавания за целия период, следвана от Испания, Япония, САЩ и Австралия[1].
В Конгреса на САЩ 117-ата сесия (започнала през 2021 година) до края на първата година вече е регистрирала 295 споменавания на ИИ — по пътя към надвишаване на рекорда на 116-ата сесия (506 споменавания за 2019–2020 г.)[17].
Методология
Докладът използва данни от множество източници[1]:
- Публикации и патенти: Center for Security and Emerging Technology (CSET), Джорджтаунски университет.
- Benchmark-ове: Papers With Code, класации на SuperGLUE, SQuAD, VCR, MLPerf и др.
- Инвестиции и стартъпи: NetBase Quid.
- Пазар на труда: Emsi Burning Glass, LinkedIn.
- Корпоративна активност: McKinsey & Company.
- Роботика: оригинално проучване на AI Index (509 професори, 67 университета).
- Законодателство: AI Index (глобален анализ на 25 държави), Bloomberg Government (САЩ).
- Образование: CRA Taulbee Survey.
- Етика: RealToxicityPrompts, Perspective API, StereoSet, CrowS-Pairs, Winogender, WinoBias, WinoMT, TruthfulQA, FEVER, FAccT, NeurIPS.
Авторски колектив
Докладът е изготвен под ръководството на съдиректорите Джак Кларк (Jack Clark, Anthropic / OECD) и Рей Перо (Raymond Perrault, SRI International) с участието на широк кръг изследователи и организации-партньори. В управителния комитет влизаха Ерик Бриньолфсон (Erik Brynjolfsson, Stanford), Джон Ечеменди (John Etchemendy, Stanford), Тера Лайонс (Terah Lyons), Джеймс Маньика (James Manyika, Google / University of Oxford), Хуан Карлос Ниеблес (Juan Carlos Niebles, Stanford / Salesforce), Майкъл Селито (Michael Sellitto, Stanford), Йоав Шохам (Yoav Shoham, Stanford / AI21 Labs — основател-директор). Мениджър на изследванията и главен редактор — Нестор Маслей (Nestor Maslej, Stanford). AI Index е проект на Станфордския институт HAI (Human-Centered Artificial Intelligence)[1].
Препратки
- Stanford HAI — AI Index Report 2022 (пълен текст): https://aiindex.stanford.edu/report/
- Center for Security and Emerging Technology (CSET) — данни за публикации и патенти: https://cset.georgetown.edu/
- Papers With Code — benchmark-ове и класации: https://paperswithcode.com/
- SuperGLUE Benchmark: https://super.gluebenchmark.com/
- MLPerf (MLCommons) — benchmark-ове за обучение: https://mlcommons.org/en/
- NetBase Quid — инвестиционни данни: https://quid.com/
- McKinsey Global Survey on AI: https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
- CRA Taulbee Survey: https://cra.org/resources/taulbee-survey/
- Bloomberg Government — данни за законодателство: https://about.bgov.com/
- RealToxicityPrompts: https://arxiv.org/abs/2009.11462
- TruthfulQA: https://arxiv.org/abs/2109.07958
- Global AI Vibrancy Tool: https://aiindex.stanford.edu/vibrancy/
Литература
- Zhang, D., Maslej, N., Brynjolfsson, E., Etchemendy, J., Lyons, T., Manyika, J., Ngo, H., Niebles, J.C., Sellitto, M., Sakhaee, E., Shoham, Y., Clark, J., Perrault, R. (2022). The AI Index 2022 Annual Report. AI Index Steering Committee, Stanford Institute for Human-Centered AI, Stanford University. https://aiindex.stanford.edu/report/
- Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. https://arxiv.org/abs/2112.11446
- Gehman, S. et al. (2020). RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models. https://arxiv.org/abs/2009.11462
- Xu, A. et al. (2021). Detoxifying Language Models Risks Marginalizing Minority Voices. https://arxiv.org/abs/2104.06390
- Lin, S., Hilton, J., Evans, O. (2021). TruthfulQA: Measuring How Models Mimic Human Falsehoods. https://arxiv.org/abs/2109.07958
- Weidinger, L. et al. (2021). Ethical and social risks of harm from Language Models. https://arxiv.org/abs/2112.04359
- Welbl, J. et al. (2021). Challenges in Detoxifying Language Models. https://arxiv.org/abs/2109.07445
- Birhane, A. et al. (2021). Multimodal datasets: misogyny, pornography, and malignant stereotypes. https://arxiv.org/abs/2110.01963
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. https://arxiv.org/abs/2203.02155
- Wang, A. et al. (2019). SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems. https://arxiv.org/abs/1905.00537
- McKinsey & Company (2021). The State of AI in 2021. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
Бележки
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 Zhang, D., Maslej, N., Brynjolfsson, E., Etchemendy, J., Lyons, T., Manyika, J., Ngo, H., Niebles, J.C., Sellitto, M., Sakhaee, E., Shoham, Y., Clark, J., Perrault, R. (2022). The AI Index 2022 Annual Report. AI Index Steering Committee, Stanford Institute for Human-Centered AI, Stanford University. https://aiindex.stanford.edu/report/
- ↑ 2.0 2.1 2.2 2.3 2.4 NetBase Quid (2021). AI Investment and Startup Activity Data. https://quid.com/
- ↑ 3.0 3.1 3.2 3.3 Center for Security and Emerging Technology, Georgetown University (2021). AI Publications and Patents Data. https://cset.georgetown.edu/
- ↑ 4.0 4.1 Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. https://arxiv.org/abs/2112.11446
- ↑ 5.0 5.1 MLCommons (2021). MLPerf Training Benchmark Results. https://mlcommons.org/en/training-normal-11/
- ↑ Birhane, A. et al. (2021). Multimodal datasets: misogyny, pornography, and malignant stereotypes. https://arxiv.org/abs/2110.01963
- ↑ Wang, A. et al. (2019). SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems. https://arxiv.org/abs/1905.00537
- ↑ Intento (2021). The State of Machine Translation 2021. https://inten.to/
- ↑ Swedish Chess Computer Association (2021). Chess Engine Rating List. https://www.ssca.se/
- ↑ Gehman, S. et al. (2020). RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models. https://arxiv.org/abs/2009.11462
- ↑ Xu, A. et al. (2021). Detoxifying Language Models Risks Marginalizing Minority Voices. https://arxiv.org/abs/2104.06390
- ↑ Lin, S., Hilton, J., Evans, O. (2021). TruthfulQA: Measuring How Models Mimic Human Falsehoods. https://arxiv.org/abs/2109.07958
- ↑ LinkedIn (2021). AI Hiring Index Data. https://www.linkedin.com/
- ↑ Emsi Burning Glass (2021). AI Job Postings Data. https://www.economicmodeling.com/
- ↑ 15.0 15.1 McKinsey & Company (2021). The State of AI in 2021. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
- ↑ 16.0 16.1 Computing Research Association (2021). CRA Taulbee Survey 2020–2021. https://cra.org/resources/taulbee-survey/
- ↑ 17.0 17.1 17.2 Bloomberg Government (2021). U.S. AI Legislative Records. https://about.bgov.com/