The 2024 AI Index Report (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

AI Index Report 2024 — המהדורה השנתית השביעית של דוח AI Index, שהוכן על ידי מכון סטנפורד לבינה מלאכותית ממוקדת-אדם (Stanford HAI)[1]. דוח 2024 הוא הנרחב ביותר בכל תולדות הפרסום, ויוצא לאור בעת שהשפעת ה-AI על החברה הופכת לבולטת באופן חסר תקדים. המהדורה כוללת הערכות חדשות של עלויות אימון מודלים, ניתוח מעמיק של AI אחראי, ולראשונה מכילה פרק נפרד המוקדש להשפעת ה-AI על המדע והרפואה. הדוח עוקב אחר נתונים הקשורים לבינה מלאכותית, מסדר ומדמה אותם בצורה ויזואלית, ומספק מידע אובייקטיבי ומאומת היטב עבור קובעי מדיניות, חוקרים, מנהלים, עיתונאים והציבור הרחב.

מבנה הדוח

דוח 2024 מורכב מתשעה פרקים נושאיים[1]:

  1. מחקר ופיתוח (Research and Development) — מגמות בפרסומים, פטנטים, מודלי בסיס ופרויקטים פתוחים.
  2. ביצועים טכניים (Technical Performance) — benchmark-ים, השוואה לרמה אנושית, מולטי-מודליות.
  3. AI אחראי (Responsible AI) — אירועים, בטיחות, הטיה, פרטיות.
  4. כלכלה (Economy) — השקעות, שוק העבודה, אימוץ ארגוני, רובוטיזציה.
  5. מדע ורפואה (Science and Medicine) — פרק חדש: פריצות דרך במדע וביישומים רפואיים של AI.
  6. חינוך (Education) — הכשרת כוח אדם, תוכניות לימודים, ChatGPT בהוראה.
  7. מדיניות וממשל (Policy and Governance) — חקיקה, רגולציה, אסטרטגיות לאומיות.
  8. גיוון (Diversity) — גיוון מגדרי ואתני בתחום ה-AI.
  9. דעת קהל (Public Opinion) — יחס הציבור ל-AI על פי נתוני סקרים בינלאומיים.

מסקנות מרכזיות של הדוח (Top 10)

מחברי הדוח הצביעו על עשרה טיעונים מרכזיים לשנת 2024[1]:

1. AI עולה על בני אדם במספר משימות, אך לא בכולן

מערכות בינה מלאכותית עלו על הרמה האנושית במספר benchmark-ים, כולל סיווג תמונות (ImageNet), הסקה חזותית (VQA) והבנת שפה אנגלית (SuperGLUE). יחד עם זאת, AI עדיין נופל מבני אדם במשימות מורכבות יותר: מתמטיקה ברמת אולימפיאדה (MATH), הסקה חזותית יומיומית ותכנון[1].

2. התעשייה שולטת במחקר AI מתקדם

בשנת 2023 התעשייה יצרה 51 מודלי Machine Learning משמעותיים, בעוד האקדמיה — רק 15. כמו כן, 21 מודלים נוצרו כתוצאה משיתוף פעולה בין התעשייה לאקדמיה — שיא חדש[1].

3. עלות אימון מודלים מתקדמים עולה בחדות

לפי הערכות AI Index ו-Epoch AI, עלויות אימון GPT-4 עמדו על כ-78 מיליון דולר, ואלה של Gemini Ultra מבית Google — על כ-191 מיליון דולר[2]. לשם השוואה: אימון מודל ה-Transformer המקורי בשנת 2017 עלה כ-900 דולר, ו-RoBERTa Large בשנת 2019 — כ-160 אלף דולר[1].

4. ארה"ב מובילה כמקור המודלים המתקדמים של AI

בשנת 2023 נוצרו 61 מודלי AI משמעותיים בארגונים אמריקאיים, מה שמשאיר רחוק מאחור את האיחוד האירופי (21 מודלים) ואת סין (15 מודלים)[1].

5. הערכות אחריות סטנדרטיות עבור LLM נמצאות פיגור חמור

מחקר AI Index חשף מחסור משמעותי בסטנדרטיזציה של דיווח על AI אחראי. מפתחים מובילים — OpenAI, Google ו-Anthropic — בוחנים את מודליהם על benchmark-ים שונים של AI אחראי, מה שמקשה על השוואה שיטתית של סיכונים[1].

6. השקעות ב-Generative AI גדלות במהירות

למרות ירידה כוללת בהשקעות הפרטיות ב-AI, מימון ה-Generative AI גדל כמעט פי שמונה בהשוואה ל-2022, והגיע ל-25.2 מיליארד דולר. סבבי גיוס גדולים ביצעו OpenAI, Anthropic, Hugging Face ו-Inflection[3].

7. AI משפר את הפריון ואיכות העבודה

מחקרים רבים משנת 2023 הראו כי AI מסייע לעובדים לבצע משימות מהר יותר ובאיכות גבוהה יותר, וכן מצמצם את הפער בין בעלי מיומנויות נמוכות לגבוהות. יחד עם זאת, מספר עבודות מזהירות כי שימוש ב-AI ללא פיקוח מתאים עלול להוביל לירידה בפריון[1].

8. ההתקדמות המדעית מואצת בזכות AI

בשנת 2023 הוצגו יישומים מדעיים משמעותיים של AI: AlphaDev (האצת אלגוריתמי מיון), GNoME (גילוי חומרים חדשים), GraphCast (תחזית מזג אוויר) ואחרים[1].

9. מספר מסמכי הרגולציה על AI בארה"ב עלה בחדות

בשנת 2023 אושרו 25 מסמכי רגולציה הקשורים ל-AI — עלייה של 56.3% לעומת השנה הקודמת. לשם השוואה: בשנת 2016 אושר רק מסמך אחד כזה[1].

10. בני אדם מודעים יותר ויותר להשפעת ה-AI — וחרדים יותר ויותר

לפי נתוני Ipsos, שיעור המשיבים הסבורים כי AI ישפיע מהותית על חייהם בשלוש עד חמש השנים הקרובות עלה מ-60% ל-66%. כ-52% מביעים חרדה לגבי מוצרים ושירותי AI — עלייה של 13 נקודות אחוז מ-2022. בארה"ב, לפי נתוני Pew Research, 52% מהאמריקאים מדווחים על חשש רב יותר מאשר התרגשות בנוגע ל-AI (לעומת 37% בשנת 2022)[4][5].

פרק 1. מחקר ופיתוח

הפרק מנתח מגמות בפרסומים, פטנטים, מערכות AI מתקדמות, מודלי בסיס (foundation models), כנסים ופרויקטי תוכנה פתוחים[1].

פרסומים

המספר הכולל של פרסומים בתחום ה-AI ממשיך לגדול: מכ-88,000 בשנת 2010 ליותר מ-240,000 בשנת 2022 (גידול של כמעט פי שלושה). הגידול בשנה האחרונה עמד על 1.1%[1].

פטנטים

מספר הפטנטים שהוענקו בתחום ה-AI בעולם עלה בחדות: בין 2021 ל-2022 הגידול עמד על 62.7%, ומ-2010 — על יותר מפי 31. סין שולטת ברישום פטנטי AI: בשנת 2022 חלקה עמד על 61.1% מבקשות הפטנט, בעוד חלקה של ארה"ב עמד על 20.9% (ירידה מ-54.1% בשנת 2010)[1].

מודלים מתקדמים

בשנת 2023 המשיכה התעשייה לשלוט ביצירת מודלים מתקדמים. שוחררו 149 מודלי בסיס — פי שניים יותר מאשר בשנת 2022. מתוכם, 65.7% היו בקוד פתוח (לעומת 44.4% בשנת 2022 ו-33.3% בשנת 2021)[1].

עלות אימון. שיתוף הפעולה של AI Index עם Epoch AI אפשר קבלת הערכות מדויקות יותר של עלויות אימון מודלים. עליית ההוצאות ממוחשת בדינמיקה הבאה[2]:

מודל שנה הערכת עלות אימון (USD)
Transformer 2017 ~930
BERT-Large 2018 ~3,300
RoBERTa Large 2019 ~160,000
GPT-3 175B 2020 ~4.3 מיליון
PaLM 540B 2022 ~12.4 מיליון
Llama 2 70B 2023 ~3.9 מיליון
GPT-4 2023 ~78 מיליון
Gemini Ultra 2023 ~191 מיליון

שיוך לאומי. בשנת 2023 נוצרו 61 מודלים משמעותיים על ידי ארגונים אמריקאיים, 21 — על ידי האיחוד האירופי, 15 — על ידי סין. הדבר מאשר את תפקידה המוביל של ארה"ב בפיתוח מערכות AI מתקדמות[1].

תוכנה בקוד פתוח

מספר פרויקטי ה-AI ב-GitHub גדל בהתמדה: מ-845 בשנת 2011 לכ-1.8 מיליון בשנת 2023. בשנת 2023 נרשם גידול של 59.3%. המספר הכולל של הכוכבים לפרויקטי AI שולש: מ-4.0 מיליון בשנת 2022 ל-12.2 מיליון בשנת 2023[1].

כנסים

הנוכחות בכנסי AI מובילים (NeurIPS, ICML, ICLR ואחרים) המשיכה לגדול, ומשקפת את העניין הגובר בתחום[1].

פרק 2. ביצועים טכניים

הפרק מנתח את ההתקדמות של מערכות AI במשימות של עיבוד שפה, יצירת תמונות, הסקה, תכנות והתנהגות סוכנים[1].

מצב ביצועי ה-AI

נכון לשנת 2023, AI עולה על הרמה האנושית במספר קטגוריות משימות: סיווג תמונות (מ-2015), הבנת טקסט בסיסית (מ-2017), הסקה חזותית (מ-2020), הסקה לוגית בשפה טבעית (מ-2021). עם זאת, במשימות כגון מתמטיקה ברמת אולימפיאדה (MATH) ותכנון, AI עדיין נופל מבני אדם[1].

מודלי שפה

HELM. ה-benchmark של Holistic Evaluation of Language Models (HELM), שפותח בסטנפורד, מעריך LLM לפי עשרה תרחישים, כולל הבנת טקסט, מתמטיקה והסקה משפטית. נכון לינואר 2024, GPT-4 מוביל עם ציון mean win rate של 0.96[6].

MMLU. ה-benchmark של Massive Multitask Language Understanding (MMLU) מעריך מודלים על פני 57 תחומי ידע. Gemini Ultra מבית Google היה הראשון שחצה את הרמה הבסיסית האנושית (89.8%), עם ציון של 90.0% — שיפור של 14.8 נקודות אחוז לעומת 2022 ו-57.6 נקודות אחוז מאז יצירת ה-benchmark בשנת 2019[7].

Chatbot Arena. הפלטפורמה שהושקה בשנת 2023 מאפשרת למשתמשים להשוות את הפלטים של מודלים אנונימיים. נכון לתחילת 2024, GPT-4 Turbo הוכר כמודל המועדף ביותר על סמך יותר מ-200,000 הצבעות[1].

מולטי-מודליות

באופן מסורתי, מערכות AI היו מוגבלות למודליות אחת. אולם בשנת 2023 הופיעו מודלים מולטי-מודליים רבי עוצמה — Google Gemini ו-OpenAI GPT-4, המסוגלים לעבד טקסט, תמונות, ובמקרים מסוימים גם אודיו. ה-benchmark של MMMU (Massive Multi-discipline Multimodal Understanding) הראה כי Gemini Ultra מוביל עם 59.4%, אך זה נמוך משמעותית מרמת מומחה אנושי (82.6%)[8].

הסקה

GPQA. ה-benchmark של Graduate-Level Google-Proof Q&A כולל 448 שאלות מורכבות בביולוגיה, פיזיקה וכימיה, שאי אפשר לענות עליהן בחיפוש פשוט ב-Google. GPT-4 עם חיפוש קיבל ציון של 41.0%, נמוך מרמת מומחים (72.5%), אך גבוה מרמת לא-מומחים (30.5%)[9].

תיאוריית התודעה (BigToM). בדיקת יכולתם של LLM לדמות אמונות של בני אדם אחרים הראתה כי GPT-4 מתקרב לרמה האנושית במשימות של הסקה ישירה של אמונות ופעולות, אם כי עדיין נופל במשימות של הסקה הפוכה של אמונות[10].

תכנות

ה-benchmark של HumanEval מעריך יצירת קוד. בשנת 2023 המודלים המשיכו לשפר את ציוניהם, ו-SWE-bench — benchmark חדש להערכת פתרון משימות אמיתיות של הנדסת תוכנה — הראה כי אפילו המודלים הטובים ביותר פותרים רק חלק קטן מהמשימות, מה שמעיד על פוטנציאל משמעותי להתקדמות נוספת[1].

התנהגות סוכנים

מערכות AI נבדקות יותר ויותר בתרחישי סוכנים. Voyager (Microsoft) הדגים יכולת ללמידה אוטונומית בסביבה הדינמית של Minecraft, עם איסוף פי 3.3 פריטים ייחודיים, נסיעה פי 2.3 רחוק יותר והגעה לאבני דרך מפתח פי 15.3 מהר יותר בהשוואה למודלים קודמים[11]. MLAgentBench הראה כי סוכני AI למחקר מדעי מבטיחים פוטנציאל, אך התוצאות משתנות משמעותית בין משימות[1].

תכונות LLM

התנהגות אמרגנטית. מחקר משנת 2023 העלה ספקות לגבי הדעה שיכולות "אמרגנטיות" בלתי צפויות מופיעות בהכרח עם הגדלת המודלים. בשימוש במדדים לינאריים ורציפים, יכולות כאלה נעלמות במידה רבה[12].

ירידה בביצועים. מחקר של סטנפורד וברקלי הראה כי ביצועי GPT-4 עשויים להשתנות מהותית בין עדכונים: גרסת יוני 2023 הייתה נחותה ב-42 נקודות אחוז מגרסת מרץ ביצירת קוד, וב-33 נקודות אחוז במשימות מתמטיות[13].

תיקון עצמי. חוקרים מ-DeepMind ומאוניברסיטת אילינוי הראו כי LLM מתקשים לתקן את הסקותיהם באופן עצמאי ללא הנחיה חיצונית: ביצועי GPT-4 ירדו בכל ה-benchmark-ים שנבדקו בעת ניסיון תיקון עצמי[1].

פרק 3. AI אחראי

הפרק מוקדש לממדים המרכזיים של AI אחראי: פרטיות, שקיפות, בטיחות והוגנות[1].

אירועים בתחום ה-AI

מסד הנתונים AI Incident Database תיעד 123 אירועים בשנת 2023 — עלייה של 32.3% לעומת 2022. מאז 2013 מספר האירועים גדל ביותר מפי עשרים. הגידול נובע הן מהרחבת השימוש ב-AI והן מגברת המודעות לסיכוניו האתיים[14].

סטנדרטיזציה של benchmark-ים של AI אחראי

ניתוח של חמישה מפתחים מובילים (OpenAI, Meta, Anthropic, Google, Mistral AI) חשף היעדר סט benchmark אחיד להערכת AI אחראי. אמנם benchmark-ים כלליים של יכולות (MMLU, HellaSwag, ARC Challenge, HumanEval, GSM8K) נמצאים בשימוש נרחב, אך benchmark-ים של AI אחראי (TruthfulQA, RealToxicityPrompts, ToxiGen, BOLD, BBQ) מיושמים באופן מפוזר: TruthfulQA משתמשים בו לכל היותר שלושה מחמישה מפתחים, ומפתח אחד כלל אינו מדווח על בדיקות לפי benchmark-ים של AI אחראי[1].

AI ובחירות

מחקרים משנת 2023 הראו כי בני אדם מזהים נכון deepfake-ים קוליים רק ב-73% מהמקרים. צפוי כי עם התפתחות טכנולוגיות יצירת הקול, דיוק הזיהוי ירד. הדבר יוצר סיכונים של מניפולציה בקמפיינים פוליטיים ומאפשר לפוליטיקאים לדחות הקלטות מסכימות כמזויפות (מה שנקרא "דיבידנד השקרן")[15].

מחקרים על LLM לגבי הטיה פוליטית גילו מתאם בין תשובות ChatGPT כברירת מחדל לעמדות המפלגה הדמוקרטית, ומתאם שלילי עם עמדות המפלגה הרפובליקנית[16].

פרק 4. כלכלה

הפרק בוחן מגמות בהשקעות, תעסוקה, אימוץ ארגוני של AI ורובוטיזציה[1].

השקעות

מגמות כלליות. סך ההשקעות הארגוניות ב-AI ירד ל-189.2 מיליארד דולר בשנת 2023 (ירידה של כ-20% לעומת 2022). עם זאת, על פני עשור ההשקעות גדלו פי שלושה עשר. ההשקעות הפרטיות ירדו בשנה השנייה ברציפות, אם כי הירידה הייתה פחות חדה מאשר בין 2021 ל-2022[3].

Generative AI. השקעות ב-Generative AI עמדו על 25.2 מיליארד דולר — גידול של כמעט פי תשעה לעומת 2022 ופי שלושים לעומת 2019. Generative AI היווה יותר מרבע מכלל ההשקעות הפרטיות ב-AI[3].

התפלגות אזורית. ארה"ב עם השקעות של 67.2 מיליארד דולר הקדימה את סין (7.8 מיליארד) פי 8.7 ואת בריטניה (3.8 מיליארד) פי 17.8. ההשקעות הפרטיות בסין ירדו ב-44.2%, באיחוד האירופי ובבריטניה — ב-14.1%, בעוד בארה"ב עלו ב-22.1%[3].

סטארטאפים. מספר חברות ה-AI החדשות שקיבלו מימון עלה ל-1,812 (גידול של 40.6%). בתחום ה-Generative AI קיבלו מימון 99 סטארטאפים חדשים (לעומת 56 בשנת 2022)[3].

שוק העבודה

שיעור המשרות הקשורות ל-AI בארה"ב ירד מ-2.0% בשנת 2022 ל-1.6% בשנת 2023. מגמה דומה נצפית ברמה הגלובלית. הירידה מוסברת בצמצום הגיוס מצד חברות AI גדולות וירידה בשיעור המשרות הטכניות[1].

נדידת מומחי AI מהאקדמיה לתעשייה ממשיכה להתאיץ: בשנת 2022, 70.7% מבעלי התארים הדוקטורטיים החדשים ב-AI עברו לעבוד בתעשייה (לעומת 40.9% בשנת 2011), ורק 20.0% — לאקדמיה (לעומת 41.6%)[1].

אימוץ ארגוני

לפי McKinsey, 55% מהארגונים משתמשים ב-AI (כולל Generative AI) לפחות ביחידה עסקית אחת — גידול מ-50% בשנת 2022 ו-20% בשנת 2017. כ-42% מהארגונים מדווחים על הפחתת עלויות, ו-59% — על גידול בהכנסות בזכות AI[17].

אזכורי AI בדוחות הרווח של חברות Fortune 500 הגיעו ל-394 (כמעט 80% מכלל החברות) — עלייה ניכרת מ-266 בשנת 2022. הנושא שאוזכר לרוב (19.7% מכלל השיחות) היה Generative AI[1].

רובוטיקה

בשנת 2022 הותקנו 553,000 רובוטים תעשייתיים — גידול של 5.1% לעומת 2021 ויותר מפי שלושה מאז 2012. סין שולטת: מאז 2013, שאז עקפה את יפן, חלקה של סין גדל מ-20.8% ל-52.4% מסך ההתקנות העולמיות בשנת 2022. חלק הרובוטים השיתופיים עלה מ-2.8% בשנת 2017 ל-9.9% בשנת 2022[18].

פרק 5. מדע ורפואה

הפרק הנכלל לראשונה בדוח סוקר את תפקיד ה-AI בגילויים מדעיים ובחדשנות רפואית[1].

הישגים מדעיים משנת 2023

AlphaDev (DeepMind) — מערכת Reinforcement Learning שגילתה אלגוריתמי מיון עם מספר קטן יותר של הוראות מאשר הדגמי האנושיים הקיימים. חלק מהאלגוריתמים שנמצאו שולבו בספריית המיון הסטנדרטית של C++ (LLVM) — העדכון הראשון של חלק זה בספרייה במשך יותר מעשר שנים[19].

GraphCast (DeepMind) — מערכת לתחזית מזג אוויר המבוססת על רשתות נוירונים גרפיות, המספקת תחזית ל-10 ימים תוך פחות מדקה עם דיוק העולה על מערכת המידול המובילה HRES (המרכז האירופי לתחזיות מזג אוויר לטווח בינוני)[20].

GNoME (Google DeepMind) — מודל המשתמש ברשתות גרפיות לאיתור מואץ של חומרים פונקציונליים חדשים, דבר הקריטי להתקדמות ברובוטיקה ובתעשיית המוליכים למחצה[21].

Synbot — רובוט-כימאי מונחה AI לסינתזה אוטונומית של מולקולות אורגניות, שהשיג תפוקת תגובה הדומה לערכי הייחוס או עולה עליהם[22].

FlexiCubes (NVIDIA) — שיטה לאופטימיזציה של רשתות 3D תוך שימוש ב-AI לשיפור איכות יצירת אובייקטים תלת-ממדיים בגרפיקה ממוחשבת[23].

AI ברפואה

ידע קליני. ב-benchmark של MedQA (הערכת ידע קליני של AI) השיג המודל GPT-4 Medprompt דיוק של 90.2% — שיפור של 22.6 נקודות אחוז לעומת התוצאה הטובה ביותר של 2022. מאז יצירת ה-benchmark בשנת 2019, ביצועי ה-AI ב-MedQA כמעט שולשו. ראוי לציין כי GPT-4 Medprompt השתמש ב-prompt engineering במקום fine-tuning, ועלה על מודלים רפואיים מתמחים[24].

MediTron-70B — LLM רפואי פתוח שהשיג 70.2% ב-MedQA — התוצאה הטובה ביותר בקרב מודלים בקוד פתוח, אם כי נמוכה מביצועי המודלים הסגורים GPT-4 Medprompt ו-Med-PaLM 2[25].

חדשנות רפואית. בין המערכות המשמעותיות של 2023: SynthSR (שיפור הדמיית מבני מוח מסריקות MRI באיכות נמוכה), ImmunoSEIRA (חיישני אינפרא-אדום מבוססי AI לאבחון מחלות ניווניות), EVEscape (חיזוי אבולוציית וירוסים למניעת מגפות), AlphaMissense (סיווג מוטציות missense)[1].

אישורי FDA. בשנת 2022 אישרה ה-FDA 139 מכשירים רפואיים מבוססי AI — גידול של 12.1% לעומת 2021. מאז 2012 מספר האישורים כאלה גדל ביותר מפי 45[26].

פרק 6. חינוך

הפרק בוחן מגמות בחינוך בתחום מדעי המחשב וה-AI[1].

השכלה גבוהה

מספר בוגרי התואר הראשון במדעי המחשב בארה"ב ובקנדה ממשיך לגדול. מספר בעלי תואר שני נשאר יחסית יציב, ומספר בעלי הדוקטורט גדל בצנועות. מאז 2018 מספר בעלי תואר שני ודוקטורט במדעי המחשב ירד מעט[1].

שיעור הסטודנטים הבינלאומיים ירד בכל רמות הלימוד, באופן בולט במיוחד בתואר שני. בקנה מידה עולמי, מספר התוכניות האקדמיות דוברות האנגלית הקשורות ל-AI שולש מ-2017[1].

ChatGPT בחינוך

לפי נתוני סקר Walton Foundation, 88% מהמורים ו-79% מהסטודנטים סבורים כי ChatGPT משפיע לטובה על התהליך החינוכי. 76% מהמורים ו-65% מהסטודנטים סבורים כי חשוב לשלב ChatGPT בהוראה[27].

פרק 7. מדיניות וממשל

הפרק מנתח את הפעילות החקיקתית והרגולטורית בתחום ה-AI ברמה הגלובלית, האמריקאית והאירופית[1].

מגמות גלובליות

אזכורי AI בהליכים חקיקתיים ברחבי העולם הגיעו לשיא חדש. ניתן לראות מעבר ממדיניות מעודדת גרידא לחקיקה מגבילה, המעידה על תשומת לב גוברת של רגולטורים לסיכונים הפוטנציאליים של AI[1].

נושאי החוקים שהתקבלו בשנת 2023 הורחבו משמעותית, וכללו כוחות מזוינים וביטחון לאומי, זכויות אזרח, מסחר, חינוך, יחסי עבודה, מדע וטכנולוגיה[1].

רגולציה בארה"ב

מספר מסמכי הרגולציה הקשורים ל-AI הגיע ל-25 בשנת 2023 (גידול של 56.3% לעומת 2022). הנושא הנפוץ ביותר היה סחר חוץ ופיננסים בינלאומיים. שיעור מסמכי הרגולציה עם רלוונטיות גבוהה ובינונית ל-AI עלה לעומת שנים קודמות[1].

אירוע בולט בשנת 2023 היה צו הנשיא ביידן בנושא AI (Executive Order on AI), שנועד, בין היתר, להקים את המשאב הלאומי למחקר AI (National AI Research Resource) כדי להבטיח שוויון הזדמנויות בין התעשייה לאקדמיה[28].

רגולציה באיחוד האירופי

באיחוד האירופי נצפית מגמה דומה של גידול במספר מסמכי הרגולציה הקשורים ל-AI. הישג משמעותי בשנת 2023 היה קידום AI Act — החוק המקיף הראשון בעולם בנושא AI[1].

פרק 8. גיוון

הפרק בוחן את הגיוון המגדרי והאתני בקרב מומחי AI. למרות מעט התקדמות, נשים ובני מיעוטים עדיין מיוצגים בחסר בתחום ה-AI, הן בתעשייה והן באקדמיה[1].

פרק 9. דעת קהל

הפרק מנתח את תפיסת הציבור את ה-AI על בסיס סקרים בינלאומיים ונתוני רשתות חברתיות[1].

סקרים בינלאומיים

מודעות וחרדה. לפי נתוני Ipsos, 66% מהמשיבים (גידול מ-60%) סבורים כי AI ישפיע מהותית על חייהם בשלוש עד חמש השנים הקרובות. כ-52% מביעים חרדה כלפי מוצרי AI (עלייה של 13 נקודות אחוז מ-2022)[4].

ציפיות כלכליות. רק 37% מהמשיבים סבורים כי AI ישפר את עבודתם, 34% — כי הוא ישפר את הכלכלה, ו-32% — כי ישפיע לטובה על שוק העבודה[4].

הבדלים דמוגרפיים. הדורות הצעירים אופטימיסטיים בהרבה: 59% מבני דור Z סבורים כי AI ישפר את הבידור, לעומת 40% מבייבי-בומרים. בעלי הכנסה והשכלה גבוהות יותר הם גם אופטימיסטיים יותר[1].

מוכרות ChatGPT. לפי סקר בינלאומי של אוניברסיטת טורונטו, 63% מהמשיבים מכירים את ChatGPT, ומתוכם כמחצית משתמשים בו לפחות פעם בשבוע[29].

נתוני רשתות חברתיות

ניתוח של Quid על יותר מ-7 מיליון פוסטים ברשתות החברתיות בשנת 2023 גילה כי המודלים GraphCast ו-Claude 2.1 קיבלו את ציון הסנטימנט החיובי הגבוה ביותר (net sentiment score). GPT-4 משך את חלק תשומת הלב הגדול ביותר ברבעון הראשון, בעוד שלקראת סוף השנה הפוקוס עבר ל-Gemini ו-Grok[1].

מודלי AI משמעותיים של 2023

הדוח מתעד את הופעתם של מספר מודלים מרכזיים[1]:

מודל מפתח סוג תאריך משמעות
GPT-4 OpenAI LLM, מולטי-מודלי מרץ 2023 אחד מה-LLM החזקים ביותר; מוביל HELM
PaLM 2 Google LLM מאי 2023 יכולות רב-לשוניות מורחבות
Llama 2 Meta LLM (פתוח) יולי 2023 המודל הפתוח המוביל; גרסאות 7B/13B/70B
Claude 2 / 2.1 Anthropic LLM יולי / נובמבר 2023 חלון הקשר של עד 200K token-ים
Mistral 7B Mistral AI LLM (פתוח) ספטמבר 2023 מודל קומפקטי בעל ביצועים גבוהים
DALL-E 3 OpenAI יצירת תמונות אוקטובר 2023 שיפור איכות ועמידה ב-prompt-ים
Gemini / Gemini Ultra Google LLM, מולטי-מודלי דצמבר 2023 ה-LLM הראשון שעלה על בני אדם ב-MMLU
Mixtral 8×7B Mistral AI LLM (MoE, פתוח) דצמבר 2023 ארכיטקטורת Mixture-of-Experts
Midjourney v6 Midjourney יצירת תמונות דצמבר 2023 שיפור איכות ו-prompt-ים אינטואיטיביים
Whisper v3 OpenAI זיהוי דיבור נובמבר 2023 דיוק משופר, תמיכה מורחבת בשפות

מתודולוגיה

הדוח משתמש בנתונים ממקורות רבים[1]:

  • פרסומים ופטנטים: OpenAlex, WIPO, USPTO, נתוני Epoch AI.
  • Benchmark-ים: Papers With Code, CRFM (HELM), לוחות מובילים מתמחים.
  • השקעות: Quid (Capital IQ, Crunchbase), נתונים על יותר מ-8 מיליון חברות.
  • שוק העבודה: Lightcast, LinkedIn, Stack Overflow.
  • פעילות ארגונית: McKinsey & Company, Seeking Alpha (שיחות רווחים).
  • רובוטיקה: International Federation of Robotics (IFR).
  • רגולציה: Federal Register (ארה"ב), EUR-Lex (האיחוד האירופי), Govini.
  • דעת קהל: Ipsos, Pew Research Center, University of Toronto (GPO-AI), Quid (מדיה חברתית).
  • חינוך: CRA Taulbee Survey, Informatics Europe, Studyportals, Code.org, Walton Foundation.
  • רפואה: FDA, Papers With Code (MedQA).

הערכות עלות אימון המודלים הוכנו בשיתוף עם Epoch AI על בסיס ניתוח סוג וכמות החומרה, משך האימון ומחירי השכרת ענן[2].

צוות המחברים

הדוח הוכן בהנהגת הדירקטורים המשותפים Ray Perrault ו-Jack Clark בהשתתפות מעגל רחב של חוקרים וארגונים שותפים. AI Index הוא פרויקט של מכון Stanford HAI (Human-Centered Artificial Intelligence)[1].

קישורים חיצוניים

ביבליוגרפיה

הערות

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/
  2. 2.0 2.1 2.2 Epoch AI (2023). AI Training Cost Estimates. https://epochai.org/
  3. 3.0 3.1 3.2 3.3 3.4 Quid (2023). AI Investment Data. https://quid.com/
  4. 4.0 4.1 4.2 Ipsos (2023). Global Perceptions of AI Survey. https://www.ipsos.com/
  5. Pew Research Center (2023). Public Views on AI. https://www.pewresearch.org/
  6. Liang, P. et al. (2022). Holistic Evaluation of Language Models. https://arxiv.org/abs/2211.09110
  7. Hendrycks, D. et al. (2021). Measuring Massive Multitask Language Understanding. https://arxiv.org/abs/2009.03300
  8. Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. https://arxiv.org/abs/2311.16502
  9. Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
  10. Gandhi, K. et al. (2023). Understanding Social Reasoning in Language Models with Language Models. https://arxiv.org/abs/2306.15448
  11. Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. https://arxiv.org/abs/2305.16291
  12. Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? https://arxiv.org/abs/2304.15004
  13. Chen, L. et al. (2023). How Is ChatGPT's Behavior Changing over Time? https://arxiv.org/abs/2307.09009
  14. AI Incident Database (2023). https://incidentdatabase.ai/
  15. Mai, K. T. et al. (2023). Warning: Humans Cannot Reliably Detect Speech Deepfakes. https://arxiv.org/abs/2301.07829
  16. Motoki, F. et al. (2023). More Human than Human: Measuring ChatGPT Political Bias. https://doi.org/10.1007/s11127-023-01097-2
  17. McKinsey & Company (2023). The State of AI in 2023: Generative AI's Breakout Year. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
  18. International Federation of Robotics (2023). World Robotics Report 2023. https://ifr.org/worldrobotics/
  19. Mankowitz, D. J. et al. (2023). Faster sorting algorithms discovered using deep reinforcement learning. Nature. https://doi.org/10.1038/s41586-023-06004-9
  20. Lam, R. et al. (2023). Learning skillful medium-range global weather forecasting. Science. https://doi.org/10.1126/science.adi2336
  21. Merchant, A. et al. (2023). Scaling deep learning for materials discovery. Nature. https://doi.org/10.1038/s41586-023-06735-9
  22. Ha, T. et al. (2023). AI-driven robotic chemist for autonomous synthesis of organic molecules. Science Advances. https://doi.org/10.1126/sciadv.adj0461
  23. Shen, T. et al. (2023). Flexible Isosurface Extraction for Gradient-Based Mesh Optimization. ACM Transactions on Graphics. https://doi.org/10.1145/3592430
  24. Nori, H. et al. (2023). Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine. https://arxiv.org/abs/2311.16452
  25. Chen, Z. et al. (2023). MEDITRON-70B: Scaling Medical Pretraining for Large Language Models. https://arxiv.org/abs/2311.16079
  26. U.S. Food and Drug Administration (2023). Artificial Intelligence and Machine Learning (AI/ML)-Enabled Medical Devices. https://www.fda.gov/medical-devices/software-medical-device-samd/artificial-intelligence-and-machine-learning-aiml-enabled-medical-devices
  27. Impact Research / Walton Family Foundation (2023). ChatGPT and Education Survey. https://www.waltonfamilyfoundation.org/
  28. The White House (2023). Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence. https://www.whitehouse.gov/briefing-room/presidential-actions/2023/10/30/executive-order-on-the-safe-secure-and-trustworthy-development-and-use-of-artificial-intelligence/
  29. Global Public Opinion on AI Survey, University of Toronto (2023). https://www.mediatechdemocracy.com/