The 2024 AI Index Report (FA)
AI Index Report 2024 — هفتمین نسخه سالانه گزارش AI Index، تهیهشده توسط مؤسسه هوش مصنوعی انسانمحور دانشگاه استنفورد (Stanford HAI)[1]. گزارش سال ۲۰۲۴ جامعترین نسخه در تمام تاریخ انتشار این مجموعه است و در زمانی منتشر میشود که تأثیر هوش مصنوعی بر جامعه به شکل بیسابقهای آشکار گردیده است. این نشریه شامل برآوردهای جدید هزینه آموزش مدلها، تحلیل دقیق هوش مصنوعی مسئول، و برای نخستین بار فصلی مجزا درباره تأثیر هوش مصنوعی بر علم و پزشکی است. این گزارش دادههای مرتبط با هوش مصنوعی را ردیابی، دستهبندی و بصریسازی میکند و اطلاعاتی عینی و دقیقاً تأییدشده برای سیاستگذاران، پژوهشگران، مدیران، روزنامهنگاران و عموم مردم فراهم میآورد.
ساختار گزارش
گزارش سال ۲۰۲۴ از نه فصل موضوعی تشکیل شده است[1]:
- تحقیق و توسعه (Research and Development) — روندها در انتشارات، ثبت اختراعات، مدلهای پایه و پروژههای متنباز.
- عملکرد فنی (Technical Performance) — benchmarkها، مقایسه با سطح انسانی، چندوجهیبودن.
- هوش مصنوعی مسئول (Responsible AI) — حوادث، ایمنی، تعصب، حریم خصوصی.
- اقتصاد (Economy) — سرمایهگذاری، بازار کار، پذیرش سازمانی، رباتیک.
- علم و پزشکی (Science and Medicine) — فصل جدید: پیشرفتهای علمی و کاربردهای پزشکی هوش مصنوعی.
- آموزش (Education) — آمادهسازی نیروی انسانی، برنامههای آموزشی، ChatGPT در یادگیری.
- سیاست و حکمرانی (Policy and Governance) — قانونگذاری، مقررات، استراتژیهای ملی.
- تنوع (Diversity) — تنوع جنسیتی و قومی در حوزه هوش مصنوعی.
- افکار عمومی (Public Opinion) — نگرش مردم به هوش مصنوعی بر اساس نظرسنجیهای بینالمللی.
نتایج کلیدی گزارش (۱۰ مورد برتر)
نویسندگان گزارش ده تز اصلی سال ۲۰۲۴ را برجسته کردهاند[1]:
۱. هوش مصنوعی در برخی وظایف از انسان پیشی میگیرد، اما نه در همه
سیستمهای هوش مصنوعی در چندین benchmark از سطح انسانی فراتر رفتهاند، از جمله در طبقهبندی تصویر (ImageNet)، استدلال بصری (VQA) و درک زبان انگلیسی (SuperGLUE). در عین حال، هوش مصنوعی هنوز در وظایف پیچیدهتر مانند ریاضیات المپیادی (MATH)، استدلال بصری روزمره و برنامهریزی از انسان عقب است[1].
۲. صنعت بر تحقیقات پیشرفته هوش مصنوعی تسلط دارد
در سال ۲۰۲۳، صنعت ۵۱ مدل Machine Learning معنادار تولید کرد، در حالی که دانشگاه تنها ۱۵ مدل ارائه داد. همچنین ۲۱ مدل حاصل همکاری صنعت و دانشگاه بود که رکوردی بیسابقه به شمار میرود[1].
۳. هزینه آموزش مدلهای پیشرفته به شدت افزایش یافته است
بر اساس برآوردهای AI Index و Epoch AI، هزینه آموزش GPT-4 حدود ۷۸ میلیون دلار و Gemini Ultra گوگل حدود ۱۹۱ میلیون دلار بوده است[2]. برای مقایسه: آموزش مدل اصلی Transformer در سال ۲۰۱۷ حدود ۹۰۰ دلار و RoBERTa Large در سال ۲۰۱۹ حدود ۱۶۰ هزار دلار هزینه داشت[1].
۴. ایالات متحده به عنوان منبع اصلی مدلهای برتر هوش مصنوعی پیشتاز است
در سال ۲۰۲۳، ۶۱ مدل معنادار هوش مصنوعی در سازمانهای آمریکایی ایجاد شد که به طور قابل توجهی از اتحادیه اروپا (۲۱ مدل) و چین (۱۵ مدل) پیشی گرفت[1].
۵. ارزیابیهای استانداردشده مسئولیت LLM به شدت عقب ماندهاند
تحقیق AI Index کمبود جدی استانداردسازی در گزارشدهی هوش مصنوعی مسئول را آشکار کرد. توسعهدهندگان پیشرو — OpenAI، Google و Anthropic — مدلهای خود را بر روی benchmarkهای مختلف هوش مصنوعی مسئول آزمایش میکنند که مقایسه سیستماتیک ریسکها را دشوار میسازد[1].
۶. سرمایهگذاری در هوش مصنوعی مولد به سرعت رشد میکند
علیرغم کاهش کلی سرمایهگذاری خصوصی در هوش مصنوعی، تأمین مالی هوش مصنوعی مولد تقریباً هشت برابر نسبت به سال ۲۰۲۲ افزایش یافت و به ۲۵.۲ میلیارد دلار رسید. OpenAI، Anthropic، Hugging Face و Inflection دورهای بزرگی از جذب سرمایه انجام دادند[3].
۷. هوش مصنوعی بهرهوری و کیفیت کار را بهبود میبخشد
مطالعات متعددی در سال ۲۰۲۳ نشان داد که هوش مصنوعی به کارمندان کمک میکند تا وظایف را سریعتر و با کیفیت بالاتری انجام دهند و شکاف بین متخصصان کممهارت و پرمهارت را کاهش میدهد. با این حال، برخی مطالعات هشدار میدهند که استفاده از هوش مصنوعی بدون نظارت مناسب میتواند به کاهش بهرهوری منجر شود[1].
۸. پیشرفت علمی با کمک هوش مصنوعی شتاب میگیرد
در سال ۲۰۲۳ کاربردهای علمی قابل توجهی از هوش مصنوعی معرفی شدند: AlphaDev (تسریع الگوریتمهای مرتبسازی)، GNoME (کشف مواد جدید)، GraphCast (پیشبینی آبوهوا) و موارد دیگر[1].
۹. تعداد مقررات هوش مصنوعی در ایالات متحده به شدت افزایش یافته است
در سال ۲۰۲۳، ۲۵ مقرره مرتبط با هوش مصنوعی تصویب شد که نسبت به سال قبل رشد ۵۶.۳ درصدی داشت. برای مقایسه: در سال ۲۰۱۶ تنها یک مقرره از این نوع تصویب شده بود[1].
۱۰. مردم بیش از پیش از تأثیر هوش مصنوعی آگاهاند — و بیش از پیش نگران
بر اساس دادههای Ipsos، سهم پاسخدهندگانی که معتقدند هوش مصنوعی طی ۳ تا ۵ سال آینده تأثیر قابل توجهی بر زندگیشان خواهد داشت، از ۶۰٪ به ۶۶٪ افزایش یافته است. همچنین ۵۲٪ نگرانی خود را نسبت به محصولات و خدمات هوش مصنوعی ابراز میکنند که نسبت به سال ۲۰۲۲ افزایش ۱۳ واحد درصدی داشته است. در ایالات متحده، بر اساس دادههای Pew Research، ۵۲٪ آمریکاییها از نگرانی بیشتر نسبت به هیجان در رابطه با هوش مصنوعی گزارش میدهند (در مقابل ۳۷٪ در سال ۲۰۲۲)[4][5].
فصل ۱. تحقیق و توسعه
این فصل روندهای انتشارات، ثبت اختراعات، سیستمهای پیشرفته هوش مصنوعی، مدلهای پایه (foundation models)، کنفرانسها و پروژههای نرمافزاری متنباز را تحلیل میکند[1].
انتشارات
تعداد کل انتشارات در حوزه هوش مصنوعی به رشد خود ادامه میدهد: از حدود ۸۸,۰۰۰ در سال ۲۰۱۰ به بیش از ۲۴۰,۰۰۰ در سال ۲۰۲۲ (رشد تقریباً سهبرابری). رشد در سال آخر ۱.۱٪ بود[1].
ثبت اختراعات
تعداد اختراعات اعطاشده در حوزه هوش مصنوعی در جهان به شدت افزایش یافته است: از ۲۰۲۱ تا ۲۰۲۲ رشد ۶۲.۷ درصدی داشت و از سال ۲۰۱۰ بیش از ۳۱ برابر شده است. چین در ثبت اختراعات هوش مصنوعی تسلط دارد: در سال ۲۰۲۲ سهم آن از درخواستهای ثبت اختراع ۶۱.۱٪ بود، در حالی که سهم ایالات متحده ۲۰.۹٪ بود (کاهش از ۵۴.۱٪ در سال ۲۰۱۰)[1].
مدلهای پیشرفته
در سال ۲۰۲۳، صنعت به تسلط خود در خلق مدلهای پیشرفته ادامه داد. ۱۴۹ مدل پایه منتشر شد — دو برابر بیشتر از سال ۲۰۲۲. از این میان، ۶۵.۷٪ دارای کد متنباز بودند (در مقایسه با ۴۴.۴٪ در سال ۲۰۲۲ و ۳۳.۳٪ در سال ۲۰۲۱)[1].
هزینه آموزش. همکاری AI Index با Epoch AI امکان دستیابی به برآوردهای دقیقتری از هزینه آموزش مدلها را فراهم کرد. رشد هزینهها را میتوان در پویایی زیر به وضوح مشاهده کرد[2]:
| مدل | سال | برآورد هزینه آموزش (USD) |
|---|---|---|
| Transformer | 2017 | ~930 |
| BERT-Large | 2018 | ~3 300 |
| RoBERTa Large | 2019 | ~160 000 |
| GPT-3 175B | 2020 | ~4.3 میلیون |
| PaLM 540B | 2022 | ~12.4 میلیون |
| Llama 2 70B | 2023 | ~3.9 میلیون |
| GPT-4 | 2023 | ~78 میلیون |
| Gemini Ultra | 2023 | ~191 میلیون |
وابستگی ملی. در سال ۲۰۲۳، ۶۱ مدل معنادار توسط سازمانهای آمریکایی، ۲۱ مدل توسط اتحادیه اروپا و ۱۵ مدل توسط چین ایجاد شد. این امر نقش پیشرو ایالات متحده در توسعه سیستمهای پیشرفته هوش مصنوعی را تأیید میکند[1].
نرمافزار متنباز
تعداد پروژههای هوش مصنوعی در GitHub به طور مستمر رشد میکند: از ۸۴۵ مورد در سال ۲۰۱۱ به حدود ۱.۸ میلیون در سال ۲۰۲۳. در سال ۲۰۲۳ رشد ۵۹.۳ درصدی ثبت شد. تعداد کل ستارههای پروژههای هوش مصنوعی سه برابر شد: از ۴.۰ میلیون در سال ۲۰۲۲ به ۱۲.۲ میلیون در سال ۲۰۲۳[1].
کنفرانسها
حضور در کنفرانسهای پیشرو هوش مصنوعی (NeurIPS، ICML، ICLR و غیره) به رشد خود ادامه داد که نشاندهنده علاقه فزاینده به این حوزه است[1].
فصل ۲. عملکرد فنی
این فصل پیشرفت سیستمهای هوش مصنوعی را در وظایف پردازش زبان، تولید تصویر، استدلال، برنامهنویسی و رفتار عاملی تحلیل میکند[1].
وضعیت عملکرد هوش مصنوعی
تا سال ۲۰۲۳، هوش مصنوعی در چندین دسته از وظایف از سطح انسانی فراتر رفته است: طبقهبندی تصویر (از سال ۲۰۱۵)، درک پایه متن (از سال ۲۰۱۷)، استدلال بصری (از سال ۲۰۲۰)، استنتاج منطقی به زبان طبیعی (از سال ۲۰۲۱). با این حال در وظایفی مانند ریاضیات المپیادی (MATH) و برنامهریزی، هوش مصنوعی هنوز از انسان عقب است[1].
مدلهای زبانی
HELM. بنچمارک Holistic Evaluation of Language Models (HELM)، توسعهیافته در استنفورد، LLMها را در ده سناریو از جمله درک متن، ریاضیات و استدلال حقوقی ارزیابی میکند. تا ژانویه ۲۰۲۴، GPT-4 با نرخ برد متوسط ۰.۹۶ در صدر قرار دارد[6].
MMLU. بنچمارک Massive Multitask Language Understanding (MMLU) مدلها را در ۵۷ حوزه موضوعی ارزیابی میکند. Gemini Ultra گوگل اولین مدلی بود که از سطح پایه انسانی (۸۹.۸٪) فراتر رفت و ۹۰.۰٪ کسب کرد — بهبودی ۱۴.۸ واحد درصدی نسبت به سال ۲۰۲۲ و ۵۷.۶ واحد درصدی از زمان ایجاد این بنچمارک در سال ۲۰۱۹[7].
Chatbot Arena. این پلتفرم که در سال ۲۰۲۳ راهاندازی شد، به کاربران امکان میدهد خروجیهای مدلهای ناشناس را مقایسه کنند. تا اوایل ۲۰۲۴، GPT-4 Turbo بر اساس بیش از ۲۰۰,۰۰۰ رأی به عنوان محبوبترین مدل شناخته شده است[1].
چندوجهیبودن
به طور سنتی، سیستمهای هوش مصنوعی به یک وجه محدود بودند. اما در سال ۲۰۲۳ مدلهای چندوجهی قدرتمند ظهور کردند — Google Gemini و OpenAI GPT-4 — که قادر به پردازش متن، تصویر و در برخی موارد صدا هستند. بنچمارک MMMU (Massive Multi-discipline Multimodal Understanding) نشان داد که Gemini Ultra با ۵۹.۴٪ پیشتاز است، اما این عدد به طور قابل توجهی پایینتر از سطح متخصصان انسانی (۸۲.۶٪) است[8].
استدلال
GPQA. بنچمارک Graduate-Level Google-Proof Q&A شامل ۴۴۸ سؤال دشوار در زیستشناسی، فیزیک و شیمی است که با جستجوی ساده در Google نمیتوان به آنها پاسخ داد. GPT-4 با جستجو ۴۱.۰٪ کسب کرد که پایینتر از سطح متخصصان (۷۲.۵٪) اما بالاتر از غیرمتخصصان (۳۰.۵٪) است[9].
نظریه ذهن (BigToM). آزمایش توانایی LLMها در مدلسازی باورهای دیگران نشان داد که GPT-4 در وظایف استنتاج مستقیم باور و عمل به سطح انسانی نزدیک میشود، هرچند در وظایف استنتاج معکوس باور همچنان عقب است[10].
برنامهنویسی
بنچمارک HumanEval تولید کد را ارزیابی میکند. در سال ۲۰۲۳ مدلها به بهبود نتایج خود ادامه دادند، و SWE-bench — بنچمارک جدیدی برای ارزیابی حل وظایف واقعی مهندسی نرمافزار — نشان داد که حتی بهترین مدلها تنها سهم کوچکی از وظایف را حل میکنند که پتانسیل قابل توجهی برای پیشرفت بیشتر نشان میدهد[1].
رفتار عاملی
سیستمهای هوش مصنوعی به طور فزایندهای در سناریوهای عاملی آزمایش میشوند. Voyager (مایکروسافت) توانایی یادگیری خودمختار در محیط پویای Minecraft را نشان داد و ۳.۳ برابر اشیاء منحصربهفرد بیشتر جمعآوری کرد، ۲.۳ برابر بیشتر حرکت نمود و ۱۵.۳ برابر سریعتر به مراحل کلیدی رسید در مقایسه با مدلهای پیشین[11]. MLAgentBench نشان داد که عاملهای هوش مصنوعی برای تحقیقات علمی پتانسیل دارند، اما نتایج بین وظایف مختلف به طور قابل توجهی متفاوت است[1].
ویژگیهای LLM
رفتار ظهوری. تحقیقی در سال ۲۰۲۳ این تصور را به چالش کشید که ظهور تواناییهای «ظهوری» غیرقابل پیشبینی هنگام مقیاسبندی مدلها اجتنابناپذیر است. با استفاده از معیارهای خطی و پیوسته، چنین تواناییهایی تا حد زیادی ناپدید میشوند[12].
افت عملکرد. تحقیق مشترک استنفورد و برکلی نشان داد که عملکرد GPT-4 میتواند بین بهروزرسانیها تغییرات قابل توجهی داشته باشد: نسخه ژوئن ۲۰۲۳ در تولید کد ۴۲ واحد درصد و در وظایف ریاضی ۳۳ واحد درصد ضعیفتر از نسخه مارس بود[13].
خودتصحیحی. محققان DeepMind و دانشگاه ایلینوی نشان دادند که LLMها در تصحیح مستقل استدلال خود بدون راهنمایی خارجی عملکرد ضعیفی دارند: عملکرد GPT-4 در تمام benchmarkهای آزمایششده هنگام تلاش برای خودتصحیحی کاهش یافت[1].
فصل ۳. هوش مصنوعی مسئول
این فصل به ابعاد کلیدی هوش مصنوعی مسئول میپردازد: حریم خصوصی، شفافیت، ایمنی و انصاف[1].
حوادث در حوزه هوش مصنوعی
پایگاه داده AI Incident Database در سال ۲۰۲۳ تعداد ۱۲۳ حادثه ثبت کرد — رشد ۳۲.۳ درصدی نسبت به سال ۲۰۲۲. از سال ۲۰۱۳ تعداد حوادث بیش از بیست برابر شده است. این رشد هم ناشی از گسترش کاربرد هوش مصنوعی و هم ناشی از افزایش آگاهی درباره خطرات اخلاقی آن است[14].
استانداردسازی بنچمارکهای هوش مصنوعی مسئول
تحلیل پنج توسعهدهنده پیشرو (OpenAI، Meta، Anthropic، Google، Mistral AI) نبود مجموعه واحدی از بنچمارکها برای ارزیابی هوش مصنوعی مسئول را آشکار کرد. در حالی که بنچمارکهای عمومی توانایی (MMLU، HellaSwag، ARC Challenge، HumanEval، GSM8K) به طور گسترده استفاده میشوند، بنچمارکهای هوش مصنوعی مسئول (TruthfulQA، RealToxicityPrompts، ToxiGen، BOLD، BBQ) به صورت پراکنده به کار میروند: TruthfulQA توسط حداکثر سه نفر از پنج توسعهدهنده استفاده میشود و یک توسعهدهنده اصلاً از آزمایش بر روی بنچمارکهای هوش مصنوعی مسئول گزارش نمیدهد[1].
هوش مصنوعی و انتخابات
مطالعات سال ۲۰۲۳ نشان داد که مردم دیپفیکهای صوتی را تنها در ۷۳٪ موارد به درستی شناسایی میکنند. انتظار میرود با پیشرفت فناوریهای تولید صدا، دقت تشخیص کاهش یابد. این امر خطر دستکاری کمپینهای سیاسی را ایجاد میکند و به سیاستمداران این امکان را میدهد که ضبطهای صوتی مخرب را به عنوان جعلی رد کنند (به اصطلاح «سود دروغگو»)[15].
بررسی LLMها از نظر تعصب سیاسی همبستگی میان پاسخهای پیشفرض ChatGPT و مواضع حزب دموکرات و همبستگی منفی با مواضع حزب جمهوریخواه را نشان داد[16].
فصل ۴. اقتصاد
این فصل روندهای سرمایهگذاری، اشتغال، پذیرش سازمانی هوش مصنوعی و رباتیک را بررسی میکند[1].
سرمایهگذاری
روندهای کلی. مجموع سرمایهگذاریهای سازمانی در هوش مصنوعی در سال ۲۰۲۳ به ۱۸۹.۲ میلیارد دلار کاهش یافت (کاهش ~۲۰٪ نسبت به سال ۲۰۲۲). با این حال، طی یک دهه حجم سرمایهگذاری سیزده برابر شده است. سرمایهگذاری خصوصی برای دومین سال متوالی کاهش یافت، هرچند این کاهش کمتر از دوره ۲۰۲۱-۲۰۲۲ بود[3].
هوش مصنوعی مولد. سرمایهگذاری در هوش مصنوعی مولد به ۲۵.۲ میلیارد دلار رسید — رشد تقریباً نه برابری نسبت به سال ۲۰۲۲ و سی برابری نسبت به سال ۲۰۱۹. هوش مصنوعی مولد بیش از یک چهارم کل سرمایهگذاریهای خصوصی در هوش مصنوعی را تأمین کرد[3].
توزیع منطقهای. ایالات متحده با سرمایهگذاری ۶۷.۲ میلیارد دلاری، ۸.۷ برابر از چین (۷.۸ میلیارد) و ۱۷.۸ برابر از بریتانیا (۳.۸ میلیارد) پیشی گرفت. در این میان، سرمایهگذاری خصوصی در چین ۴۴.۲٪، در اتحادیه اروپا و بریتانیا ۱۴.۱٪ کاهش یافت، در حالی که در ایالات متحده ۲۲.۱٪ رشد کرد[3].
استارتآپها. تعداد شرکتهای جدید هوش مصنوعی که تأمین مالی دریافت کردند به ۱,۸۱۲ رسید (رشد ۴۰.۶٪). در حوزه هوش مصنوعی مولد، ۹۹ استارتآپ جدید تأمین مالی دریافت کردند (در مقابل ۵۶ مورد در سال ۲۰۲۲)[3].
بازار کار
سهم فرصتهای شغلی مرتبط با هوش مصنوعی در ایالات متحده از ۲.۰٪ در سال ۲۰۲۲ به ۱.۶٪ در سال ۲۰۲۳ کاهش یافت. روند مشابهی در سطح جهانی نیز مشاهده میشود. این کاهش ناشی از کاهش استخدام در شرکتهای بزرگ هوش مصنوعی و کاهش سهم مشاغل فنی است[1].
مهاجرت متخصصان هوش مصنوعی از دانشگاه به صنعت به شتاب خود ادامه میدهد: در سال ۲۰۲۲، ۷۰.۷٪ از دارندگان جدید دکترا در هوش مصنوعی وارد صنعت شدند (در مقابل ۴۰.۹٪ در سال ۲۰۱۱)، و تنها ۲۰.۰٪ به دانشگاه رفتند (در مقابل ۴۱.۶٪)[1].
پذیرش سازمانی
بر اساس دادههای McKinsey، ۵۵٪ سازمانها از هوش مصنوعی (از جمله هوش مصنوعی مولد) در حداقل یک بخش تجاری استفاده میکنند — رشد از ۵۰٪ در سال ۲۰۲۲ و ۲۰٪ در سال ۲۰۱۷. در این میان، ۴۲٪ سازمانها از کاهش هزینهها و ۵۹٪ از رشد درآمد به لطف هوش مصنوعی گزارش میدهند[17].
اشاره به هوش مصنوعی در گزارشهای سود شرکتهای Fortune 500 به ۳۹۴ مورد رسید (تقریباً ۸۰٪ از همه شرکتها) — رشد قابل توجهی از ۲۶۶ مورد در سال ۲۰۲۲. پرتکرارترین موضوع (۱۹.۷٪ از کل تماسها) هوش مصنوعی مولد بود[1].
رباتیک
در سال ۲۰۲۲، ۵۵۳,۰۰۰ ربات صنعتی نصب شد — رشد ۵.۱٪ نسبت به سال ۲۰۲۱ و بیش از سه برابر شدن از سال ۲۰۱۲. چین تسلط دارد: از سال ۲۰۱۳ که از ژاپن پیشی گرفت، سهم چین از ۲۰.۸٪ به ۵۲.۴٪ از نصبهای جهانی در سال ۲۰۲۲ رسیده است. سهم رباتهای همکار از ۲.۸٪ در سال ۲۰۱۷ به ۹.۹٪ در سال ۲۰۲۲ افزایش یافته است[18].
فصل ۵. علم و پزشکی
این فصل که برای نخستین بار در گزارش گنجانده شده، نقش هوش مصنوعی را در کشفیات علمی و نوآوریهای پزشکی روشن میسازد[1].
دستاوردهای علمی سال ۲۰۲۳
AlphaDev (DeepMind) — سیستم Reinforcement Learning که الگوریتمهای مرتبسازی با دستورالعملهای کمتر از معیارهای انسانی موجود کشف کرد. برخی از الگوریتمهای یافتشده در کتابخانه مرتبسازی استاندارد C++ (LLVM) گنجانده شدند — اولین بهروزرسانی این بخش از کتابخانه در بیش از ده سال[19].
GraphCast (DeepMind) — سیستم پیشبینی آبوهوا بر پایه Neural Networkهای گرافی که پیشبینی ۱۰ روزه را در کمتر از یک دقیقه با دقتی بالاتر از سیستم مدلسازی پیشرو HRES (مرکز اروپایی پیشبینیهای میانمدت آبوهوایی) ارائه میدهد[20].
GNoME (Google DeepMind) — مدلی که از شبکههای گرافی برای جستجوی شتابیافته مواد عملکردی جدید استفاده میکند، امری که برای پیشرفت در رباتیک و صنعت نیمههادیها حیاتی است[21].
Synbot — ربات شیمیدان هدایتشده توسط هوش مصنوعی برای سنتز خودمختار مولکولهای آلی که به بازده واکنشی برابر با مقادیر مرجع یا بیشتر دست یافت[22].
FlexiCubes (NVIDIA) — روش بهینهسازی مشهای سهبعدی با استفاده از هوش مصنوعی برای بهبود کیفیت تولید اشیاء سهبعدی در گرافیک کامپیوتری[23].
هوش مصنوعی در پزشکی
دانش بالینی. در بنچمارک MedQA (ارزیابی دانش بالینی هوش مصنوعی)، مدل GPT-4 Medprompt به دقت ۹۰.۲٪ دست یافت — رشد ۲۲.۶ واحد درصدی نسبت به بهترین نتیجه سال ۲۰۲۲. از زمان ایجاد این بنچمارک در سال ۲۰۱۹، عملکرد هوش مصنوعی در MedQA تقریباً سه برابر شده است. شایان ذکر است که GPT-4 Medprompt از prompt engineering به جای fine-tuning استفاده کرد و از مدلهای پزشکی تخصصی پیشی گرفت[24].
MediTron-70B — یک LLM پزشکی متنباز که ۷۰.۲٪ در MedQA کسب کرد — بهترین نتیجه در میان مدلهای متنباز، هرچند پایینتر از عملکرد مدلهای غیرمتنباز GPT-4 Medprompt و Med-PaLM 2[25].
نوآوریهای پزشکی. از جمله سیستمهای قابل توجه سال ۲۰۲۳: SynthSR (بهبود تصویربرداری از ساختارهای مغز از اسکنهای MRI با کیفیت پایین)، ImmunoSEIRA (سنسورهای مادون قرمز مبتنی بر هوش مصنوعی برای تشخیص بیماریهای نوروژنراتیو)، EVEscape (پیشبینی تکامل ویروسها برای پیشگیری از همهگیریها)، AlphaMissense (طبقهبندی جهشهای missense)[1].
تأییدیه FDA. در سال ۲۰۲۲، FDA 139 دستگاه پزشکی مبتنی بر هوش مصنوعی را تأیید کرد — رشد ۱۲.۱٪ نسبت به سال ۲۰۲۱. از سال ۲۰۱۲، تعداد چنین تأییدیههایی بیش از ۴۵ برابر شده است[26].
فصل ۶. آموزش
این فصل روندهای آموزش در حوزه علوم کامپیوتر و هوش مصنوعی را بررسی میکند[1].
آموزش عالی
تعداد فارغالتحصیلان مقطع کارشناسی در علوم کامپیوتر در ایالات متحده و کانادا به رشد خود ادامه میدهد. تعداد دانشجویان کارشناسی ارشد نسبتاً ثابت مانده و تعداد دکتراها به آرامی افزایش مییابد. از سال ۲۰۱۸، تعداد کارشناسیارشدان و دکتراهای علوم کامپیوتر اندکی کاهش یافته است[1].
سهم دانشجویان بینالمللی در همه سطوح آموزشی کاهش یافته، به ویژه در مقطع کارشناسی ارشد. در مقیاس جهانی، تعداد برنامههای آموزشی انگلیسیزبان مرتبط با هوش مصنوعی از سال ۲۰۱۷ سه برابر شده است[1].
ChatGPT در آموزش
بر اساس نظرسنجی Walton Foundation، ۸۸٪ معلمان و ۷۹٪ دانشآموزان معتقدند ChatGPT تأثیر مثبتی بر فرآیند آموزشی دارد. ۷۶٪ معلمان و ۶۵٪ دانشآموزان بر این باورند که ادغام ChatGPT در آموزش مهم است[27].
فصل ۷. سیاست و حکمرانی
این فصل فعالیتهای قانونگذاری و نظارتی در حوزه هوش مصنوعی را در سطوح جهانی، آمریکایی و اروپایی تحلیل میکند[1].
روندهای جهانی
اشاره به هوش مصنوعی در فرآیندهای قانونگذاری در سراسر جهان به سطح رکورد رسیده است. تحولی از اقدامات صرفاً تشویقی به قانونگذاری محدودکننده مشاهده میشود که نشاندهنده توجه فزاینده نهادهای نظارتی به ریسکهای بالقوه هوش مصنوعی است[1].
موضوعات قوانین تصویبشده در سال ۲۰۲۳ به طور قابل توجهی گسترش یافته و نیروهای مسلح و امنیت ملی، حقوق مدنی، تجارت، آموزش، روابط کاری، علم و فناوری را در بر میگیرد[1].
مقررات در ایالات متحده
تعداد مقررات مرتبط با هوش مصنوعی در سال ۲۰۲۳ به ۲۵ مورد رسید (رشد ۵۶.۳٪ نسبت به سال ۲۰۲۲). پرتکرارترین موضوع، تجارت خارجی و امور مالی بینالمللی بود. سهم مقررات با درجه ارتباط بالا و متوسط با هوش مصنوعی نسبت به سالهای گذشته افزایش یافت[1].
رویداد مهم سال ۲۰۲۳ فرمان اجرایی رئیسجمهور بایدن درباره هوش مصنوعی (Executive Order on AI) بود که از جمله به ایجاد منبع ملی تحقیقات هوش مصنوعی (National AI Research Resource) برای تضمین فرصتهای برابر بین صنعت و دانشگاه هدف داشت[28].
مقررات در اتحادیه اروپا
در اتحادیه اروپا روند مشابهی از افزایش تعداد مقررات مرتبط با هوش مصنوعی مشاهده میشود. دستاورد مهم سال ۲۰۲۳ پیشرفت AI Act — اولین قانون جامع هوش مصنوعی در جهان — بود[1].
فصل ۸. تنوع
این فصل تنوع جنسیتی و قومی در میان متخصصان هوش مصنوعی را بررسی میکند. علیرغم برخی پیشرفتها، زنان و اقلیتها هنوز در حوزه هوش مصنوعی، هم در صنعت و هم در دانشگاه، به طور قابل توجهی کمتر از حد انتظار نمایندگی دارند[1].
فصل ۹. افکار عمومی
این فصل درک عمومی از هوش مصنوعی را بر اساس نظرسنجیهای بینالمللی و دادههای شبکههای اجتماعی تحلیل میکند[1].
نظرسنجیهای بینالمللی
آگاهی و نگرانی. بر اساس دادههای Ipsos، ۶۶٪ پاسخدهندگان (رشد از ۶۰٪) معتقدند هوش مصنوعی طی ۳ تا ۵ سال آینده تأثیر قابل توجهی بر زندگیشان خواهد داشت. در عین حال، ۵۲٪ نگرانی خود را نسبت به محصولات هوش مصنوعی ابراز میکنند (رشد ۱۳ واحد درصدی از سال ۲۰۲۲)[4].
انتظارات اقتصادی. تنها ۳۷٪ پاسخدهندگان معتقدند هوش مصنوعی کارشان را بهبود میبخشد، ۳۴٪ معتقدند اقتصاد را بهبود میدهد، و ۳۲٪ معتقدند تأثیر مثبتی بر بازار کار خواهد داشت[4].
تفاوتهای جمعیتی. نسلهای جوانتر به طور قابل توجهی خوشبینتر هستند: ۵۹٪ از نسل Z معتقدند هوش مصنوعی سرگرمی را بهبود میبخشد، در مقابل ۴۰٪ از نسل بیبیبومر. افراد با درآمد و تحصیلات بالاتر نیز خوشبینترند[1].
شناخت ChatGPT. بر اساس نظرسنجی بینالمللی دانشگاه تورنتو، ۶۳٪ پاسخدهندگان از ChatGPT آگاهی دارند و از میان آنها تقریباً نیمی حداقل یک بار در هفته از آن استفاده میکنند[29].
دادههای شبکههای اجتماعی
تحلیل Quid بر روی بیش از ۷ میلیون پست در شبکههای اجتماعی در سال ۲۰۲۳ نشان داد که مدلهای GraphCast و Claude 2.1 بالاترین نرخ احساسات مثبت (net sentiment score) را کسب کردند. GPT-4 بیشترین سهم توجه را در سهماهه اول جذب کرد، در حالی که تا پایان سال تمرکز به Gemini و Grok منتقل شد[1].
مدلهای مهم هوش مصنوعی سال ۲۰۲۳
گزارش ظهور تعدادی از مدلهای کلیدی را ثبت میکند[1]:
| مدل | توسعهدهنده | نوع | تاریخ | اهمیت |
|---|---|---|---|---|
| GPT-4 | OpenAI | LLM، چندوجهی | مارس ۲۰۲۳ | یکی از قدرتمندترین LLMها؛ پیشرو در HELM |
| PaLM 2 | LLM | مه ۲۰۲۳ | قابلیتهای چندزبانه گسترده | |
| Llama 2 | Meta | LLM (متنباز) | ژوئیه ۲۰۲۳ | مدل متنباز پیشرو؛ نسخههای 7B/13B/70B |
| Claude 2 / 2.1 | Anthropic | LLM | ژوئیه / نوامبر ۲۰۲۳ | پنجره context تا ۲۰۰K token |
| Mistral 7B | Mistral AI | LLM (متنباز) | سپتامبر ۲۰۲۳ | مدل کوچک با عملکرد بالا |
| DALL-E 3 | OpenAI | تولید تصویر | اکتبر ۲۰۲۳ | بهبود کیفیت و پیروی از prompt |
| Gemini / Gemini Ultra | LLM، چندوجهی | دسامبر ۲۰۲۳ | اولین LLM که در MMLU از انسان پیشی گرفت | |
| Mixtral 8×7B | Mistral AI | LLM (MoE، متنباز) | دسامبر ۲۰۲۳ | معماری Mixture-of-Experts |
| Midjourney v6 | Midjourney | تولید تصویر | دسامبر ۲۰۲۳ | بهبود کیفیت و promptهای شهودی |
| Whisper v3 | OpenAI | تشخیص گفتار | نوامبر ۲۰۲۳ | دقت بهبودیافته، پشتیبانی زبانی گستردهتر |
روششناسی
گزارش از دادههای منابع متعددی استفاده میکند[1]:
- انتشارات و ثبت اختراعات: OpenAlex، WIPO، USPTO، دادههای Epoch AI.
- بنچمارکها: Papers With Code، CRFM (HELM)، لیدربوردهای تخصصی.
- سرمایهگذاری: Quid (Capital IQ، Crunchbase)، دادههای بیش از ۸ میلیون شرکت.
- بازار کار: Lightcast، LinkedIn، Stack Overflow.
- فعالیت سازمانی: McKinsey & Company، Seeking Alpha (earnings calls).
- رباتیک: International Federation of Robotics (IFR).
- مقررات: Federal Register (ایالات متحده)، EUR-Lex (اتحادیه اروپا)، Govini.
- افکار عمومی: Ipsos، Pew Research Center، University of Toronto (GPO-AI)، Quid (رسانههای اجتماعی).
- آموزش: CRA Taulbee Survey، Informatics Europe، Studyportals، Code.org، Walton Foundation.
- پزشکی: FDA، Papers With Code (MedQA).
برآوردهای هزینه آموزش مدلها در همکاری با Epoch AI و بر اساس تحلیل نوع و تعداد سختافزار، مدت زمان آموزش و قیمتهای اجاره ابری تهیه شدند[2].
تیم نویسندگان
گزارش تحت رهبری هممدیران ری پرو (Ray Perrault) و جک کلارک (Jack Clark) و با مشارکت طیف گستردهای از پژوهشگران و سازمانهای شریک تهیه شده است. AI Index پروژه مؤسسه HAI استنفورد (Human-Centered Artificial Intelligence) است[1].
پیوندها
- Stanford HAI — AI Index Report 2024 (متن کامل): https://aiindex.stanford.edu/report/
- Epoch AI — دادههای هزینه آموزش و روندهای محاسباتی: https://epochai.org/
- Papers With Code — بنچمارکها و لیدربوردها: https://paperswithcode.com/
- CRFM HELM — Holistic Evaluation of Language Models: https://crfm.stanford.edu/helm/
- AI Incident Database: https://incidentdatabase.ai/
- International Federation of Robotics: https://ifr.org/
- McKinsey Global Survey on AI: https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
منابع
- Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/
- Epoch AI (2023). AI Training Cost Estimates and Compute Trends. https://epochai.org/
- Liang, P. et al. (2022). Holistic Evaluation of Language Models. https://arxiv.org/abs/2211.09110
- Hendrycks, D. et al. (2021). Measuring Massive Multitask Language Understanding. https://arxiv.org/abs/2009.03300
- Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. https://arxiv.org/abs/2311.16502
- Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
- Gandhi, K. et al. (2023). Understanding Social Reasoning in Language Models with Language Models. https://arxiv.org/abs/2306.15448
- Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? https://arxiv.org/abs/2304.15004
- Chen, L. et al. (2023). How Is ChatGPT's Behavior Changing over Time? https://arxiv.org/abs/2307.09009
- Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. https://arxiv.org/abs/2305.16291
- Mankowitz, D. J. et al. (2023). Faster sorting algorithms discovered using deep reinforcement learning. Nature. https://doi.org/10.1038/s41586-023-06004-9
- Lam, R. et al. (2023). Learning skillful medium-range global weather forecasting. Science. https://doi.org/10.1126/science.adi2336
- Merchant, A. et al. (2023). Scaling deep learning for materials discovery. Nature. https://doi.org/10.1038/s41586-023-06735-9
- Ha, T. et al. (2023). AI-driven robotic chemist for autonomous synthesis of organic molecules. Science Advances. https://doi.org/10.1126/sciadv.adj0461
- Shen, T. et al. (2023). Flexible Isosurface Extraction for Gradient-Based Mesh Optimization. ACM Transactions on Graphics. https://doi.org/10.1145/3592430
- Nori, H. et al. (2023). Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine. https://arxiv.org/abs/2311.16452
- Chen, Z. et al. (2023). MEDITRON-70B: Scaling Medical Pretraining for Large Language Models. https://arxiv.org/abs/2311.16079
- Mai, K. T. et al. (2023). Warning: Humans Cannot Reliably Detect Speech Deepfakes. https://arxiv.org/abs/2301.07829
- Motoki, F. et al. (2023). More Human than Human: Measuring ChatGPT Political Bias. https://doi.org/10.1007/s11127-023-01097-2
- McKinsey & Company (2023). The State of AI in 2023: Generative AI's Breakout Year. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
- International Federation of Robotics (2023). World Robotics Report 2023. https://ifr.org/worldrobotics/
- The White House (2023). Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence. https://www.whitehouse.gov/briefing-room/presidential-actions/2023/10/30/executive-order-on-the-safe-secure-and-trustworthy-development-and-use-of-artificial-intelligence/
- Fleming, S. L. et al. (2023). MedAlign: A Clinician-Generated Dataset for Instruction Following With Electronic Medical Records. https://arxiv.org/abs/2308.14089
- Iglesias, J. E. et al. (2023). SynthSR: A public AI tool to turn heterogeneous clinical brain scans into high-resolution T1-weighted images for 3D morphometry. Science Advances. https://doi.org/10.1126/sciadv.add3607
- Cheng, J. et al. (2023). Accurate Proteome-Wide Missense Variant Effect Prediction With AlphaMissense. Science. https://doi.org/10.1126/science.adg7492
یادداشتها
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/
- ↑ 2.0 2.1 2.2 Epoch AI (2023). AI Training Cost Estimates. https://epochai.org/
- ↑ 3.0 3.1 3.2 3.3 3.4 Quid (2023). AI Investment Data. https://quid.com/
- ↑ 4.0 4.1 4.2 Ipsos (2023). Global Perceptions of AI Survey. https://www.ipsos.com/
- ↑ Pew Research Center (2023). Public Views on AI. https://www.pewresearch.org/
- ↑ Liang, P. et al. (2022). Holistic Evaluation of Language Models. https://arxiv.org/abs/2211.09110
- ↑ Hendrycks, D. et al. (2021). Measuring Massive Multitask Language Understanding. https://arxiv.org/abs/2009.03300
- ↑ Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. https://arxiv.org/abs/2311.16502
- ↑ Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
- ↑ Gandhi, K. et al. (2023). Understanding Social Reasoning in Language Models with Language Models. https://arxiv.org/abs/2306.15448
- ↑ Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. https://arxiv.org/abs/2305.16291
- ↑ Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? https://arxiv.org/abs/2304.15004
- ↑ Chen, L. et al. (2023). How Is ChatGPT's Behavior Changing over Time? https://arxiv.org/abs/2307.09009
- ↑ AI Incident Database (2023). https://incidentdatabase.ai/
- ↑ Mai, K. T. et al. (2023). Warning: Humans Cannot Reliably Detect Speech Deepfakes. https://arxiv.org/abs/2301.07829
- ↑ Motoki, F. et al. (2023). More Human than Human: Measuring ChatGPT Political Bias. https://doi.org/10.1007/s11127-023-01097-2
- ↑ McKinsey & Company (2023). The State of AI in 2023: Generative AI's Breakout Year. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
- ↑ International Federation of Robotics (2023). World Robotics Report 2023. https://ifr.org/worldrobotics/
- ↑ Mankowitz, D. J. et al. (2023). Faster sorting algorithms discovered using deep reinforcement learning. Nature. https://doi.org/10.1038/s41586-023-06004-9
- ↑ Lam, R. et al. (2023). Learning skillful medium-range global weather forecasting. Science. https://doi.org/10.1126/science.adi2336
- ↑ Merchant, A. et al. (2023). Scaling deep learning for materials discovery. Nature. https://doi.org/10.1038/s41586-023-06735-9
- ↑ Ha, T. et al. (2023). AI-driven robotic chemist for autonomous synthesis of organic molecules. Science Advances. https://doi.org/10.1126/sciadv.adj0461
- ↑ Shen, T. et al. (2023). Flexible Isosurface Extraction for Gradient-Based Mesh Optimization. ACM Transactions on Graphics. https://doi.org/10.1145/3592430
- ↑ Nori, H. et al. (2023). Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine. https://arxiv.org/abs/2311.16452
- ↑ Chen, Z. et al. (2023). MEDITRON-70B: Scaling Medical Pretraining for Large Language Models. https://arxiv.org/abs/2311.16079
- ↑ U.S. Food and Drug Administration (2023). Artificial Intelligence and Machine Learning (AI/ML)-Enabled Medical Devices. https://www.fda.gov/medical-devices/software-medical-device-samd/artificial-intelligence-and-machine-learning-aiml-enabled-medical-devices
- ↑ Impact Research / Walton Family Foundation (2023). ChatGPT and Education Survey. https://www.waltonfamilyfoundation.org/
- ↑ The White House (2023). Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence. https://www.whitehouse.gov/briefing-room/presidential-actions/2023/10/30/executive-order-on-the-safe-secure-and-trustworthy-development-and-use-of-artificial-intelligence/
- ↑ Global Public Opinion on AI Survey, University of Toronto (2023). https://www.mediatechdemocracy.com/