The 2024 AI Index Report (VI)
AI Index Report 2024 — ấn bản thường niên lần thứ bảy của báo cáo AI Index, được chuẩn bị bởi Viện Trí tuệ Nhân tạo Lấy Con người làm Trung tâm của Stanford (Stanford HAI)[1]. Báo cáo năm 2024 là ấn bản quy mô nhất trong toàn bộ lịch sử xuất bản và ra đời vào thời điểm tác động của AI đối với xã hội trở nên nổi bật chưa từng có. Ấn bản bao gồm các đánh giá mới về chi phí huấn luyện mô hình, phân tích chi tiết về AI có trách nhiệm, và lần đầu tiên có một chương riêng dành cho tác động của AI đối với khoa học và y học. Báo cáo theo dõi, hệ thống hóa và trực quan hóa dữ liệu liên quan đến trí tuệ nhân tạo, cung cấp thông tin khách quan và được kiểm chứng kỹ lưỡng cho các nhà hoạch định chính sách, nhà nghiên cứu, lãnh đạo doanh nghiệp, nhà báo và công chúng rộng rãi.
Cấu trúc báo cáo
Báo cáo năm 2024 gồm chín chương chuyên đề[1]:
- Nghiên cứu và Phát triển (Research and Development) — xu hướng trong các ấn phẩm, bằng sáng chế, mô hình nền tảng và các dự án mã nguồn mở.
- Hiệu suất Kỹ thuật (Technical Performance) — benchmark, so sánh với trình độ con người, tính đa phương thức.
- AI có Trách nhiệm (Responsible AI) — sự cố, an toàn, thiên kiến, quyền riêng tư.
- Kinh tế (Economy) — đầu tư, thị trường lao động, ứng dụng doanh nghiệp, tự động hóa.
- Khoa học và Y học (Science and Medicine) — chương mới: những đột phá trong khoa học và các ứng dụng y tế của AI.
- Giáo dục (Education) — đào tạo nhân lực, chương trình giáo dục, ChatGPT trong giảng dạy.
- Chính sách và Quản trị (Policy and Governance) — luật pháp, quy định, chiến lược quốc gia.
- Đa dạng (Diversity) — đa dạng giới tính và dân tộc trong lĩnh vực AI.
- Dư luận xã hội (Public Opinion) — thái độ của công chúng đối với AI dựa trên các cuộc khảo sát quốc tế.
Những kết luận chính của báo cáo (Top 10)
Các tác giả báo cáo đã xác định mười luận điểm chính của năm 2024[1]:
1. AI vượt trội con người trong một số tác vụ, nhưng không phải tất cả
Các hệ thống trí tuệ nhân tạo đã vượt trình độ con người trên một số benchmark, bao gồm phân loại hình ảnh (ImageNet), suy luận thị giác (VQA) và hiểu ngôn ngữ tiếng Anh (SuperGLUE). Tuy nhiên, AI vẫn thua kém con người trong các tác vụ phức tạp hơn: toán học cấp độ Olympic (MATH), suy luận thông thường dựa trên hình ảnh và lập kế hoạch[1].
2. Ngành công nghiệp thống trị các nghiên cứu AI tiên tiến
Năm 2023, ngành công nghiệp đã tạo ra 51 mô hình Machine Learning đáng kể, trong khi giới học thuật chỉ tạo ra 15. Ngoài ra, 21 mô hình là kết quả hợp tác giữa công nghiệp và học thuật — mức kỷ lục[1].
3. Chi phí huấn luyện các mô hình tiên tiến tăng mạnh
Theo ước tính của AI Index và Epoch AI, chi phí huấn luyện GPT-4 vào khoảng 78 triệu đô la, còn Gemini Ultra của Google vào khoảng 191 triệu đô la[2]. Để so sánh: việc huấn luyện mô hình Transformer gốc năm 2017 tốn khoảng 900 đô la, còn RoBERTa Large năm 2019 tốn khoảng 160 nghìn đô la[1].
4. Mỹ dẫn đầu với tư cách nguồn gốc của các mô hình AI hàng đầu
Năm 2023, 61 mô hình AI đáng kể được tạo ra tại các tổ chức ở Mỹ, vượt xa EU (21 mô hình) và Trung Quốc (15 mô hình)[1].
5. Các đánh giá tiêu chuẩn hóa về trách nhiệm của LLM còn tụt hậu nghiêm trọng
Nghiên cứu của AI Index đã phát hiện ra sự thiếu hụt đáng kể trong tiêu chuẩn hóa báo cáo về AI có trách nhiệm. Các nhà phát triển hàng đầu — OpenAI, Google và Anthropic — kiểm tra mô hình của họ trên các benchmark AI có trách nhiệm khác nhau, điều này gây khó khăn cho việc so sánh hệ thống các rủi ro[1].
6. Đầu tư vào AI tạo sinh tăng trưởng vượt bậc
Bất chấp sự sụt giảm chung của đầu tư tư nhân vào AI, tài trợ cho AI tạo sinh đã tăng gần tám lần so với năm 2022, đạt 25,2 tỷ đô la. Các vòng huy động vốn lớn đã được thực hiện bởi OpenAI, Anthropic, Hugging Face và Inflection[3].
7. AI nâng cao năng suất và chất lượng công việc
Nhiều nghiên cứu năm 2023 cho thấy AI giúp người lao động hoàn thành tác vụ nhanh hơn và với chất lượng cao hơn, đồng thời thu hẹp khoảng cách giữa người lao động có kỹ năng thấp và cao. Tuy nhiên, một số nghiên cứu cảnh báo rằng việc sử dụng AI mà không có giám sát phù hợp có thể dẫn đến giảm năng suất[1].
8. Tiến bộ khoa học được đẩy nhanh nhờ AI
Năm 2023, các ứng dụng khoa học đáng kể của AI được giới thiệu: AlphaDev (tăng tốc thuật toán sắp xếp), GNoME (khám phá vật liệu mới), GraphCast (dự báo thời tiết) và nhiều ứng dụng khác[1].
9. Số lượng văn bản quy phạm về AI tại Mỹ tăng mạnh
Năm 2023, 25 văn bản quy phạm liên quan đến AI được ban hành — tăng 56,3% so với năm trước. Để so sánh: năm 2016 chỉ có một văn bản như vậy được thông qua[1].
10. Mọi người ngày càng nhận thức được tác động của AI — và ngày càng lo lắng hơn
Theo dữ liệu của Ipsos, tỷ lệ người trả lời cho rằng AI sẽ ảnh hưởng đáng kể đến cuộc sống của họ trong 3–5 năm tới đã tăng từ 60% lên 66%. Trong đó, 52% bày tỏ lo lắng về các sản phẩm và dịch vụ AI — tăng 13 điểm phần trăm so với năm 2022. Tại Mỹ, theo dữ liệu của Pew Research, 52% người Mỹ báo cáo lo lắng nhiều hơn là phấn khích về AI (so với 37% năm 2022)[4][5].
Chương 1. Nghiên cứu và Phát triển
Chương này phân tích xu hướng trong các ấn phẩm, bằng sáng chế, các hệ thống AI tiên tiến, mô hình nền tảng (foundation models), hội nghị và các dự án phần mềm mã nguồn mở[1].
Ấn phẩm
Tổng số ấn phẩm về AI tiếp tục tăng: từ khoảng 88.000 năm 2010 lên hơn 240.000 vào năm 2022 (tăng gần gấp ba lần). Mức tăng trong năm gần nhất là 1,1%[1].
Bằng sáng chế
Số lượng bằng sáng chế được cấp trong lĩnh vực AI trên toàn thế giới tăng mạnh: từ năm 2021 đến 2022 tăng 62,7%, và từ năm 2010 tăng hơn 31 lần. Trung Quốc chiếm ưu thế trong việc đăng ký bằng sáng chế AI: năm 2022, nước này chiếm 61,1% đơn đăng ký bằng sáng chế, trong khi Mỹ chiếm 20,9% (giảm từ 54,1% năm 2010)[1].
Các mô hình tiên tiến
Năm 2023, ngành công nghiệp tiếp tục thống trị trong việc tạo ra các mô hình tiên tiến. Đã có 149 mô hình nền tảng được phát hành — gấp đôi so với năm 2022. Trong số đó, 65,7% là mã nguồn mở (so với 44,4% năm 2022 và 33,3% năm 2021)[1].
Chi phí huấn luyện. Sự hợp tác giữa AI Index và Epoch AI đã cho phép có được các ước tính chi phí huấn luyện mô hình chính xác hơn. Sự tăng trưởng của chi phí được minh họa rõ nét qua xu hướng sau[2]:
| Mô hình | Năm | Ước tính chi phí huấn luyện (USD) |
|---|---|---|
| Transformer | 2017 | ~930 |
| BERT-Large | 2018 | ~3 300 |
| RoBERTa Large | 2019 | ~160 000 |
| GPT-3 175B | 2020 | ~4,3 triệu |
| PaLM 540B | 2022 | ~12,4 triệu |
| Llama 2 70B | 2023 | ~3,9 triệu |
| GPT-4 | 2023 | ~78 triệu |
| Gemini Ultra | 2023 | ~191 triệu |
Quốc tịch. Năm 2023, 61 mô hình đáng kể được tạo ra bởi các tổ chức Mỹ, 21 — của EU, 15 — của Trung Quốc. Điều này khẳng định vai trò dẫn đầu của Mỹ trong việc phát triển các hệ thống AI tiên tiến[1].
Phần mềm mã nguồn mở
Số lượng dự án AI trên GitHub tăng đều đặn: từ 845 năm 2011 lên khoảng 1,8 triệu năm 2023. Năm 2023 ghi nhận mức tăng 59,3%. Tổng số sao dành cho các dự án AI đã tăng gấp ba: từ 4,0 triệu năm 2022 lên 12,2 triệu năm 2023[1].
Hội nghị
Số lượng người tham dự các hội nghị AI hàng đầu (NeurIPS, ICML, ICLR và các hội nghị khác) tiếp tục tăng, phản ánh mối quan tâm ngày càng lớn đối với lĩnh vực này[1].
Chương 2. Hiệu suất Kỹ thuật
Chương này phân tích tiến bộ của các hệ thống AI trong các tác vụ xử lý ngôn ngữ, tạo sinh hình ảnh, suy luận, lập trình và hành vi tác nhân[1].
Tình trạng hiệu suất của AI
Tính đến năm 2023, AI vượt trội trình độ con người trong một số danh mục tác vụ: phân loại hình ảnh (từ năm 2015), hiểu văn bản cơ bản (từ năm 2017), suy luận thị giác (từ năm 2020), suy diễn ngôn ngữ tự nhiên (từ năm 2021). Tuy nhiên, trong các tác vụ như toán học Olympic (MATH) và lập kế hoạch, AI vẫn thua kém con người[1].
Mô hình ngôn ngữ
HELM. Benchmark Holistic Evaluation of Language Models (HELM), được phát triển tại Stanford, đánh giá các LLM theo mười kịch bản, bao gồm hiểu văn bản, toán học và suy luận pháp lý. Tính đến tháng 1 năm 2024, GPT-4 dẫn đầu với chỉ số mean win rate là 0,96[6].
MMLU. Benchmark Massive Multitask Language Understanding (MMLU) đánh giá các mô hình trên 57 lĩnh vực chủ đề. Gemini Ultra của Google là mô hình đầu tiên vượt ngưỡng cơ sở của con người (89,8%), đạt 90,0% — cải thiện 14,8 điểm phần trăm so với năm 2022 và 57,6 điểm phần trăm kể từ khi benchmark được tạo ra năm 2019[7].
Chatbot Arena. Nền tảng được ra mắt năm 2023 cho phép người dùng so sánh kết quả tạo sinh từ các mô hình ẩn danh. Tính đến đầu năm 2024, GPT-4 Turbo được công nhận là mô hình được ưa chuộng nhất dựa trên hơn 200.000 lượt bình chọn[1].
Tính đa phương thức
Truyền thống, các hệ thống AI bị giới hạn ở một phương thức duy nhất. Tuy nhiên, năm 2023 đã xuất hiện các mô hình đa phương thức mạnh mẽ — Google Gemini và OpenAI GPT-4, có khả năng xử lý văn bản, hình ảnh và trong một số trường hợp cả âm thanh. Benchmark MMMU (Massive Multi-discipline Multimodal Understanding) cho thấy Gemini Ultra dẫn đầu với 59,4%, nhưng con số này thấp hơn đáng kể so với trình độ chuyên gia con người (82,6%)[8].
Suy luận
GPQA. Benchmark Graduate-Level Google-Proof Q&A bao gồm 448 câu hỏi khó về sinh học, vật lý và hóa học mà không thể trả lời bằng cách tìm kiếm đơn giản trên Google. GPT-4 với tìm kiếm đạt 41,0%, thấp hơn trình độ chuyên gia (72,5%) nhưng cao hơn người không chuyên (30,5%)[9].
Lý thuyết về tâm trí (BigToM). Kiểm tra khả năng của các LLM trong việc mô hình hóa niềm tin của người khác cho thấy GPT-4 đang tiệm cận trình độ con người trong các tác vụ suy diễn trực tiếp về niềm tin và hành động, mặc dù vẫn còn thua kém trong các tác vụ suy diễn ngược về niềm tin[10].
Lập trình
Benchmark HumanEval đánh giá việc tạo sinh mã. Năm 2023, các mô hình tiếp tục cải thiện chỉ số, còn SWE-bench — benchmark mới để đánh giá việc giải quyết các bài toán kỹ thuật phần mềm thực tế — cho thấy ngay cả các mô hình tốt nhất cũng chỉ giải quyết được một phần nhỏ các tác vụ, cho thấy tiềm năng đáng kể để tiến bộ hơn nữa[1].
Hành vi tác nhân
Các hệ thống AI ngày càng được kiểm thử trong các kịch bản tác nhân. Voyager (Microsoft) đã chứng minh khả năng tự học trong môi trường động của Minecraft, thu thập gấp 3,3 lần số vật phẩm độc đáo, di chuyển xa gấp 2,3 lần và đạt được các cột mốc quan trọng nhanh hơn 15,3 lần so với các mô hình tiền nhiệm[11]. MLAgentBench cho thấy các tác nhân AI dành cho nghiên cứu khoa học có tiềm năng hứa hẹn, nhưng kết quả biến động đáng kể giữa các tác vụ[1].
Các đặc tính của LLM
Hành vi nổi sinh. Một nghiên cứu năm 2023 đã đặt câu hỏi về quan niệm rằng các khả năng "nổi sinh" không thể đoán trước nhất thiết phải xuất hiện khi mở rộng quy mô mô hình. Khi sử dụng các thước đo tuyến tính và liên tục, các khả năng này phần lớn biến mất[12].
Suy giảm hiệu suất. Nghiên cứu của Stanford và Berkeley cho thấy hiệu suất của GPT-4 có thể thay đổi đáng kể giữa các lần cập nhật: phiên bản tháng 6 năm 2023 kém hơn phiên bản tháng 3 tới 42 điểm phần trăm trong tạo sinh mã và kém hơn 33 điểm phần trăm trong các tác vụ toán học[13].
Tự hiệu chỉnh. Các nhà nghiên cứu từ DeepMind và Đại học Illinois cho thấy rằng các LLM xử lý kém khi tự hiệu chỉnh lập luận của mình mà không có hướng dẫn từ bên ngoài: hiệu suất của GPT-4 giảm trên tất cả các benchmark được kiểm tra khi cố gắng tự hiệu chỉnh[1].
Chương 3. AI có Trách nhiệm
Chương này dành cho các khía cạnh chính của AI có trách nhiệm: quyền riêng tư, minh bạch, an toàn và công bằng[1].
Các sự cố trong lĩnh vực AI
Cơ sở dữ liệu AI Incident Database đã ghi nhận 123 sự cố trong năm 2023 — tăng 32,3% so với năm 2022. Kể từ năm 2013, số lượng sự cố đã tăng hơn hai mươi lần. Sự tăng trưởng này được thúc đẩy bởi cả việc mở rộng ứng dụng AI lẫn nâng cao nhận thức về các rủi ro đạo đức của nó[14].
Tiêu chuẩn hóa benchmark AI có trách nhiệm
Phân tích năm nhà phát triển hàng đầu (OpenAI, Meta, Anthropic, Google, Mistral AI) cho thấy sự vắng mặt của một bộ benchmark thống nhất để đánh giá AI có trách nhiệm. Mặc dù các benchmark về khả năng chung (MMLU, HellaSwag, ARC Challenge, HumanEval, GSM8K) được sử dụng rộng rãi, các benchmark AI có trách nhiệm (TruthfulQA, RealToxicityPrompts, ToxiGen, BOLD, BBQ) được áp dụng rải rác: TruthfulQA chỉ được không quá ba trong số năm nhà phát triển sử dụng, và một nhà phát triển hoàn toàn không báo cáo về kiểm thử theo các benchmark AI có trách nhiệm[1].
AI và bầu cử
Các nghiên cứu năm 2023 cho thấy mọi người chỉ xác định đúng audio deepfake trong 73% trường hợp. Dự kiến rằng khi công nghệ tạo sinh âm thanh phát triển, độ chính xác nhận dạng sẽ giảm. Điều này tạo ra rủi ro thao túng các chiến dịch chính trị và cho phép các chính trị gia bác bỏ các bản ghi âm gây bất lợi là giả mạo (cái gọi là "lợi tức của kẻ nói dối")[15].
Các nghiên cứu về thiên kiến chính trị của LLM đã phát hiện mối tương quan giữa câu trả lời mặc định của ChatGPT với lập trường của Đảng Dân chủ và mối tương quan nghịch với lập trường của Đảng Cộng hòa[16].
Chương 4. Kinh tế
Chương này khảo sát xu hướng trong đầu tư, việc làm, ứng dụng AI doanh nghiệp và tự động hóa[1].
Đầu tư
Xu hướng chung. Tổng đầu tư doanh nghiệp vào AI giảm xuống còn 189,2 tỷ đô la năm 2023 (giảm ~20% so với năm 2022). Tuy nhiên, trong một thập kỷ, khối lượng đầu tư đã tăng mười ba lần. Đầu tư tư nhân giảm năm thứ hai liên tiếp, mặc dù mức giảm ít rõ rệt hơn so với giai đoạn 2021–2022[3].
AI tạo sinh. Đầu tư vào AI tạo sinh đạt 25,2 tỷ đô la — tăng gần chín lần so với năm 2022 và ba mươi lần so với năm 2019. AI tạo sinh chiếm hơn một phần tư tổng đầu tư tư nhân vào AI[3].
Phân bố theo khu vực. Mỹ với mức đầu tư 67,2 tỷ đô la đã vượt Trung Quốc (7,8 tỷ) 8,7 lần và Vương quốc Anh (3,8 tỷ) 17,8 lần. Trong khi đó, đầu tư tư nhân tại Trung Quốc giảm 44,2%, tại EU và Vương quốc Anh giảm 14,1%, còn tại Mỹ tăng 22,1%[3].
Công ty khởi nghiệp. Số lượng công ty AI mới nhận được tài trợ tăng lên 1.812 (tăng 40,6%). Trong lĩnh vực AI tạo sinh, 99 startup mới nhận được tài trợ (so với 56 vào năm 2022)[3].
Thị trường lao động
Tỷ lệ vị trí tuyển dụng liên quan đến AI tại Mỹ giảm từ 2,0% năm 2022 xuống còn 1,6% năm 2023. Xu hướng tương tự được quan sát thấy trên toàn cầu. Sự sụt giảm được giải thích bởi việc giảm tuyển dụng từ các công ty AI lớn và thu hẹp tỷ lệ vị trí kỹ thuật[1].
Sự dịch chuyển của các chuyên gia AI từ học thuật sang công nghiệp tiếp tục tăng tốc: năm 2022, 70,7% người nhận bằng tiến sĩ mới trong AI đã làm việc trong ngành công nghiệp (so với 40,9% năm 2011), và chỉ 20,0% — trong học thuật (so với 41,6%)[1].
Ứng dụng doanh nghiệp
Theo dữ liệu McKinsey, 55% tổ chức sử dụng AI (bao gồm AI tạo sinh) trong ít nhất một đơn vị kinh doanh — tăng từ 50% năm 2022 và 20% năm 2017. Trong đó, 42% tổ chức báo cáo giảm chi phí và 59% — tăng doanh thu nhờ AI[17].
Số lần đề cập AI trong các báo cáo thu nhập của các công ty Fortune 500 đạt 394 (gần 80% tổng số công ty) — tăng đáng kể so với 266 năm 2022. Chủ đề được đề cập thường xuyên nhất (19,7% tổng số cuộc gọi) là AI tạo sinh[1].
Robotics
Năm 2022, đã lắp đặt 553.000 robot công nghiệp — tăng 5,1% so với năm 2021 và hơn gấp ba lần so với năm 2012. Trung Quốc chiếm ưu thế: từ năm 2013, khi nước này vượt qua Nhật Bản, tỷ lệ của Trung Quốc đã tăng từ 20,8% lên 52,4% số lượng lắp đặt toàn cầu vào năm 2022. Tỷ lệ robot cộng tác tăng từ 2,8% năm 2017 lên 9,9% năm 2022[18].
Chương 5. Khoa học và Y học
Chương được đưa vào báo cáo lần đầu tiên, đề cập đến vai trò của AI trong các khám phá khoa học và đổi mới y tế[1].
Thành tựu khoa học năm 2023
AlphaDev (DeepMind) — hệ thống Reinforcement Learning đã phát hiện ra các thuật toán sắp xếp với số lượng lệnh ít hơn các chuẩn mực hiện có của con người. Một số thuật toán được tìm thấy đã được đưa vào thư viện sắp xếp chuẩn C++ (LLVM) — lần cập nhật đầu tiên phần này của thư viện trong hơn mười năm[19].
GraphCast (DeepMind) — hệ thống dự báo thời tiết dựa trên mạng neural đồ thị, cung cấp dự báo 10 ngày trong chưa đầy một phút với độ chính xác vượt qua hệ thống mô hình hóa hàng đầu HRES (Trung tâm Dự báo Thời tiết Hạn vừa Châu Âu)[20].
GNoME (Google DeepMind) — mô hình sử dụng mạng đồ thị để tìm kiếm nhanh hơn các vật liệu chức năng mới, điều này rất quan trọng cho tiến bộ trong lĩnh vực robotics và ngành công nghiệp bán dẫn[21].
Synbot — robot hóa học được điều khiển bởi AI để tổng hợp tự động các phân tử hữu cơ, đạt được hiệu suất phản ứng tương đương hoặc vượt qua các giá trị tham chiếu[22].
FlexiCubes (NVIDIA) — phương pháp tối ưu hóa lưới 3D sử dụng AI để cải thiện chất lượng tạo sinh đối tượng 3D trong đồ họa máy tính[23].
AI trong y học
Kiến thức lâm sàng. Trên benchmark MedQA (đánh giá kiến thức lâm sàng của AI), mô hình GPT-4 Medprompt đạt độ chính xác 90,2% — tăng 22,6 điểm phần trăm so với kết quả tốt nhất năm 2022. Kể từ khi benchmark được tạo ra năm 2019, hiệu suất của AI trên MedQA đã tăng gần gấp ba. Đáng chú ý là GPT-4 Medprompt sử dụng kỹ thuật prompt engineering thay vì fine-tuning, vượt qua các mô hình y tế chuyên biệt[24].
MediTron-70B — LLM y tế mã nguồn mở, đạt 70,2% trên MedQA — kết quả tốt nhất trong số các mô hình mã nguồn mở, mặc dù thấp hơn các chỉ số của các mô hình đóng GPT-4 Medprompt và Med-PaLM 2[25].
Đổi mới y tế. Trong số các hệ thống đáng chú ý năm 2023: SynthSR (cải thiện hình ảnh hóa cấu trúc não từ các lần quét MRI chất lượng thấp), ImmunoSEIRA (cảm biến hồng ngoại AI để chẩn đoán bệnh thoái hóa thần kinh), EVEscape (dự đoán sự tiến hóa của virus để ngăn ngừa đại dịch), AlphaMissense (phân loại các đột biến missense)[1].
Phê duyệt của FDA. Năm 2022, FDA đã phê duyệt 139 thiết bị y tế dựa trên AI — tăng 12,1% so với năm 2021. Kể từ năm 2012, số lượng phê duyệt như vậy đã tăng hơn 45 lần[26].
Chương 6. Giáo dục
Chương này xem xét các xu hướng trong giáo dục về khoa học máy tính và AI[1].
Giáo dục đại học
Số lượng sinh viên tốt nghiệp đại học ngành khoa học máy tính tại Mỹ và Canada tiếp tục tăng. Số lượng thạc sĩ tương đối ổn định, còn số lượng tiến sĩ tăng khiêm tốn. Kể từ năm 2018, số lượng thạc sĩ và tiến sĩ khoa học máy tính đã giảm nhẹ[1].
Tỷ lệ sinh viên quốc tế giảm ở tất cả các cấp giáo dục, đặc biệt rõ rệt ở bậc thạc sĩ. Trên quy mô toàn cầu, số lượng chương trình giáo dục bằng tiếng Anh liên quan đến AI đã tăng gấp ba kể từ năm 2017[1].
ChatGPT trong giáo dục
Theo dữ liệu khảo sát của Walton Foundation, 88% giáo viên và 79% sinh viên cho rằng ChatGPT có tác động tích cực đến quá trình giáo dục. 76% giáo viên và 65% sinh viên cho rằng việc tích hợp ChatGPT vào giảng dạy là quan trọng[27].
Chương 7. Chính sách và Quản trị
Chương này phân tích hoạt động lập pháp và quản lý trong lĩnh vực AI ở cấp độ toàn cầu, Mỹ và châu Âu[1].
Xu hướng toàn cầu
Số lần đề cập AI trong các quy trình lập pháp trên toàn thế giới đạt mức kỷ lục. Có sự dịch chuyển từ các biện pháp thuần túy khuyến khích sang luật hạn chế, cho thấy sự quan tâm ngày càng tăng của các cơ quan quản lý đối với các rủi ro tiềm ẩn của AI[1].
Chủ đề của các luật được thông qua năm 2023 đã mở rộng đáng kể, bao gồm lực lượng vũ trang và an ninh quốc gia, quyền dân sự, thương mại, giáo dục, quan hệ lao động, khoa học và công nghệ[1].
Quản lý tại Mỹ
Số lượng văn bản quy phạm liên quan đến AI đạt 25 vào năm 2023 (tăng 56,3% so với năm 2022). Chủ đề phổ biến nhất là thương mại nước ngoài và tài chính quốc tế. Tỷ lệ các văn bản quy phạm có mức độ liên quan cao và trung bình đến AI tăng so với các năm trước[1].
Sự kiện đáng chú ý của năm 2023 là Sắc lệnh của Tổng thống Biden về AI (Executive Order on AI), nhằm vào việc tạo ra Nguồn lực Nghiên cứu AI Quốc gia (National AI Research Resource) để đảm bảo cơ hội bình đẳng giữa ngành công nghiệp và học thuật[28].
Quản lý tại EU
Tại Liên minh Châu Âu, có xu hướng tương tự là tăng số lượng văn bản quy phạm liên quan đến AI. Thành tựu đáng kể của năm 2023 là sự tiến triển của AI Act — đạo luật toàn diện đầu tiên về AI trên thế giới[1].
Chương 8. Đa dạng
Chương này nghiên cứu sự đa dạng về giới tính và dân tộc trong số các chuyên gia AI. Mặc dù có một số tiến bộ, phụ nữ và các nhóm thiểu số vẫn bị đại diện thiếu đáng kể trong lĩnh vực AI cả trong công nghiệp lẫn học thuật[1].
Chương 9. Dư luận xã hội
Chương này phân tích nhận thức của công chúng về AI dựa trên các cuộc khảo sát quốc tế và dữ liệu mạng xã hội[1].
Các cuộc khảo sát quốc tế
Nhận thức và lo ngại. Theo dữ liệu của Ipsos, 66% người được hỏi (tăng từ 60%) cho rằng AI sẽ ảnh hưởng đáng kể đến cuộc sống của họ trong 3–5 năm tới. Trong đó, 52% bày tỏ lo lắng về các sản phẩm AI (tăng 13 điểm phần trăm so với năm 2022)[4].
Kỳ vọng kinh tế. Chỉ 37% người được hỏi cho rằng AI sẽ cải thiện công việc của họ, 34% — rằng nó sẽ cải thiện nền kinh tế, và 32% — rằng nó sẽ có tác động tích cực đến thị trường lao động[4].
Sự khác biệt nhân khẩu học. Các thế hệ trẻ lạc quan hơn đáng kể: 59% đại diện thế hệ Z cho rằng AI sẽ cải thiện lĩnh vực giải trí, so với 40% thế hệ Baby Boomer. Những người có thu nhập và trình độ học vấn cao hơn cũng lạc quan hơn[1].
Mức độ nhận biết ChatGPT. Theo dữ liệu khảo sát quốc tế của Đại học Toronto, 63% người được hỏi biết về ChatGPT, trong đó khoảng một nửa sử dụng nó ít nhất một lần mỗi tuần[29].
Dữ liệu mạng xã hội
Phân tích của Quid đối với hơn 7 triệu bài đăng trên mạng xã hội năm 2023 cho thấy các mô hình GraphCast và Claude 2.1 nhận được chỉ số tình cảm tích cực cao nhất (net sentiment score). GPT-4 thu hút tỷ lệ sự chú ý lớn nhất trong quý đầu tiên, trong khi đến cuối năm trọng tâm chuyển sang Gemini và Grok[1].
Các mô hình AI đáng chú ý năm 2023
Báo cáo ghi nhận sự xuất hiện của một số mô hình quan trọng[1]:
| Mô hình | Nhà phát triển | Loại | Ngày | Ý nghĩa |
|---|---|---|---|---|
| GPT-4 | OpenAI | LLM, đa phương thức | Tháng 3 năm 2023 | Một trong những LLM mạnh mẽ nhất; dẫn đầu HELM |
| PaLM 2 | LLM | Tháng 5 năm 2023 | Khả năng đa ngôn ngữ nâng cao | |
| Llama 2 | Meta | LLM (mã nguồn mở) | Tháng 7 năm 2023 | Mô hình mã nguồn mở hàng đầu; các phiên bản 7B/13B/70B |
| Claude 2 / 2.1 | Anthropic | LLM | Tháng 7 / Tháng 11 năm 2023 | Cửa sổ ngữ cảnh lên đến 200K token |
| Mistral 7B | Mistral AI | LLM (mã nguồn mở) | Tháng 9 năm 2023 | Mô hình nhỏ gọn hiệu suất cao |
| DALL-E 3 | OpenAI | Tạo sinh hình ảnh | Tháng 10 năm 2023 | Chất lượng cải thiện và tuân theo prompt tốt hơn |
| Gemini / Gemini Ultra | LLM, đa phương thức | Tháng 12 năm 2023 | LLM đầu tiên vượt qua con người trên MMLU | |
| Mixtral 8×7B | Mistral AI | LLM (MoE, mã nguồn mở) | Tháng 12 năm 2023 | Kiến trúc Mixture-of-Experts |
| Midjourney v6 | Midjourney | Tạo sinh hình ảnh | Tháng 12 năm 2023 | Chất lượng cải thiện và prompt trực quan hơn |
| Whisper v3 | OpenAI | Nhận dạng giọng nói | Tháng 11 năm 2023 | Độ chính xác nâng cao, hỗ trợ ngôn ngữ mở rộng |
Phương pháp luận
Báo cáo sử dụng dữ liệu từ nhiều nguồn[1]:
- Ấn phẩm và bằng sáng chế: OpenAlex, WIPO, USPTO, dữ liệu Epoch AI.
- Benchmark: Papers With Code, CRFM (HELM), các bảng xếp hạng chuyên biệt.
- Đầu tư: Quid (Capital IQ, Crunchbase), dữ liệu từ hơn 8 triệu công ty.
- Thị trường lao động: Lightcast, LinkedIn, Stack Overflow.
- Hoạt động doanh nghiệp: McKinsey & Company, Seeking Alpha (earnings calls).
- Robotics: International Federation of Robotics (IFR).
- Quản lý: Federal Register (Mỹ), EUR-Lex (EU), Govini.
- Dư luận xã hội: Ipsos, Pew Research Center, University of Toronto (GPO-AI), Quid (mạng xã hội).
- Giáo dục: CRA Taulbee Survey, Informatics Europe, Studyportals, Code.org, Walton Foundation.
- Y học: FDA, Papers With Code (MedQA).
Các ước tính chi phí huấn luyện mô hình được chuẩn bị cùng với Epoch AI dựa trên phân tích loại và số lượng phần cứng, thời gian huấn luyện và giá thuê đám mây[2].
Nhóm tác giả
Báo cáo được chuẩn bị dưới sự lãnh đạo của đồng giám đốc Ray Perrault và Jack Clark với sự tham gia của đông đảo nhà nghiên cứu và các tổ chức đối tác. AI Index là dự án của Viện HAI Stanford (Human-Centered Artificial Intelligence)[1].
Liên kết
- Stanford HAI — AI Index Report 2024 (toàn văn): https://aiindex.stanford.edu/report/
- Epoch AI — dữ liệu về chi phí huấn luyện và xu hướng tính toán: https://epochai.org/
- Papers With Code — benchmark và bảng xếp hạng: https://paperswithcode.com/
- CRFM HELM — Holistic Evaluation of Language Models: https://crfm.stanford.edu/helm/
- AI Incident Database: https://incidentdatabase.ai/
- International Federation of Robotics: https://ifr.org/
- McKinsey Global Survey on AI: https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
Tài liệu tham khảo
- Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/
- Epoch AI (2023). AI Training Cost Estimates and Compute Trends. https://epochai.org/
- Liang, P. et al. (2022). Holistic Evaluation of Language Models. https://arxiv.org/abs/2211.09110
- Hendrycks, D. et al. (2021). Measuring Massive Multitask Language Understanding. https://arxiv.org/abs/2009.03300
- Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. https://arxiv.org/abs/2311.16502
- Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
- Gandhi, K. et al. (2023). Understanding Social Reasoning in Language Models with Language Models. https://arxiv.org/abs/2306.15448
- Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? https://arxiv.org/abs/2304.15004
- Chen, L. et al. (2023). How Is ChatGPT's Behavior Changing over Time? https://arxiv.org/abs/2307.09009
- Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. https://arxiv.org/abs/2305.16291
- Mankowitz, D. J. et al. (2023). Faster sorting algorithms discovered using deep reinforcement learning. Nature. https://doi.org/10.1038/s41586-023-06004-9
- Lam, R. et al. (2023). Learning skillful medium-range global weather forecasting. Science. https://doi.org/10.1126/science.adi2336
- Merchant, A. et al. (2023). Scaling deep learning for materials discovery. Nature. https://doi.org/10.1038/s41586-023-06735-9
- Ha, T. et al. (2023). AI-driven robotic chemist for autonomous synthesis of organic molecules. Science Advances. https://doi.org/10.1126/sciadv.adj0461
- Shen, T. et al. (2023). Flexible Isosurface Extraction for Gradient-Based Mesh Optimization. ACM Transactions on Graphics. https://doi.org/10.1145/3592430
- Nori, H. et al. (2023). Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine. https://arxiv.org/abs/2311.16452
- Chen, Z. et al. (2023). MEDITRON-70B: Scaling Medical Pretraining for Large Language Models. https://arxiv.org/abs/2311.16079
- Mai, K. T. et al. (2023). Warning: Humans Cannot Reliably Detect Speech Deepfakes. https://arxiv.org/abs/2301.07829
- Motoki, F. et al. (2023). More Human than Human: Measuring ChatGPT Political Bias. https://doi.org/10.1007/s11127-023-01097-2
- McKinsey & Company (2023). The State of AI in 2023: Generative AI's Breakout Year. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
- International Federation of Robotics (2023). World Robotics Report 2023. https://ifr.org/worldrobotics/
- The White House (2023). Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence. https://www.whitehouse.gov/briefing-room/presidential-actions/2023/10/30/executive-order-on-the-safe-secure-and-trustworthy-development-and-use-of-artificial-intelligence/
- Fleming, S. L. et al. (2023). MedAlign: A Clinician-Generated Dataset for Instruction Following With Electronic Medical Records. https://arxiv.org/abs/2308.14089
- Iglesias, J. E. et al. (2023). SynthSR: A public AI tool to turn heterogeneous clinical brain scans into high-resolution T1-weighted images for 3D morphometry. Science Advances. https://doi.org/10.1126/sciadv.add3607
- Cheng, J. et al. (2023). Accurate Proteome-Wide Missense Variant Effect Prediction With AlphaMissense. Science. https://doi.org/10.1126/science.adg7492
Ghi chú
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 Stanford HAI (2024). Artificial Intelligence Index Report 2024. https://aiindex.stanford.edu/report/
- ↑ 2.0 2.1 2.2 Epoch AI (2023). AI Training Cost Estimates. https://epochai.org/
- ↑ 3.0 3.1 3.2 3.3 3.4 Quid (2023). AI Investment Data. https://quid.com/
- ↑ 4.0 4.1 4.2 Ipsos (2023). Global Perceptions of AI Survey. https://www.ipsos.com/
- ↑ Pew Research Center (2023). Public Views on AI. https://www.pewresearch.org/
- ↑ Liang, P. et al. (2022). Holistic Evaluation of Language Models. https://arxiv.org/abs/2211.09110
- ↑ Hendrycks, D. et al. (2021). Measuring Massive Multitask Language Understanding. https://arxiv.org/abs/2009.03300
- ↑ Yue, X. et al. (2023). MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark. https://arxiv.org/abs/2311.16502
- ↑ Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. https://arxiv.org/abs/2311.12022
- ↑ Gandhi, K. et al. (2023). Understanding Social Reasoning in Language Models with Language Models. https://arxiv.org/abs/2306.15448
- ↑ Wang, G. et al. (2023). Voyager: An Open-Ended Embodied Agent with Large Language Models. https://arxiv.org/abs/2305.16291
- ↑ Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? https://arxiv.org/abs/2304.15004
- ↑ Chen, L. et al. (2023). How Is ChatGPT's Behavior Changing over Time? https://arxiv.org/abs/2307.09009
- ↑ AI Incident Database (2023). https://incidentdatabase.ai/
- ↑ Mai, K. T. et al. (2023). Warning: Humans Cannot Reliably Detect Speech Deepfakes. https://arxiv.org/abs/2301.07829
- ↑ Motoki, F. et al. (2023). More Human than Human: Measuring ChatGPT Political Bias. https://doi.org/10.1007/s11127-023-01097-2
- ↑ McKinsey & Company (2023). The State of AI in 2023: Generative AI's Breakout Year. https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai
- ↑ International Federation of Robotics (2023). World Robotics Report 2023. https://ifr.org/worldrobotics/
- ↑ Mankowitz, D. J. et al. (2023). Faster sorting algorithms discovered using deep reinforcement learning. Nature. https://doi.org/10.1038/s41586-023-06004-9
- ↑ Lam, R. et al. (2023). Learning skillful medium-range global weather forecasting. Science. https://doi.org/10.1126/science.adi2336
- ↑ Merchant, A. et al. (2023). Scaling deep learning for materials discovery. Nature. https://doi.org/10.1038/s41586-023-06735-9
- ↑ Ha, T. et al. (2023). AI-driven robotic chemist for autonomous synthesis of organic molecules. Science Advances. https://doi.org/10.1126/sciadv.adj0461
- ↑ Shen, T. et al. (2023). Flexible Isosurface Extraction for Gradient-Based Mesh Optimization. ACM Transactions on Graphics. https://doi.org/10.1145/3592430
- ↑ Nori, H. et al. (2023). Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine. https://arxiv.org/abs/2311.16452
- ↑ Chen, Z. et al. (2023). MEDITRON-70B: Scaling Medical Pretraining for Large Language Models. https://arxiv.org/abs/2311.16079
- ↑ U.S. Food and Drug Administration (2023). Artificial Intelligence and Machine Learning (AI/ML)-Enabled Medical Devices. https://www.fda.gov/medical-devices/software-medical-device-samd/artificial-intelligence-and-machine-learning-aiml-enabled-medical-devices
- ↑ Impact Research / Walton Family Foundation (2023). ChatGPT and Education Survey. https://www.waltonfamilyfoundation.org/
- ↑ The White House (2023). Executive Order on the Safe, Secure, and Trustworthy Development and Use of Artificial Intelligence. https://www.whitehouse.gov/briefing-room/presidential-actions/2023/10/30/executive-order-on-the-safe-secure-and-trustworthy-development-and-use-of-artificial-intelligence/
- ↑ Global Public Opinion on AI Survey, University of Toronto (2023). https://www.mediatechdemocracy.com/