Stochastic parrot (VI)

From Systems analysis Wiki
Jump to navigation Jump to search

Con vẹt ngẫu nhiên (tiếng Anh: Stochastic parrot) — là một phép ẩn dụ được sử dụng trong lĩnh vực trí tuệ nhân tạo để mô tả các mô hình ngôn ngữ lớn (LLM) như những hệ thống có khả năng kết hợp các hình thức ngôn ngữ một cách hợp lý về mặt thống kê, nhưng lại thiếu sự hiểu biết thực sự về ý nghĩa của chúng[1].

Thuật ngữ này được giới thiệu vào tháng 3 năm 2021 trong bài báo khoa học «On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?» (Về những nguy hiểm của các con vẹt ngẫu nhiên: Liệu các mô hình ngôn ngữ có thể quá lớn không?), được công bố tại hội nghị FAccT. Các tác giả bao gồm Emily M. Bender, Timnit Gebru, Angelina McMillan-Major và Margaret Mitchell[2].

Định nghĩa và khái niệm

Theo các tác giả của bài báo, con vẹt ngẫu nhiên đại diện cho «một hệ thống kết hợp hỗn loạn các chuỗi hình thức ngôn ngữ quan sát được trong dữ liệu huấn luyện khổng lồ của nó, theo thông tin xác suất về cách chúng kết hợp với nhau, nhưng không có bất kỳ liên kết nào với ý nghĩa»[2].

Thuật ngữ này bao gồm hai phần:

  • Ngẫu nhiên (Stochastic) — từ tiếng Hy Lạp cổ στοχαστικός («dựa trên phỏng đoán»), trong toán học hiện đại biểu thị một quá trình được xác định bởi phân phối xác suất ngẫu nhiên[1].
  • Con vẹt (Parrot) — ám chỉ khả năng của loài vẹt trong việc bắt chước lời nói của con người mà không hiểu ý nghĩa của nó[1].

Khái niệm này khẳng định rằng các LLM được huấn luyện để dự đoán từ tiếp theo trong một chuỗi, về bản chất, là các hệ thống tự động hoàn thành phức tạp, thao tác các ký hiệu mà không có quyền truy cập vào ý nghĩa của chúng.

Các luận điểm chính của bài báo «On the Dangers of Stochastic Parrots»

Bài báo xác định bốn loại rủi ro chính liên quan đến việc phát triển các mô hình ngôn ngữ có quy mô quá lớn.

1. Dữ liệu huấn luyện không thể khảo sát toàn diện

Các LLM được huấn luyện trên các tập dữ liệu khổng lồ, không được chú thích, thu thập từ internet (ví dụ: Common Crawl). Các dataset như vậy không thể tránh khỏi việc chứa đựng những thiên kiến, ngôn ngữ độc hại và các quan điểm thống trị gây hại cho các nhóm dễ bị tổn thương. Ví dụ, nội dung internet đại diện không cân xứng cho nam giới da trắng từ các nước phát triển (67% người dùng Reddit tại Mỹ là nam giới)[2].

2. Thiếu sự hiểu biết ngôn ngữ thực sự

Các tác giả lập luận rằng các LLM không có sự hiểu biết thực sự về ngôn ngữ. Họ viện dẫn lý thuyết cho rằng ngôn ngữ là một hệ thống ký hiệu, trong đó hình thức (từ) gắn liền không thể tách rời với ý nghĩa (nội dung). Dữ liệu huấn luyện cho các LLM chỉ chứa hình thức, khiến mô hình không thể tiếp cận ý nghĩa. Do đó, các LLM chỉ đơn thuần là bắt chước ngôn ngữ có nghĩa.

3. Văn bản tổng hợp và những tác hại tiềm tàng

Vì các LLM tạo ra văn bản đúng ngữ pháp và thuyết phục, con người có xu hướng gán ý nghĩa cho chúng và tin tưởng vào chúng. Điều này tạo ra rủi ro lan truyền thông tin sai lệch, ngôn ngữ thù địch và gian lận. Sự bắt chước càng hoàn hảo, nguy cơ con người đánh giá quá cao khả năng của AI và giao phó cho nó các quyết định quan trọng càng cao.

Tầm ảnh hưởng khoa học và tranh cãi xung quanh việc công bố

Bài báo đã trở thành trung tâm của một vụ bê bối lớn tại Google, nơi các đồng tác giả Timnit Gebru và Margaret Mitchell đang làm việc vào thời điểm đó. Vào cuối năm 2020, trong quá trình đánh giá nội bộ, ban lãnh đạo Google đã yêu cầu các tác giả rút bài báo hoặc xóa tên các nhân viên Google khỏi bài[3].

Timnit Gebru, nhà nghiên cứu đạo đức AI hàng đầu, đã từ chối tuân theo yêu cầu này, dẫn đến việc bà bị sa thải khỏi Google vào tháng 12 năm 2020. Vào tháng 2 năm 2021, Margaret Mitchell, người đã lên tiếng ủng hộ Gebru, cũng bị sa thải[4]. Những sự kiện này đã gây ra làn sóng phản ứng rộng rãi trong cộng đồng. Hơn 2200 nhân viên Google và hàng nghìn đại diện của cộng đồng học thuật đã ký một bức thư phản đối, cáo buộc công ty kiểm duyệt khoa học và đàn áp nghiên cứu có thể ảnh hưởng đến lợi ích thương mại của mình[5]. Cuối cùng, bài báo đã được công bố vào tháng 3 năm 2021 tại hội nghị FAccT.

Phản ứng, tranh luận và sự tiến hóa của quan điểm

Phép ẩn dụ «con vẹt ngẫu nhiên» nhanh chóng lan rộng và trở thành điểm trung tâm trong các cuộc tranh luận về bản chất của trí tuệ nhân tạo. Hiệp hội Phương ngữ học Mỹ (ADS) đã chọn «stochastic parrot» là từ của năm trong lĩnh vực AI năm 2023, vượt qua cả «ChatGPT» và «LLM»[1].

Phê bình khái niệm và bằng chứng về sự hiểu biết

Khái niệm này đã bị nhiều nhà nghiên cứu hàng đầu phản bác.

  • Geoffrey Hinton, một trong những «cha đỡ đầu» của học sâu (deep learning), lập luận rằng «để dự đoán chính xác từ tiếp theo, cần phải hiểu câu»[1]. Năm 2023, sau khi rời Google, ông tuyên bố rằng các mô hình lớn đã «hiểu» những gì chúng được dạy và có thể đưa ra kết luận độc lập[6].
  • Khả năng nổi sinh (Emergent Abilities): Các nghiên cứu đã chỉ ra rằng khi đạt đến một quy mô nhất định, các LLM thể hiện sự xuất hiện đột ngột của các khả năng mới, chẳng hạn như giải các bài toán số học, vốn không được lập trình rõ ràng vào chúng[7].
  • Mô hình thế giới nội tại: Một nghiên cứu năm 2022 cho thấy một mô hình được huấn luyện để chơi Othello dựa trên các bản ghi nước đi dạng văn bản đã tự phát hình thành biểu diễn nội tại của bàn cờ, cho thấy sự phát triển của một mô hình trừu tượng về thế giới được mô tả[3].
  • Hiệu suất trên các benchmark: Các mô hình hiện đại như GPT-4 cho kết quả ở mức độ con người (hoặc cao hơn) trong các kỳ thi chuyên môn phức tạp, điều mà một số người cho là không thể thực hiện được nếu không có sự hiểu biết[8].

Sử dụng mang tính châm biếm và diễn ngôn công chúng

Thuật ngữ này trở nên phổ biến đến mức ngay cả Giám đốc điều hành OpenAI Sam Altman cũng sử dụng nó một cách châm biếm, khi viết trên Twitter: «i am a stochastic parrot, and so r u» (tạm dịch: «tôi là một con vẹt ngẫu nhiên, và bạn cũng vậy»). Qua đó, ông ám chỉ rằng lời nói của con người cũng phần lớn là sự dự đoán xác suất về từ tiếp theo, qua đó đùa cợt với những lời chỉ trích nhắm vào AI[1].

Ảnh hưởng đến diễn ngôn khoa học

Phép ẩn dụ «con vẹt ngẫu nhiên» vẫn là trung tâm trong các cuộc tranh luận về khả năng và hạn chế của các LLM. Nó đã giúp định hình vấn đề về việc các mô hình ngôn ngữ thiếu sự hiểu biết thực sự và thu hút sự chú ý đến những rủi ro liên quan đến sự phát triển của chúng. Đồng thời, sự tiến bộ nhanh chóng trong lĩnh vực LLM liên tục buộc phải đánh giá lại phép ẩn dụ này, vì các mô hình mới nhất thể hiện hành vi ngày càng phức tạp hơn, không phù hợp với hình ảnh «con vẹt vô nghĩa». Thuật ngữ này tiếp tục ảnh hưởng đến diễn ngôn khoa học, nhấn mạnh tầm quan trọng của việc phân tích phê phán các khả năng của hệ thống AI và những hệ quả xã hội của chúng[8].

Tài liệu tham khảo

  • Bender, E. M.; Gebru, T.; McMillan-Major, A.; Mitchell, M. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. FAccT 2021.
  • Floridi, L.; Chiriatti, M. (2020). GPT-3: Its Nature, Scope, Limits, and Consequences. Minds & Machines, 30(4), 681-694.
  • Bommasani, R. et al. (2021). On the Opportunities and Risks of Foundation Models. arXiv:2108.07258.
  • Weidinger, L. et al. (2021). Ethical and Social Risks of Harm from Language Models. arXiv:2112.04359.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
  • Perez, E. et al. (2022). Red Teaming Language Models with Language Models. EMNLP 2022.
  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Du, Z. et al. (2024). Understanding Emergent Abilities of Language Models from the Loss Perspective. arXiv:2403.15796.
  • Gerstgrasser, M. et al. (2024). Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data. arXiv:2404.01413.

Ghi chú

  1. 1.0 1.1 1.2 1.3 1.4 1.5 'Stochastic Parrot': A Name for AI That Sounds a Bit Less Intelligent. Mint. [1]
  2. 2.0 2.1 2.2 Bender, Emily M., et al. «On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?». Conference on Fairness, Accountability, and Transparency (FAccT '21). [2]
  3. 3.0 3.1 «Протестующие пчёлы и стохастические попугаи: дайджест публикаций с критикой и поддержкой развития AI». Хабр. [3]
  4. Hao, Karen. «We read the paper that forced Timnit Gebru out of Google. Here's what it says». MIT Technology Review. [4]
  5. Vincent, James. «Timnit Gebru's actual paper may explain why Google ejected her». The Verge. [5]
  6. «Geoffrey Hinton on the promise, risks of artificial intelligence». 60 Minutes - CBS News. [6]
  7. «Stochastic parrot». Wikipedia. [7]
  8. 8.0 8.1 «The debate over understanding in AI's large language models». PMC. [8]