PaLM (Pathways Language Model) (VI)
PaLM (Pathways Language Model) — đây là một họ các mô hình ngôn ngữ lớn (LLM) được phát triển bởi công ty Google. Phiên bản đầu tiên của mô hình, được giới thiệu vào tháng 4 năm 2022, chứa 540 tỷ tham số và trở thành một trong những mô hình ngôn ngữ lớn nhất thế giới vào thời điểm đó, thể hiện các khả năng đột phá là kết quả của việc mở rộng quy mô khổng lồ[1].
Nền tảng công nghệ cốt lõi của PaLM là Pathways — một kiến trúc hệ thống Machine Learning mới của Google, cho phép phối hợp hiệu quả các tính toán phân tán trên hàng nghìn chip gia tốc[2]. PaLM trở thành minh chứng đầu tiên ở quy mô lớn của hệ thống này, cho thấy hiệu quả huấn luyện chưa từng có ở quy mô khổng lồ.
Hệ thống Pathways - Nền tảng cho việc mở rộng quy mô
Khái niệm Pathways, được Google giới thiệu vào năm 2021, đề xuất tạo ra một mạng nơ-ron duy nhất có khả năng tổng quát hóa kiến thức hiệu quả cho các lĩnh vực khác nhau và thực hiện hàng nghìn tác vụ cùng một lúc. PaLM là ứng dụng quy mô lớn đầu tiên của hệ thống này: quá trình huấn luyện được song song hóa trên 6144 bộ xử lý chuyên dụng TPU v4, được kết nối thành hai cụm đám mây (TPU v4 Pods)[1].
Vào thời điểm được tạo ra, đây là cấu hình TPU lớn nhất từng được sử dụng để huấn luyện một mô hình duy nhất. Hệ thống đạt được hiệu quả sử dụng phần cứng kỷ lục (57,8% FLOPs), cho phép vượt xa các dự án tiền nhiệm về quy mô và huấn luyện thành công mô hình với hơn nửa nghìn tỷ tham số[3].
Kiến trúc và dữ liệu huấn luyện
Kiến trúc mô hình
PaLM là một mô hình ngôn ngữ dày đặc (không thưa) với kiến trúc «chỉ bộ giải mã» (decoder-only), tương tự như các mô hình thuộc dòng GPT. Kiến trúc này tập trung vào các tác vụ dự đoán token tiếp theo và rất phù hợp để tạo sinh văn bản. Khác với kiến trúc transformer tiêu chuẩn, PaLM sử dụng một số sửa đổi quan trọng để nâng cao hiệu quả[1]:
- Các lớp song song: Các cơ chế attention và các lớp kết nối đầy đủ được tính toán song song, cho phép tăng tốc độ huấn luyện khoảng 15%.
- Kích hoạt SwiGLU: Sử dụng hàm kích hoạt SwiGLU thay vì ReLU tiêu chuẩn, giúp cải thiện đáng kể chất lượng mô hình.
Dữ liệu huấn luyện
PaLM được huấn luyện trên một corpus dữ liệu chất lượng cao với khối lượng 780 tỷ token. Tập dữ liệu có tính đa ngôn ngữ và đa dạng, bao gồm[1]:
- Các tài liệu web và sách chất lượng cao.
- Các bài viết từ Wikipedia.
- Các cuộc hội thoại từ mạng xã hội (50% corpus).
- Mã nguồn từ GitHub (5% corpus).
Khoảng 78% dữ liệu là tiếng Anh, và 22% còn lại là tập đa ngôn ngữ. Để tokenization, một kỹ thuật «không mất mát» đặc biệt được sử dụng, giúp giữ nguyên tất cả các khoảng trắng (quan trọng đối với mã) và phân tách các ký tự Unicode không nhận dạng được thành các byte.
Khả năng và kết quả
Khả năng nổi sinh và few-shot learning
PaLM đã chứng minh rằng việc tăng quy mô mô hình, khối lượng dữ liệu và sức mạnh tính toán có thể dẫn đến các khả năng nổi sinh (xuất hiện bất ngờ). Trên nhiều tác vụ, hiệu suất của mô hình tăng vọt theo cách phi tuyến tính chỉ khi đạt đến quy mô tối đa, cho thấy sự xuất hiện của các khả năng mới chưa từng được quan sát trước đây[3].
Mô hình được đánh giá trong chế độ few-shot learning (không fine-tuning, với một vài ví dụ trong prompt) và vượt qua các mô hình lớn trước đó (như GPT-3 và LaMDA) trên 28 trong số 29 benchmark NLP phổ biến. Trên tập nhiệm vụ phức hợp BIG-bench, PaLM trở thành mô hình đầu tiên có kết quả vượt qua mức trung bình của những người thử nghiệm là con người[1].
Suy luận theo chuỗi suy nghĩ (Chain-of-Thought)
Một trong những thành tựu nổi bật nhất của PaLM là khả năng suy luận logic nhiều bước khi sử dụng kỹ thuật gợi ý «chuỗi suy nghĩ» (chain-of-thought prompting)[1]. Phương pháp này bao gồm việc cung cấp cho mô hình các ví dụ trong đó giải pháp cho một vấn đề được trình bày theo từng bước. Sau khi học từ các ví dụ đó, PaLM có thể tạo ra «chuỗi suy nghĩ» của riêng mình để giải quyết các tác vụ phức tạp mới, chẳng hạn như:
- Bài toán toán học: Trên bài kiểm tra GSM8K (các bài toán cấp tiểu học), PaLM giải quyết được 58% bài toán, vượt qua kết quả state-of-the-art trước đó đạt được bởi mô hình đã được fine-tuning.
- Bài toán lẽ thường: Mô hình có thể tạo ra các giải thích chi tiết cho các bài toán phi hiển nhiên, ví dụ như giải thích các câu đùa chưa từng gặp.
Khả năng này giúp quá trình «suy nghĩ» của mô hình trở nên minh bạch hơn và giống con người hơn.
Tạo sinh mã và đa ngôn ngữ
Mặc dù mã nguồn chỉ chiếm 5% dữ liệu huấn luyện, PaLM đạt được mức độ tương đương với mô hình chuyên biệt OpenAI Codex trên các tác vụ tạo sinh và biến đổi mã. Mô hình cũng thể hiện năng lực mạnh trong các tác vụ đa ngôn ngữ, bao gồm cả dịch thuật[3].
Sự phát triển và các mô hình kế thừa: Họ PaLM
PaLM đã trở thành nền tảng cho một họ các mô hình được Google phát triển.
PaLM 2
Được giới thiệu vào tháng 5 năm 2023, PaLM 2 là người kế thừa hiệu quả hơn và đa ngôn ngữ hơn. Thay vì chạy đua về số lượng tham số, trọng tâm được chuyển sang chất lượng dữ liệu huấn luyện và hiệu quả của kiến trúc. PaLM 2 được huấn luyện trên văn bản bằng hơn 100 ngôn ngữ và thể hiện khả năng cải thiện trong lĩnh vực lập luận, lập trình và dịch thuật[4]. Mô hình được phát hành ở bốn kích thước (từ nhỏ nhất đến lớn nhất): Gecko, Otter, Bison và Unicorn. Biến thể nhỏ gọn nhất (Gecko) đủ nhẹ để hoạt động trên các thiết bị di động trong chế độ ngoại tuyến.
Các phiên bản chuyên biệt
Dựa trên PaLM và PaLM 2, các phiên bản cho các lĩnh vực cụ thể đã được tạo ra:
- Med-PaLM 2: Mô hình chuyên biệt cho y tế. Trở thành hệ thống AI đầu tiên đạt trình độ chuyên gia trên các câu hỏi của kỳ thi cấp phép bác sĩ tại Hoa Kỳ (USMLE)[4].
- Sec-PaLM 2: Mô hình hướng đến an ninh mạng, được huấn luyện để phát hiện các lỗ hổng và phân tích mã độc hại[5].
PaLM-E - Phiên bản đa phương thức
PaLM-E (Pathways Language Model Embodied) — là một mô hình đa phương thức kết hợp mô hình ngôn ngữ PaLM với dữ liệu thị giác từ Vision Transformer (ViT). Điều này cho phép mô hình xử lý cả văn bản lẫn hình ảnh, giải quyết các tác vụ liên quan đến thế giới vật lý, ví dụ như điều khiển robot[6].
Các khía cạnh đạo đức và hạn chế
Các nhà phát triển PaLM nhấn mạnh sự cần thiết phải có cách tiếp cận có trách nhiệm trong việc phát triển các mô hình ngôn ngữ lớn. Bài báo khoa học chính thức đã phân tích các thiên kiến và độc tính có thể có trong văn bản được mô hình hóa. Để đảm bảo tính minh bạch, Google đã công bố thẻ mô hình (Model Card) và phiếu thông tin dữ liệu (Datasheet) cho PaLM, trong đó ghi lại các đặc điểm của dataset, kết quả kiểm thử và các hạn chế đã được xác định[1]. Các biện pháp này phù hợp với các thực hành AI có trách nhiệm hiện đại và nhằm giảm thiểu các rủi ro liên quan đến định kiến và việc tạo sinh nội dung có hại.
Liên kết ngoài
- Blog chính thức của Google về PaLM
- PaLM API dành cho nhà phát triển
Tài liệu tham khảo
- Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
- Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
- Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
- Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
- Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
- Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
- Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
- Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
- Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
- Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.
Ghi chú
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [1]
- ↑ «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [2]
- ↑ 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [3]
- ↑ 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [4]
- ↑ «New AI capabilities that can help address your security challenges». Google Cloud Blog. [5]
- ↑ «PaLM-E: An embodied multimodal language model». Google Research Blog. [6]