BLOOM (language model) (VI)
BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) — là một mô hình ngôn ngữ lớn (LLM) mã nguồn mở, chứa 176 tỷ tham số. Mô hình được phát triển vào năm 2022 trong khuôn khổ dự án BigScience — một sự hợp tác quốc tế của hơn 1000 nhà nghiên cứu từ 70 quốc gia dưới sự bảo trợ của công ty Hugging Face[1].
BLOOM là một mô hình transformer tự hồi quy, có khả năng tạo ra văn bản mạch lạc bằng 46 ngôn ngữ tự nhiên và 13 ngôn ngữ lập trình. Mô hình được huấn luyện trên siêu máy tính Jean Zay tại Pháp và trở thành một trong những giải pháp thay thế thực sự mở đầu tiên cho các mô hình đóng như GPT-3 của OpenAI[2].
Tiền sử và quá trình phát triển
Sáng kiến BigScience được khởi động vào tháng 5 năm 2021 với mục tiêu dân chủ hóa nghiên cứu trong lĩnh vực AI thông qua việc cộng tác tạo ra một mô hình ngôn ngữ lớn, mở[1]. Vào thời điểm đó, các LLM tiên tiến như GPT-3 được phát triển khép kín trong các công ty lớn, vốn không công bố kiến trúc, dữ liệu huấn luyện và mã nguồn. Dự án BigScience đã tập hợp hơn một nghìn tình nguyện viên là các nhà nghiên cứu từ khắp nơi trên thế giới để tạo ra một mô hình cạnh tranh và hoàn toàn mở.
Dự án nhận được khoản tài trợ về tài nguyên tính toán trên siêu máy tính Jean Zay (IDRIS/CNRS) của Pháp. Quá trình huấn luyện mô hình diễn ra từ ngày 11 tháng 3 đến ngày 6 tháng 7 năm 2022[3]. Quá trình phát triển được thực hiện một cách minh bạch tối đa: nhóm nghiên cứu công bố thông tin về việc lựa chọn dữ liệu, các thiết lập huấn luyện và tổ chức thảo luận công khai, tuân theo hiến chương đạo đức đã được thông qua của dự án.
Kiến trúc và huấn luyện
Kiến trúc mô hình
BLOOM được xây dựng trên kiến trúc transformer tự hồi quy (decoder-only), tương tự mô hình GPT-3[2].
| Tham số | Đặc điểm |
|---|---|
| Loại | Transformer chỉ có bộ giải mã (decoder-only) |
| Tham số | 176 247 271 424 |
| Số lớp (layers) | 70 |
| Đầu attention | 112 |
| Kích thước trạng thái ẩn | 14 336 |
| Độ dài chuỗi | 2048 token |
| Hàm kích hoạt | GeLU; mã hóa vị trí ALiBi |
Mô hình được triển khai dựa trên các framework Megatron-LM và DeepSpeed, được phát triển bởi Nvidia và Microsoft tương ứng, với một số sửa đổi nhằm huấn luyện phân tán hiệu quả[5].
Dữ liệu huấn luyện
BLOOM được huấn luyện trên bộ ngữ liệu văn bản được tạo riêng mang tên ROOTS (The Responsible Open-science Open-collaboration Text Sources). Tổng dung lượng dữ liệu là 1,6 terabyte văn bản đã được làm sạch và loại bỏ trùng lặp (≈366 tỷ token)[6].
Bộ ngữ liệu bao gồm văn bản bằng 59 ngôn ngữ:
- 46 ngôn ngữ tự nhiên, bao gồm tiếng Anh (30% token), tiếng Trung, tiếng Pháp, tiếng Tây Ban Nha, tiếng Ả Rập, cũng như nhiều ngôn ngữ có ít tài nguyên (ví dụ: Chi Tumbuka — 0,00002% token).
- 13 ngôn ngữ lập trình, bao gồm Python, Java, JavaScript và C++.
Bộ dataset đa ngôn ngữ và đa lĩnh vực như vậy được thu thập một cách có chủ đích nhằm làm cho mô hình phù hợp với nhiều cộng đồng ngôn ngữ rộng rãi.
Hiệu suất và ứng dụng
BLOOM thể hiện kết quả cạnh tranh trên nhiều benchmark khác nhau, tương đương với các mô hình có kích thước tương tự như OPT-175B của Meta, bất chấp tính đa ngôn ngữ của nó[2].
Mô hình có khả năng thực hiện nhiều loại nhiệm vụ theo chế độ zero-shot (không cần huấn luyện bổ sung), bao gồm:
- Tạo văn bản theo phong cách cho trước.
- Tóm tắt tài liệu.
- Trả lời câu hỏi theo ngữ cảnh.
- Dịch thuật giữa các ngôn ngữ.
- Tạo mã lập trình đơn giản.
Để cải thiện tính hữu dụng thực tiễn, nhóm BigScience sau đó đã thực hiện fine-tuning đa nhiệm bổ sung cho mô hình, tạo ra phiên bản BLOOMZ, vốn tuân theo hướng dẫn của người dùng chính xác hơn.
Cấp phép và mã nguồn mở
Toàn bộ mô hình BLOOM với 176 tỷ tham số, mã nguồn và dữ liệu của nó đã được công bố vào tháng 7 năm 2022. Mô hình được phân phối theo giấy phép được thiết kế riêng là RAIL (Responsible AI License) v1.0[7].
Giấy phép này cho phép sử dụng và chỉnh sửa mô hình miễn phí, nhưng áp đặt một số hạn chế đối với việc sử dụng trong một số lĩnh vực nhất định. Cụ thể, bị cấm sử dụng BLOOM cho các mục đích vi phạm các chuẩn mực đạo đức của BigScience, chẳng hạn như:
- Giám sát hàng loạt.
- Phân biệt đối xử theo thuật toán.
- Lan truyền thông tin sai lệch.
- Điều khiển vũ khí sát thương.
BLOOM trở thành mô hình AI lớn đầu tiên được phát hành theo giấy phép có điều khoản rõ ràng về sử dụng có trách nhiệm[8].
Tài liệu tham khảo
- Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
- Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
- Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
- Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
- BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
- Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
- Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
- Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.
Ghi chú
- ↑ 1.0 1.1 «BLOOM». BigScience Blog. [1]
- ↑ 2.0 2.1 2.2 Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». arXiv:2211.05100. [2]
- ↑ «Researchers open-source neural network with 176B parameters». SiliconANGLE. [3]
- ↑ «bigscience/bloom». Hugging Face. [4]
- ↑ «The Technology Behind BLOOM Training». Hugging Face Blog. [5]
- ↑ Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». arXiv:2303.03915. [6]
- ↑ «BigScience OpenRAIL-M». BigScience Blog. [7]
- ↑ Heikkilä, M. «BLOOM is the first AI model to be under a...». X. [8]