BLOOM (language model) (TH)
BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) — คือโมเดลภาษาขนาดใหญ่ (LLM) แบบเปิดสาธารณะ ที่มี 176 พันล้าน พารามิเตอร์ โมเดลนี้ถูกพัฒนาขึ้นในปี ค.ศ. 2022 ภายใต้โครงการ BigScience ซึ่งเป็นความร่วมมือระหว่างประเทศของนักวิจัยกว่า 1,000 คนจาก 70 ประเทศ ภายใต้การดูแลของบริษัท Hugging Face[1]
BLOOM เป็น autoregressive transformer model ที่สามารถสร้างข้อความที่ต่อเนื่องได้ใน 46 ภาษาธรรมชาติ และ 13 ภาษาโปรแกรม โมเดลนี้ถูกฝึกบนซูเปอร์คอมพิวเตอร์ Jean Zay ในประเทศฝรั่งเศส และกลายเป็นหนึ่งในทางเลือกแบบเปิดแห่งแรกที่แท้จริงสำหรับโมเดลแบบปิด เช่น GPT-3 จาก OpenAI[2]
ประวัติความเป็นมาและการพัฒนา
โครงการริเริ่ม BigScience ถูกเปิดตัวในเดือนพฤษภาคม ค.ศ. 2021 โดยมีเป้าหมายเพื่อทำให้การวิจัยด้าน AI เป็นประชาธิปไตยผ่านการสร้างโมเดลภาษาขนาดใหญ่แบบเปิดร่วมกัน[1] ในขณะนั้น LLM ชั้นนำอย่าง GPT-3 ถูกพัฒนาแบบปิดในบริษัทขนาดใหญ่ที่ไม่เปิดเผยสถาปัตยกรรม ข้อมูลการฝึก และซอร์สโค้ด โครงการ BigScience รวบรวมอาสาสมัครนักวิจัยกว่าพันคนจากทั่วโลกเพื่อสร้างโมเดลที่มีประสิทธิภาพสูงและเปิดเผยทั้งหมด
โครงการได้รับทุนสำหรับทรัพยากรการคำนวณบนซูเปอร์คอมพิวเตอร์ Jean Zay ของฝรั่งเศส (IDRIS/CNRS) การฝึกโมเดลดำเนินการตั้งแต่วันที่ 11 มีนาคม ถึง 6 กรกฎาคม ค.ศ. 2022[3] การพัฒนาดำเนินไปอย่างโปร่งใสสูงสุด โดยทีมงานเผยแพร่ข้อมูลเกี่ยวกับการคัดเลือกข้อมูล การตั้งค่าการฝึก และจัดการอภิปรายสาธารณะตามกฎบัตรจริยธรรมของโครงการ
สถาปัตยกรรมและการฝึก
สถาปัตยกรรมของโมเดล
BLOOM สร้างขึ้นบนสถาปัตยกรรม transformer แบบ autoregressive (decoder-only) ซึ่งคล้ายคลึงกับโมเดล GPT-3[2]
| พารามิเตอร์ | ลักษณะ |
|---|---|
| ประเภท | Decoder-only transformer |
| พารามิเตอร์ | 176 247 271 424 |
| เลเยอร์ (layers) | 70 |
| หัว attention | 112 |
| ขนาด hidden state | 14 336 |
| ความยาวลำดับ | 2048 token |
| ฟังก์ชัน activation | GeLU; การเข้ารหัสตำแหน่ง ALiBi |
โมเดลถูกพัฒนาบนพื้นฐานของเฟรมเวิร์ก Megatron-LM และ DeepSpeed ซึ่งพัฒนาโดย Nvidia และ Microsoft ตามลำดับ พร้อมด้วยการปรับแต่งหลายอย่างเพื่อการฝึกแบบกระจายที่มีประสิทธิภาพ[5]
ข้อมูลการฝึก
BLOOM ถูกฝึกบนคลังข้อมูลข้อความที่สร้างขึ้นเป็นพิเศษชื่อ ROOTS (The Responsible Open-science Open-collaboration Text Sources) ปริมาณข้อมูลทั้งหมดมี 1.6 เทราไบต์ ของข้อความที่ผ่านการทำความสะอาดและกำจัดข้อมูลซ้ำ (≈366 พันล้าน token)[6]
คลังข้อมูลประกอบด้วยข้อความใน 59 ภาษา:
- 46 ภาษาธรรมชาติ รวมถึงภาษาอังกฤษ (30% ของ token) ภาษาจีน ภาษาฝรั่งเศส ภาษาสเปน ภาษาอาหรับ และภาษาที่มีทรัพยากรน้อยจำนวนมาก (เช่น Chi Tumbuka — 0.00002% ของ token)
- 13 ภาษาโปรแกรม รวมถึง Python, Java, JavaScript และ C++
dataset ที่เป็นพหุภาษาและพหุโดเมนเช่นนี้ถูกรวบรวมโดยเจตนาเพื่อให้โมเดลเหมาะสำหรับชุมชนภาษาที่หลากหลาย
ประสิทธิภาพและการประยุกต์ใช้
BLOOM แสดงผลลัพธ์ที่มีความสามารถแข่งขันได้บน benchmark ที่หลากหลาย ซึ่งเทียบได้กับโมเดลที่มีขนาดใกล้เคียงกัน เช่น OPT-175B จาก Meta แม้จะมีความสามารถด้านพหุภาษา[2]
โมเดลสามารถทำงานได้หลากหลายในโหมด zero-shot (โดยไม่ต้องฝึกเพิ่มเติม) รวมถึง:
- การสร้างข้อความในสไตล์ที่กำหนด
- การสรุปเอกสาร
- การตอบคำถามตามบริบท
- การแปลระหว่างภาษา
- การสร้างโค้ดโปรแกรมอย่างง่าย
เพื่อปรับปรุงประโยชน์ในทางปฏิบัติ ทีม BigScience ได้ดำเนินการ fine-tuning แบบหลายงาน (fine-tuning) เพิ่มเติมในภายหลัง โดยสร้างเวอร์ชัน BLOOMZ ซึ่งปฏิบัติตามคำสั่งของผู้ใช้ได้แม่นยำยิ่งขึ้น
การออกใบอนุญาตและการเข้าถึงแบบเปิด
โมเดล BLOOM ขนาด 176 พันล้านพารามิเตอร์ ซอร์สโค้ด และข้อมูลถูกเผยแพร่ในเดือนกรกฎาคม ค.ศ. 2022 โมเดลเผยแพร่ภายใต้ใบอนุญาตที่ออกแบบขึ้นเป็นพิเศษชื่อ RAIL (Responsible AI License) v1.0[7]
ใบอนุญาตนี้อนุญาตให้ใช้และแก้ไขโมเดลได้ฟรี แต่กำหนดข้อจำกัดหลายประการเกี่ยวกับการใช้ในบางพื้นที่ โดยเฉพาะอย่างยิ่ง ห้ามใช้ BLOOM เพื่อวัตถุประสงค์ที่ขัดต่อบรรทัดฐานทางจริยธรรมของ BigScience เช่น:
- การสอดแนมมวลชน
- การเลือกปฏิบัติโดยใช้อัลกอริทึม
- การเผยแพร่ข้อมูลบิดเบือน
- การควบคุมอาวุธที่ทำให้เสียชีวิต
BLOOM กลายเป็นโมเดล AI ขนาดใหญ่รุ่นแรกที่เผยแพร่ภายใต้ใบอนุญาตที่มีข้อกำหนดชัดเจนเกี่ยวกับการใช้งานอย่างมีความรับผิดชอบ[8]
เอกสารอ้างอิง
- Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
- Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
- Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
- Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
- BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
- Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
- Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
- Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.
หมายเหตุ
- ↑ 1.0 1.1 «BLOOM». BigScience Blog. [1]
- ↑ 2.0 2.1 2.2 Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». arXiv:2211.05100. [2]
- ↑ «Researchers open-source neural network with 176B parameters». SiliconANGLE. [3]
- ↑ «bigscience/bloom». Hugging Face. [4]
- ↑ «The Technology Behind BLOOM Training». Hugging Face Blog. [5]
- ↑ Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». arXiv:2303.03915. [6]
- ↑ «BigScience OpenRAIL-M». BigScience Blog. [7]
- ↑ Heikkilä, M. «BLOOM is the first AI model to be under a...». X. [8]