BLOOM (language model) (FA)
BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) — یک مدل زبانی بزرگ (LLM) با دسترسی آزاد است که دارای ۱۷۶ میلیارد پارامتر میباشد. این مدل در سال ۲۰۲۲ در چارچوب پروژه BigScience — همکاری بینالمللی بیش از ۱۰۰۰ پژوهشگر از ۷۰ کشور زیر نظر شرکت Hugging Face — توسعه یافت[1].
BLOOM یک مدل transformer خودبازگشتی است که قادر به تولید متن منسجم به ۴۶ زبان طبیعی و ۱۳ زبان برنامهنویسی است. این مدل بر روی ابررایانه Jean Zay در فرانسه آموزش دیده و به یکی از اولین جایگزینهای واقعاً آزاد برای مدلهای بستهای مانند GPT-3 ساخت OpenAI تبدیل شده است[2].
پیشینه و توسعه
ابتکار BigScience در مه ۲۰۲۱ با هدف دموکراتیزهکردن پژوهش در حوزه هوش مصنوعی از طریق ساخت مشترک یک مدل زبانی بزرگ و آزاد راهاندازی شد[1]. در آن زمان، LLMهای پیشرفتهای مانند GPT-3 بهصورت بسته در شرکتهای بزرگ توسعه مییافتند و معماری، دادههای آموزشی و کد منبع آنها فاش نمیشد. پروژه BigScience بیش از هزار پژوهشگر داوطلب از سراسر جهان را برای ساخت یک مدل رقابتی و کاملاً آزاد گرد هم آورد.
این پروژه گرانتی برای منابع محاسباتی بر روی ابررایانه فرانسوی Jean Zay (IDRIS/CNRS) دریافت کرد. آموزش مدل از ۱۱ مارس تا ۶ جولای ۲۰۲۲ ادامه یافت[3]. توسعه با حداکثر شفافیت انجام شد: تیم اطلاعاتی درباره انتخاب دادهها و تنظیمات آموزشی منتشر کرد و بحثهای عمومی برگزار نمود و منشور اخلاقی پذیرفتهشده پروژه را دنبال کرد.
معماری و آموزش
معماری مدل
BLOOM بر پایه معماری transformer خودبازگشتی (decoder-only) ساخته شده که مشابه مدل GPT-3 است[2].
| پارامتر | مشخصه |
|---|---|
| نوع | Transformer از نوع Decoder-only |
| پارامترها | 176 247 271 424 |
| لایهها (layers) | 70 |
| سرهای توجه (attention heads) | 112 |
| اندازه حالت پنهان | 14 336 |
| طول دنباله | 2048 توکن |
| تابع فعالسازی | GeLU؛ کدگذاریهای موضعی ALiBi |
مدل بر پایه فریمورکهای Megatron-LM و DeepSpeed، که بهترتیب توسط Nvidia و Microsoft توسعه یافتهاند، با تعدادی تغییر برای آموزش توزیعشده کارآمد پیادهسازی شده است[5].
دادههای آموزشی
BLOOM بر روی مجموعه داده متنی ساختهشده بهطور ویژه به نام ROOTS (The Responsible Open-science Open-collaboration Text Sources) آموزش دیده است. حجم کل دادهها ۱٫۶ ترابایت متن پاکسازیشده و حذفتکراریشده (≈۳۶۶ میلیارد توکن) بود[6].
این مجموعه داده شامل متون به ۵۹ زبان است:
- ۴۶ زبان طبیعی، از جمله انگلیسی (۳۰٪ توکنها)، چینی، فرانسوی، اسپانیایی، عربی، و همچنین بسیاری از زبانهای کممنبع (مثلاً Chi Tumbuka — ۰٫۰۰۰۰۲٪ توکنها).
- ۱۳ زبان برنامهنویسی، از جمله Python، Java، JavaScript و C++.
این dataset چندزبانه و چندحوزهای بهعمد گردآوری شد تا مدل برای طیف گستردهای از جوامع زبانی قابل استفاده باشد.
عملکرد و کاربرد
BLOOM نتایج رقابتی بر روی benchmarkهای گوناگون نشان میدهد که با مدلهای هماندازهای مانند OPT-175B ساخت Meta قابل مقایسه است، با وجود ماهیت چندزبانهاش[2].
این مدل قادر است طیف گستردهای از وظایف را در حالت zero-shot (بدون آموزش اضافی) انجام دهد، از جمله:
- تولید متن به سبک مشخص.
- خلاصهسازی اسناد.
- پاسخ به سؤالات بر اساس متن.
- ترجمه میان زبانها.
- تولید کد برنامهنویسی ساده.
برای بهبود سودمندی عملی، تیم BigScience بعداً fine-tuning چندوظیفهای اضافی بر روی مدل انجام داد و نسخهای به نام BLOOMZ ایجاد کرد که دستورالعملهای کاربر را با دقت بیشتری دنبال میکند.
مجوز و دسترسی آزاد
مدل کامل ۱۷۶ میلیارد پارامتری BLOOM، کد منبع و دادههای آن در جولای ۲۰۲۲ منتشر شدند. مدل تحت مجوز ویژهطراحیشده RAIL (Responsible AI License) v1.0 توزیع میشود[7].
این مجوز استفاده و تغییر رایگان مدل را مجاز میداند، اما تعدادی محدودیت بر کاربرد آن در حوزههای خاص اعمال میکند. بهویژه، استفاده از BLOOM برای اهدافی که با هنجارهای اخلاقی BigScience در تضاد است ممنوع میباشد، مانند:
- نظارت گسترده.
- تبعیض الگوریتمی.
- انتشار اطلاعات غلط.
- کنترل تسلیحات کشنده.
BLOOM اولین مدل بزرگ هوش مصنوعی بود که تحت مجوزی با قید صریح استفاده مسئولانه منتشر شد[8].
منابع
- Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
- Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
- Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
- Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
- BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
- Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
- Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
- Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.
یادداشتها
- ↑ 1.0 1.1 «BLOOM». BigScience Blog. [۱]
- ↑ 2.0 2.1 2.2 Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». arXiv:2211.05100. [۲]
- ↑ «Researchers open-source neural network with 176B parameters». SiliconANGLE. [۳]
- ↑ «bigscience/bloom». Hugging Face. [۴]
- ↑ «The Technology Behind BLOOM Training». Hugging Face Blog. [۵]
- ↑ Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». arXiv:2303.03915. [۶]
- ↑ «BigScience OpenRAIL-M». BigScience Blog. [۷]
- ↑ Heikkilä, M. «BLOOM is the first AI model to be under a...». X. [۸]