BLOOM (language model) (UR)
BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) — یہ ایک بڑا زبان کا ماڈل (LLM) ہے جس تک کھلی رسائی حاصل ہے اور جس میں 176 ارب پیرامیٹر موجود ہیں۔ اسے 2022 میں BigScience منصوبے کے تحت تیار کیا گیا — یہ 70 ممالک کے 1000 سے زائد محققین کا ایک بین الاقوامی تعاون تھا جو Hugging Face کی سرپرستی میں کیا گیا[1]۔
BLOOM ایک خودبینی (autoregressive) transformer ماڈل ہے جو 46 قدرتی زبانوں اور 13 پروگرامنگ زبانوں میں مربوط متن تیار کرنے کی صلاحیت رکھتا ہے۔ یہ ماڈل فرانس میں سپر کمپیوٹر Jean Zay پر تربیت یافتہ ہوا اور OpenAI کے GPT-3 جیسے بند ماڈلوں کے مقابلے میں پہلے حقیقی معنوں میں کھلے متبادلوں میں سے ایک بن گیا[2]۔
پس منظر اور ترقی
BigScience کا منصوبہ مئی 2021 میں مشترکہ طور پر ایک بڑا کھلا زبان کا ماڈل بنا کر AI تحقیق کو جمہوری بنانے کے مقصد سے شروع کیا گیا[1]۔ اس وقت GPT-3 جیسے اعلی درجے کے LLM بڑی کمپنیوں میں خفیہ طور پر تیار کیے جا رہے تھے جو اپنے ڈھانچے، تربیتی ڈیٹا اور سورس کوڈ کو ظاہر نہیں کرتی تھیں۔ BigScience منصوبے نے ایک مسابقتی اور مکمل طور پر کھلا ماڈل بنانے کے لیے دنیا بھر سے ہزار سے زائد رضاکار محققین کو ایک جگہ اکٹھا کیا۔
اس منصوبے کو فرانسیسی سپر کمپیوٹر Jean Zay (IDRIS/CNRS) پر کمپیوٹنگ وسائل کے لیے گرانٹ ملی۔ ماڈل کی تربیت 11 مارچ سے 6 جولائی 2022 تک جاری رہی[3]۔ ترقی کا عمل زیادہ سے زیادہ شفافیت کے ساتھ کیا گیا: ٹیم نے ڈیٹا کے انتخاب، تربیت کی ترتیبات کے بارے میں معلومات شائع کیں اور منصوبے کے قبول شدہ اخلاقی چارٹر کی پیروی کرتے ہوئے عوامی مباحثے کیے۔
فن تعمیر اور تربیت
ماڈل کا فن تعمیر
BLOOM ایک خودبینی (decoder-only) قسم کے transformer کے فن تعمیر پر بنایا گیا ہے جو GPT-3 ماڈل سے ملتا جلتا ہے[2]۔
| پیرامیٹر | خصوصیت |
|---|---|
| قسم | صرف ڈیکوڈر transformer |
| پیرامیٹر | 176 247 271 424 |
| تہیں (layers) | 70 |
| توجہ کے سر (attention heads) | 112 |
| پوشیدہ حالت کا حجم | 14 336 |
| ترتیب کی لمبائی | 2048 token |
| ایکٹیویشن فنکشن | GeLU؛ پوزیشنی کوڈنگ ALiBi |
یہ ماڈل بالترتیب Nvidia اور Microsoft کے تیار کردہ Megatron-LM اور DeepSpeed frameworks کی بنیاد پر نافذ کیا گیا، جس میں مؤثر تقسیم شدہ تربیت کے لیے کئی ترامیم شامل تھیں[5]۔
تربیتی ڈیٹا
BLOOM کو خصوصی طور پر تیار کردہ متنی ڈیٹا کے مجموعے ROOTS (The Responsible Open-science Open-collaboration Text Sources) پر تربیت دی گئی۔ ڈیٹا کا کل حجم صاف شدہ اور ڈی ڈپلی کیٹڈ متن کا 1.6 ٹیرا بائٹ (≈366 ارب token) تھا[6]۔
اس مجموعے میں 59 زبانوں کے متون شامل ہیں:
- 46 قدرتی زبانیں، جن میں انگریزی (30% token)، چینی، فرانسیسی، ہسپانوی، عربی کے علاوہ کم وسائل والی بہت سی زبانیں شامل ہیں (مثلاً Chi Tumbuka — 0.00002% token)۔
- 13 پروگرامنگ زبانیں، جن میں Python، Java، JavaScript اور C++ شامل ہیں۔
اس قسم کا کثیر اللسانی اور کثیر المجالات dataset جان بوجھ کر اس لیے جمع کیا گیا تاکہ ماڈل کو زبانی برادریوں کی ایک وسیع رینج کے لیے موزوں بنایا جا سکے۔
کارکردگی اور استعمال
BLOOM اپنی کثیر اللسانی نوعیت کے باوجود اپنے ہم حجم ماڈلوں جیسے Meta کے OPT-175B کے مقابلے میں مختلف benchmarks پر مسابقتی نتائج ظاہر کرتا ہے[2]۔
یہ ماڈل zero-shot موڈ میں (اضافی تربیت کے بغیر) وسیع کاموں کو انجام دینے کی صلاحیت رکھتا ہے، جن میں شامل ہیں:
- مخصوص انداز میں متن کی تخلیق۔
- دستاویزات کا خلاصہ کرنا۔
- سیاق و سباق کی بنیاد پر سوالوں کے جوابات۔
- زبانوں کے درمیان ترجمہ۔
- سادہ پروگرامنگ کوڈ کی تخلیق۔
عملی افادیت بہتر بنانے کے لیے BigScience ٹیم نے بعد میں ماڈل کا اضافی کثیر المہام fine-tuning کیا اور BLOOMZ ورژن بنایا جو صارف کی ہدایات کو زیادہ درست طریقے سے پیروی کرتا ہے۔
لائسنسنگ اور کھلی رسائی
BLOOM کا مکمل 176 ارب پیرامیٹر والا ماڈل، اس کا سورس کوڈ اور ڈیٹا جولائی 2022 میں شائع کیے گئے۔ یہ ماڈل خصوصی طور پر تیار کردہ لائسنس RAIL (Responsible AI License) v1.0 کے تحت تقسیم کیا جاتا ہے[7]۔
یہ لائسنس ماڈل کے مفت استعمال اور ترمیم کی اجازت دیتا ہے، لیکن اس کے بعض مخصوص شعبوں میں استعمال پر متعدد پابندیاں عائد کرتا ہے۔ خاص طور پر BigScience کے اخلاقی اصولوں کے منافی مقاصد کے لیے BLOOM کا استعمال ممنوع ہے، جیسے:
- بڑے پیمانے پر نگرانی۔
- الگوریتمی امتیاز۔
- غلط معلومات کی اشاعت۔
- مہلک ہتھیاروں کا انتظام۔
BLOOM ذمہ دارانہ استعمال کے واضح شرائط کے ساتھ لائسنس کے تحت جاری ہونے والا پہلا بڑا AI ماڈل بنا[8]۔
کتابیات
- Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
- Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
- Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
- Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
- BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
- Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
- Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
- Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.
حواشی
- ↑ 1.0 1.1 «BLOOM». BigScience Blog. [1]
- ↑ 2.0 2.1 2.2 Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». arXiv:2211.05100. [2]
- ↑ «Researchers open-source neural network with 176B parameters». SiliconANGLE. [3]
- ↑ «bigscience/bloom». Hugging Face. [4]
- ↑ «The Technology Behind BLOOM Training». Hugging Face Blog. [5]
- ↑ Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». arXiv:2303.03915. [6]
- ↑ «BigScience OpenRAIL-M». BigScience Blog. [7]
- ↑ Heikkilä, M. «BLOOM is the first AI model to be under a...». X. [8]