BLOOM (language model) — بلوم
BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) — هو نموذج لغوي كبير (LLM) مفتوح الوصول، يحتوي على 176 مليار مُعلَمة (parameter). تم تطويره في عام 2022 ضمن مشروع BigScience — وهو تعاون دولي يضم أكثر من 1000 باحث من 70 دولة تحت رعاية شركة Hugging Face[1].
يُعد BLOOM نموذج محولات (transformer) ذاتي الانحدار (autoregressive)، قادر على توليد نصوص متماسكة بـ 46 لغة طبيعية و13 لغة برمجة. تم تدريب النموذج على الحاسوب الفائق "جان زاي" (Jean Zay) في فرنسا، وأصبح أحد أوائل البدائل المفتوحة الحقيقية للنماذج المغلقة مثل GPT-3 من شركة OpenAI[2].
الخلفية والتطوير
أُطلقت مبادرة BigScience في مايو 2021 بهدف إضفاء الطابع الديمقراطي على أبحاث الذكاء الاصطناعي من خلال الإنشاء التعاوني لنموذج لغوي كبير ومفتوح[1]. في ذلك الوقت، كانت النماذج اللغوية الكبيرة المتقدمة مثل GPT-3 تُطوَّر بشكل مغلق في الشركات الكبرى التي لم تكشف عن بنيتها المعمارية أو بيانات تدريبها أو شفرتها المصدرية. جمع مشروع BigScience أكثر من ألف باحث متطوع من جميع أنحاء العالم لإنشاء نموذج تنافسي ومفتوح بالكامل.
حصل المشروع على منحة للموارد الحاسوبية على الحاسوب الفائق الفرنسي Jean Zay (IDRIS/CNRS). جرى تدريب النموذج في الفترة من 11 مارس إلى 6 يوليو 2022[3]. تم التطوير بأقصى قدر من الشفافية، حيث نشر الفريق معلومات حول اختيار البيانات وإعدادات التدريب وأجرى مناقشات عامة، ملتزماً بالميثاق الأخلاقي المعتمد للمشروع.
البنية المعمارية والتدريب
البنية المعمارية للنموذج
يعتمد BLOOM على بنية محولات (transformer) من النوع ذاتي الانحدار (decoder-only)، وهي مشابهة لبنية نموذج GPT-3[2].
| المعلَمة | الخاصية |
|---|---|
| النوع | محول يعتمد على المفكك فقط (Decoder-only transformer) |
| المعلَمات | 176,247,271,424 |
| الطبقات (layers) | 70 |
| رؤوس الانتباه | 112 |
| حجم الحالة المخفية | 14,336 |
| طول التسلسل | 2048 رمزًا |
| دالة التنشيط | GeLU؛ ترميزات موضعية ALiBi |
تم تنفيذ النموذج باستخدام أطري العمل Megatron-LM وDeepSpeed، اللذين طورتهما Nvidia وMicrosoft على التوالي، مع عدد من التعديلات لتحقيق تدريب موزع فعال[5].
بيانات التدريب
تم تدريب BLOOM على مجموعة بيانات نصية أُنشئت خصيصًا تُدعى ROOTS (The Responsible Open-science Open-collaboration Text Sources). بلغ الحجم الإجمالي للبيانات 1.6 تيرابايت من النصوص المنقحة والمزالة التكرار (حوالي 366 مليار رمز)[6].
تتضمن مجموعة البيانات نصوصًا بـ 59 لغة:
- 46 لغة طبيعية، بما في ذلك الإنجليزية (30% من الرموز)، والصينية، والفرنسية، والإسبانية، والعربية، بالإضافة إلى العديد من اللغات ذات الموارد المحدودة (مثل لغة تشي تومبوكا Chi Tumbuka - 0.00002% من الرموز).
- 13 لغة برمجة، بما في ذلك Python وJava وJavaScript وC++.
جُمعت مجموعة البيانات متعددة اللغات والمجالات هذه بشكل مقصود لجعل النموذج صالحًا للاستخدام من قبل مجموعة واسعة من المجتمعات اللغوية.
الأداء والتطبيقات
يُظهر BLOOM نتائج تنافسية في مختلف اختبارات الأداء (benchmarks)، مقارنةً بالنماذج ذات الحجم المماثل مثل OPT-175B من شركة Meta، على الرغم من طبيعته متعددة اللغات[2].
النموذج قادر على أداء مجموعة واسعة من المهام في وضع zero-shot (بدون تدريب إضافي)، بما في ذلك:
- توليد النصوص بأسلوب محدد.
- تلخيص المستندات.
- الإجابة على الأسئلة بناءً على السياق.
- الترجمة بين اللغات.
- توليد أكواد برمجية بسيطة.
لتحسين فائدته العملية، أجرى فريق BigScience لاحقًا عملية ضبط دقيق (fine-tuning) متعددة المهام للنموذج، مما أدى إلى إنشاء إصدار BLOOMZ، الذي يتبع تعليمات المستخدم بدقة أكبر.
الترخيص والوصول المفتوح
تم نشر نموذج BLOOM الكامل الذي يحتوي على 176 مليار معلمة، بالإضافة إلى شفرته المصدرية وبياناته، في يوليو 2022. يُوزَّع النموذج بموجب ترخيص مُصمَّم خصيصًا وهو RAIL (Responsible AI License) v1.0[7].
يسمح هذا الترخيص بالاستخدام والتعديل المجاني للنموذج، ولكنه يفرض بعض القيود على تطبيقه في مجالات معينة. على وجه الخصوص، يُحظر استخدام BLOOM لأغراض تتعارض مع المعايير الأخلاقية لمشروع BigScience، مثل:
- المراقبة الجماعية.
- التمييز الخوارزمي.
- نشر المعلومات المضللة.
- التحكم في الأسلحة الفتاكة.
أصبح BLOOM أول نموذج ذكاء اصطناعي كبير يُصدر بموجب ترخيص يتضمن شروطًا صريحة حول الاستخدام المسؤول[8].
المراجع
- Hendrycks, D.; Gimpel, K. (206). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
- Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
- Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
- Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
- BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
- Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
- Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
- Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.
ملاحظات
- ↑ 1.0 1.1 «BLOOM». BigScience Blog. [١]
- ↑ 2.0 2.1 2.2 Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». arXiv:2211.05100. [٢]
- ↑ «Researchers open-source neural network with 176B parameters». SiliconANGLE. [٣]
- ↑ «bigscience/bloom». Hugging Face. [٤]
- ↑ «The Technology Behind BLOOM Training». Hugging Face Blog. [٥]
- ↑ Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». arXiv:2303.03915. [٦]
- ↑ «BigScience OpenRAIL-M». BigScience Blog. [٧]
- ↑ Heikkilä, M. «BLOOM is the first AI model to be under a...». X. [٨]