BLOOM (language model) (HE)
BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) — היא מודל שפה גדול (LLM) בגישה פתוחה המכיל 176 מיליארד פרמטרים. הוא פותח בשנת 2022 במסגרת פרויקט BigScience — שיתוף פעולה בינלאומי של יותר מ-1000 חוקרים מ-70 מדינות תחת חסות חברת Hugging Face[1].
BLOOM הוא מודל transformer אוטורגרסיבי, המסוגל לייצר טקסט קוהרנטי ב-46 שפות טבעיות ו-13 שפות תכנות. המודל אומן על מחשב-על Jean Zay בצרפת והפך לאחת החלופות הפתוחות הראשונות של ממש למודלים סגורים כגון GPT-3 של OpenAI[2].
רקע ופיתוח
יוזמת BigScience הושקה במאי 2021 במטרה לדמוקרטיזציה של מחקר הבינה המלאכותית באמצעות יצירה משותפת של מודל שפה גדול ופתוח[1]. באותה עת, מודלי LLM מתקדמים כגון GPT-3 פותחו בצורה סגורה בחברות גדולות, אשר לא חשפו את הארכיטקטורה, נתוני האימון והקוד המקורי שלהם. פרויקט BigScience איחד יותר מאלף חוקרים מתנדבים מרחבי העולם ליצירת מודל תחרותי ופתוח לחלוטין.
הפרויקט קיבל מענק למשאבי מחשוב על מחשב-העל הצרפתי Jean Zay (IDRIS/CNRS). אימון המודל התקיים בין ה-11 במרץ לבין ה-6 ביולי 2022[3]. הפיתוח התנהל בשקיפות מרבית: הצוות פרסם מידע על אוסף הנתונים, הגדרות האימון וקיים דיונים ציבוריים בהתאם למגילת האתיקה שאומצה על ידי הפרויקט.
ארכיטקטורה ואימון
ארכיטקטורת המודל
BLOOM בנוי על ארכיטקטורת transformer אוטורגרסיבית (decoder-only), הדומה למודל GPT-3[2].
| פרמטר | מאפיין |
|---|---|
| סוג | Transformer מסוג Decoder-only |
| פרמטרים | 176 247 271 424 |
| שכבות (layers) | 70 |
| ראשי Attention | 112 |
| גודל המצב הנסתר | 14 336 |
| אורך רצף | 2048 טוקנים |
| פונקציית הפעלה | GeLU; קידודי מיקום ALiBi |
המודל מומש על בסיס הframeworks Megatron-LM ו-DeepSpeed, שפותחו על ידי Nvidia ו-Microsoft בהתאמה, עם שורת שינויים לאימון מבוזר יעיל[5].
נתוני אימון
BLOOM אומן על גוף נתוני טקסט שנוצר במיוחד בשם ROOTS (The Responsible Open-science Open-collaboration Text Sources). הנפח הכולל של הנתונים עמד על 1.6 טרה-בייט של טקסט מנוקה ומסונן מכפילויות (≈366 מיליארד טוקנים)[6].
הגוף כולל טקסטים ב-59 שפות:
- 46 שפות טבעיות, כולל אנגלית (30% מהטוקנים), סינית, צרפתית, ספרדית, ערבית, וכן שפות רבות עם משאבים מועטים (לדוגמה, Chi Tumbuka — 0.00002% מהטוקנים).
- 13 שפות תכנות, כולל Python, Java, JavaScript ו-C++.
מאגר הנתונים הרב-לשוני והרב-תחומי הזה נאסף בכוונה תחילה, על מנת להפוך את המודל למתאים למגוון רחב של קהילות לשוניות.
ביצועים ויישומים
BLOOM מדגים תוצאות תחרותיות על מגוון benchmarks, הדומות למודלים בגודל דומה כגון OPT-175B של Meta, למרות הרב-לשוניות שלו[2].
המודל מסוגל לבצע מגוון רחב של משימות במצב zero-shot (ללא אימון נוסף), כולל:
- יצירת טקסט בסגנון נתון.
- סיכום מסמכים.
- מענה על שאלות לפי הקשר.
- תרגום בין שפות.
- יצירת קוד תכנות פשוט.
לשיפור השימושיות המעשית, צוות BigScience ביצע מאוחר יותר fine-tuning רב-משימתי נוסף של המודל, ויצר גרסה בשם BLOOMZ, העוקבת בדיוק רב יותר אחר הוראות המשתמש.
רישוי וגישה פתוחה
מודל ה-BLOOM המלא בן 176 המיליארד פרמטרים, קוד המקור שלו והנתונים פורסמו ביולי 2022. המודל מופץ תחת רישיון שפותח במיוחד: RAIL (Responsible AI License) v1.0[7].
רישיון זה מתיר שימוש חופשי ושינוי במודל, אך מטיל מספר הגבלות על השימוש בו בתחומים מסוימים. בפרט, אסור להשתמש ב-BLOOM למטרות הסותרות את הנורמות האתיות של BigScience, כגון:
- מעקב המוני.
- אפליה אלגוריתמית.
- הפצת מידע כוזב.
- שליטה בנשק קטלני.
BLOOM הפך למודל הבינה המלאכותית הגדול הראשון שהופץ תחת רישיון הכולל הוראות מפורשות לשימוש אחראי[8].
ספרות
- Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
- Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
- Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
- Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
- BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
- Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
- Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
- Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.
הערות
- ↑ 1.0 1.1 «BLOOM». BigScience Blog. [1]
- ↑ 2.0 2.1 2.2 Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». arXiv:2211.05100. [2]
- ↑ «Researchers open-source neural network with 176B parameters». SiliconANGLE. [3]
- ↑ «bigscience/bloom». Hugging Face. [4]
- ↑ «The Technology Behind BLOOM Training». Hugging Face Blog. [5]
- ↑ Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». arXiv:2303.03915. [6]
- ↑ «BigScience OpenRAIL-M». BigScience Blog. [7]
- ↑ Heikkilä, M. «BLOOM is the first AI model to be under a...». X. [8]