BLOOM (language model) (HI)
BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) — एक बड़ा खुली पहुँच वाला भाषा मॉडल (LLM) है, जिसमें 176 अरब parameters हैं। इसे 2022 में BigScience परियोजना के अंतर्गत विकसित किया गया था — यह Hugging Face की देखरेख में 70 देशों के 1000 से अधिक शोधकर्ताओं का एक अंतर्राष्ट्रीय सहयोग था[1]।
BLOOM एक स्व-प्रतिगामी transformer मॉडल है, जो 46 प्राकृतिक भाषाओं और 13 प्रोग्रामिंग भाषाओं में सुसंगत पाठ उत्पन्न करने में सक्षम है। इस मॉडल को फ्रांस के Jean Zay सुपरकंप्यूटर पर प्रशिक्षित किया गया और यह OpenAI के GPT-3 जैसे बंद मॉडलों के लिए पहली वास्तव में खुली वैकल्पिक मॉडलों में से एक बन गया[2]।
पूर्व इतिहास और विकास
BigScience पहल मई 2021 में एक बड़े खुले भाषा मॉडल के सामूहिक निर्माण द्वारा AI अनुसंधान के लोकतंत्रीकरण के उद्देश्य से शुरू की गई थी[1]। उस समय GPT-3 जैसे अग्रणी LLM बड़ी कंपनियों में बंद रूप से विकसित किए जा रहे थे, जो अपनी architecture, प्रशिक्षण डेटा और स्रोत कोड का खुलासा नहीं करती थीं। BigScience परियोजना ने एक प्रतिस्पर्धी और पूरी तरह से खुले मॉडल बनाने के लिए दुनिया भर से एक हजार से अधिक स्वयंसेवी शोधकर्ताओं को एकजुट किया।
परियोजना को फ्रांसीसी सुपरकंप्यूटर Jean Zay (IDRIS/CNRS) पर कम्प्यूटेशनल संसाधनों के लिए अनुदान मिला। मॉडल का प्रशिक्षण 11 मार्च से 6 जुलाई 2022 तक हुआ[3]। विकास अधिकतम पारदर्शिता के साथ किया गया: टीम ने डेटा चयन, प्रशिक्षण सेटिंग्स के बारे में जानकारी प्रकाशित की और परियोजना के स्वीकृत नैतिक घोषणापत्र का पालन करते हुए सार्वजनिक चर्चाएँ आयोजित कीं।
Architecture और प्रशिक्षण
मॉडल Architecture
BLOOM को GPT-3 के समान स्व-प्रतिगामी प्रकार (decoder-only) की transformer architecture पर बनाया गया है[2]।
| पैरामीटर | विशेषता |
|---|---|
| प्रकार | Decoder-only transformer |
| Parameters | 176 247 271 424 |
| Layers (परतें) | 70 |
| Attention heads | 112 |
| Hidden state का आकार | 14 336 |
| Sequence की लंबाई | 2048 tokens |
| Activation फ़ंक्शन | GeLU; positional encoding ALiBi |
मॉडल को क्रमशः Nvidia और Microsoft द्वारा विकसित Megatron-LM और DeepSpeed frameworks के आधार पर कुशल वितरित प्रशिक्षण के लिए कुछ संशोधनों के साथ लागू किया गया था[5]।
प्रशिक्षण डेटा
BLOOM को विशेष रूप से निर्मित टेक्स्ट डेटा corpus ROOTS (The Responsible Open-science Open-collaboration Text Sources) पर प्रशिक्षित किया गया था। डेटा की कुल मात्रा साफ़ और डुप्लीकेट-मुक्त पाठ के 1.6 टेराबाइट (≈366 अरब tokens) थी[6]।
Corpus में 59 भाषाओं के पाठ शामिल हैं:
- 46 प्राकृतिक भाषाएँ, जिनमें अंग्रेज़ी (30% tokens), चीनी, फ्रेंच, स्पेनिश, अरबी, और कम संसाधन वाली अनेक भाषाएँ (जैसे Chi Tumbuka — 0.00002% tokens) शामिल हैं।
- 13 प्रोग्रामिंग भाषाएँ, जिनमें Python, Java, JavaScript और C++ शामिल हैं।
इस बहुभाषी और बहु-domain dataset को जानबूझकर एकत्र किया गया ताकि मॉडल को भाषाई समुदायों की एक विस्तृत श्रृंखला के लिए उपयुक्त बनाया जा सके।
प्रदर्शन और उपयोग
BLOOM अपनी बहुभाषिकता के बावजूद Meta के OPT-175B जैसे समान आकार के मॉडलों के तुलनीय, विविध benchmarks पर प्रतिस्पर्धी परिणाम प्रदर्शित करता है[2]।
मॉडल zero-shot मोड (अतिरिक्त प्रशिक्षण के बिना) में कार्यों की एक विस्तृत श्रृंखला निष्पादित करने में सक्षम है, जिसमें शामिल हैं:
- निर्धारित शैली में पाठ उत्पन्न करना।
- दस्तावेज़ों का सारांश तैयार करना।
- संदर्भ के आधार पर प्रश्नों के उत्तर देना।
- भाषाओं के बीच अनुवाद।
- सरल प्रोग्राम कोड उत्पन्न करना।
व्यावहारिक उपयोगिता में सुधार के लिए BigScience टीम ने बाद में मॉडल का अतिरिक्त बहु-कार्य fine-tuning किया, जिससे BLOOMZ संस्करण बनाया गया, जो उपयोगकर्ता के निर्देशों का अधिक सटीक रूप से पालन करता है।
लाइसेंसिंग और खुली पहुँच
BLOOM का पूरा 176-अरब पैरामीटर वाला मॉडल, उसका स्रोत कोड और डेटा जुलाई 2022 में प्रकाशित किए गए। मॉडल विशेष रूप से विकसित लाइसेंस RAIL (Responsible AI License) v1.0 के अंतर्गत वितरित किया जाता है[7]।
यह लाइसेंस मॉडल के निःशुल्क उपयोग और संशोधन की अनुमति देता है, लेकिन कुछ क्षेत्रों में इसके उपयोग पर कई प्रतिबंध लगाता है। विशेष रूप से, BLOOM का उपयोग BigScience के नैतिक मानकों के विरुद्ध उद्देश्यों के लिए निषिद्ध है, जैसे:
- सामूहिक निगरानी।
- एल्गोरिदमिक भेदभाव।
- गलत सूचना का प्रसार।
- घातक हथियारों का प्रबंधन।
BLOOM जिम्मेदार उपयोग के स्पष्ट प्रावधानों वाले लाइसेंस के अंतर्गत जारी किया गया पहला बड़ा AI मॉडल बन गया[8]।
साहित्य
- Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
- Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
- Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
- Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
- BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
- Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
- Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
- Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.
टिप्पणियाँ
- ↑ 1.0 1.1 «BLOOM». BigScience Blog. [१]
- ↑ 2.0 2.1 2.2 Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». arXiv:2211.05100. [२]
- ↑ «Researchers open-source neural network with 176B parameters». SiliconANGLE. [३]
- ↑ «bigscience/bloom». Hugging Face. [४]
- ↑ «The Technology Behind BLOOM Training». Hugging Face Blog. [५]
- ↑ Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». arXiv:2303.03915. [६]
- ↑ «BigScience OpenRAIL-M». BigScience Blog. [७]
- ↑ Heikkilä, M. «BLOOM is the first AI model to be under a...». X. [८]