BLOOM (language model) (HU)
BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) — egy nyílt hozzáférésű nagy nyelvi modell (LLM), amely 176 milliárd paramétert tartalmaz. 2022-ben fejlesztették ki a BigScience projekt keretében — egy nemzetközi együttműködés során, amelyben több mint 1000 kutató vett részt 70 országból, a Hugging Face vállalat égisze alatt[1].
A BLOOM egy autoregresszív transformer modell, amely képes összefüggő szöveget generálni 46 természetes nyelven és 13 programozási nyelven. A modellt a franciaországi Jean Zay szuperszámítógépen tanították be, és az egyik első valóban nyílt alternatívává vált a zárt modellek, például az OpenAI GPT-3 modellje mellett[2].
Előzmények és fejlesztés
A BigScience kezdeményezést 2021 májusában indították el azzal a céllal, hogy demokratizálják a mesterséges intelligencia kutatását egy nagy, nyílt nyelvi modell közös fejlesztésén keresztül[1]. Abban az időben az élvonalbeli LLM-eket, mint például a GPT-3, zárt körben fejlesztették nagy vállalatoknál, amelyek nem hozták nyilvánosságra az architektúrát, a tanítási adatokat és a forráskódot. A BigScience projekt több mint ezer önkéntes kutatót tömörített a világ minden tájáról egy versenyképes és teljesen nyílt modell létrehozása érdekében.
A projekt számítási erőforrásokra vonatkozó támogatást kapott a franciaországi Jean Zay szuperszámítógépen (IDRIS/CNRS). A modell betanítása 2022. március 11-től július 6-ig tartott[3]. A fejlesztés a lehető legnagyobb átláthatósággal zajlott: a csapat közzétette az adatkiválasztásról és a tanítási beállításokról szóló információkat, nyilvános vitákat tartott, és követte a projekt elfogadott etikai chartáját.
Architektúra és betanítás
A modell architektúrája
A BLOOM autoregresszív transformer architektúrára (decoder-only) épül, amely hasonló a GPT-3 modell felépítéséhez[2].
| Paraméter | Jellemző |
|---|---|
| Típus | Csak dekóderes transformer |
| Paraméterek | 176 247 271 424 |
| Rétegek (layers) | 70 |
| Figyelemfejek | 112 |
| Rejtett állapot mérete | 14 336 |
| Szekvencia hossza | 2048 token |
| Aktivációs függvény | GeLU; ALiBi pozicionális kódolások |
A modell a Megatron-LM és a DeepSpeed keretrendszerek alapján valósult meg, amelyeket az Nvidia, illetve a Microsoft fejlesztett, számos módosítással a hatékony elosztott betanítás érdekében[5].
Tanítási adatok
A BLOOM-ot egy kifejezetten erre a célra létrehozott szöveges adatkorpuszon, a ROOTS-on (The Responsible Open-science Open-collaboration Text Sources) tanították be. Az adatok teljes mennyisége 1,6 terabájt megtisztított és deduplikált szöveg (≈366 milliárd token)[6].
A korpusz 59 nyelven tartalmaz szövegeket:
- 46 természetes nyelven, köztük angolul (a tokenek 30%-a), kínaiul, franciául, spanyolul, arabul, valamint számos alacsony erőforrású nyelven (például Chi Tumbuka — a tokenek 0,00002%-a).
- 13 programozási nyelven, köztük Python, Java, JavaScript és C++.
Ezt a többnyelvű és többdoménes datasetet szándékosan állították össze, hogy a modell széles körű nyelvi közösségek számára is alkalmazható legyen.
Teljesítmény és alkalmazás
A BLOOM versenyképes eredményeket mutat különféle benchmarkokon, amelyek összehasonlíthatók az azonos méretű modellekével, mint például a Meta OPT-175B modellje, annak ellenére, hogy többnyelvű[2].
A modell képes feladatok széles körét ellátni zero-shot módban (további betanítás nélkül), beleértve:
- Szöveg generálását adott stílusban.
- Dokumentumok összefoglalását.
- Kontextuson alapuló kérdések megválaszolását.
- Nyelvek közötti fordítást.
- Egyszerű programkód generálását.
A gyakorlati hasznosság javítása érdekében a BigScience csapata később elvégzett egy kiegészítő többfeladatos fine-tuning folyamatot a modellen, és létrehozta a BLOOMZ verziót, amely pontosabban követi a felhasználói utasításokat.
Licencelés és nyílt hozzáférés
A teljes, 176 milliárd paraméteres BLOOM modellt, forráskódját és adatait 2022 júliusában tették közzé. A modell a kifejezetten erre a célra kidolgozott RAIL (Responsible AI License) v1.0 licenc alatt terjesztik[7].
Ez a licenc engedélyezi a modell ingyenes használatát és módosítását, de bizonyos területeken korlátozásokat ír elő az alkalmazásra vonatkozóan. Különösen tilos a BLOOM-ot olyan célokra használni, amelyek ellentétesek a BigScience etikai normáival, mint például:
- Tömeges megfigyelés.
- Algoritmikus diszkrimináció.
- Dezinformáció terjesztése.
- Halálos fegyverek irányítása.
A BLOOM volt az első nagy AI modell, amelyet kifejezett felelős használatra vonatkozó kikötéseket tartalmazó licenc alatt adtak ki[8].
Irodalom
- Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
- Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
- Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
- Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
- BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
- Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
- Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
- Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.
Jegyzetek
- ↑ 1.0 1.1 «BLOOM». BigScience Blog. [1]
- ↑ 2.0 2.1 2.2 Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». arXiv:2211.05100. [2]
- ↑ «Researchers open-source neural network with 176B parameters». SiliconANGLE. [3]
- ↑ «bigscience/bloom». Hugging Face. [4]
- ↑ «The Technology Behind BLOOM Training». Hugging Face Blog. [5]
- ↑ Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». arXiv:2303.03915. [6]
- ↑ «BigScience OpenRAIL-M». BigScience Blog. [7]
- ↑ Heikkilä, M. «BLOOM is the first AI model to be under a...». X. [8]