BLOOM (language model) (RO)
BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) — este un model lingvistic de mari dimensiuni (LLM) cu acces deschis, conținând 176 de miliarde de parametri. A fost dezvoltat în 2022 în cadrul proiectului BigScience — o colaborare internațională a peste 1000 de cercetători din 70 de țări, sub egida companiei Hugging Face[1].
BLOOM este un model transformer autoregresiv, capabil să genereze text coerent în 46 de limbi naturale și 13 limbaje de programare. Modelul a fost antrenat pe supercomputerul Jean Zay din Franța și a devenit una dintre primele alternative cu adevărat deschise față de modelele închise, precum GPT-3 de la OpenAI[2].
Istoric și dezvoltare
Inițiativa BigScience a fost lansată în mai 2021 cu scopul de a democratiza cercetarea în domeniul IA prin crearea colaborativă a unui model lingvistic mare și deschis[1]. La acel moment, LLM-urile de vârf, precum GPT-3, erau dezvoltate în mod închis în cadrul unor companii mari, care nu divulgau arhitectura, datele de antrenament și codul sursă. Proiectul BigScience a reunut peste o mie de cercetători voluntari din întreaga lume pentru a crea un model competitiv și complet deschis.
Proiectul a primit un grant pentru resurse de calcul pe supercomputerul francez Jean Zay (IDRIS/CNRS). Antrenamentul modelului s-a desfășurat între 11 martie și 6 iulie 2022[3]. Dezvoltarea a fost realizată cu maximă transparență: echipa a publicat informații privind selecția datelor, configurațiile de antrenament și a organizat dezbateri publice, respectând carta etică adoptată a proiectului.
Arhitectură și antrenament
Arhitectura modelului
BLOOM este construit pe arhitectura transformer de tip autoregresiv (decoder-only), similară modelului GPT-3[2].
| Parametru | Caracteristică |
|---|---|
| Tip | Transformer decoder-only |
| Parametri | 176 247 271 424 |
| Straturi (layers) | 70 |
| Capete de atenție | 112 |
| Dimensiunea stării ascunse | 14 336 |
| Lungimea secvenței | 2048 tokenuri |
| Funcția de activare | GeLU; codificări poziționale ALiBi |
Modelul a fost implementat pe baza framework-urilor Megatron-LM și DeepSpeed, dezvoltate de Nvidia și, respectiv, Microsoft, cu o serie de modificări pentru antrenamentul distribuit eficient[5].
Datele de antrenament
BLOOM a fost antrenat pe un corpus de date text creat special, denumit ROOTS (The Responsible Open-science Open-collaboration Text Sources). Volumul total al datelor a fost de 1,6 teraocteți de text curățat și deduplicat (≈366 miliarde de tokenuri)[6].
Corpusul include texte în 59 de limbi:
- 46 de limbi naturale, incluzând engleza (30% din tokenuri), chineza, franceza, spaniola, araba, precum și numeroase limbi cu resurse reduse (de exemplu, Chi Tumbuka — 0,00002% din tokenuri).
- 13 limbaje de programare, incluzând Python, Java, JavaScript și C++.
Acest dataset multilingv și multidomeniu a fost colectat în mod intenționat, pentru a face modelul utilizabil pentru o gamă largă de comunități lingvistice.
Performanță și aplicare
BLOOM demonstrează rezultate competitive pe diverse benchmark-uri, comparabile cu modele de dimensiuni similare, precum OPT-175B de la Meta, în ciuda multilingvismului său[2].
Modelul este capabil să execute o gamă largă de sarcini în regim zero-shot (fără antrenament suplimentar), incluzând:
- Generarea de text într-un stil dat.
- Sumarizarea documentelor.
- Răspunsuri la întrebări pe baza contextului.
- Traducerea între limbi.
- Generarea de cod simplu.
Pentru îmbunătățirea utilității practice, echipa BigScience a efectuat ulterior un fine-tuning multisarcină suplimentar al modelului, creând versiunea BLOOMZ, care urmează mai precis instrucțiunile utilizatorului.
Licențiere și acces deschis
Modelul complet BLOOM cu 176 de miliarde de parametri, codul său sursă și datele au fost publicate în iulie 2022. Modelul este distribuit sub licența special elaborată RAIL (Responsible AI License) v1.0[7].
Această licență permite utilizarea gratuită și modificarea modelului, dar impune o serie de restricții privind utilizarea sa în anumite domenii. În special, este interzisă utilizarea BLOOM în scopuri contrare normelor etice BigScience, precum:
- Supravegherea în masă.
- Discriminarea algoritmică.
- Răspândirea dezinformării.
- Controlul armamentului letal.
BLOOM a devenit primul model mare de IA lansat sub o licență cu clauze explicite privind utilizarea responsabilă[8].
Bibliografie
- Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
- Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
- Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
- Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
- BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
- Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
- Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
- Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.
Note
- ↑ 1.0 1.1 «BLOOM». BigScience Blog. [1]
- ↑ 2.0 2.1 2.2 Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». arXiv:2211.05100. [2]
- ↑ «Researchers open-source neural network with 176B parameters». SiliconANGLE. [3]
- ↑ «bigscience/bloom». Hugging Face. [4]
- ↑ «The Technology Behind BLOOM Training». Hugging Face Blog. [5]
- ↑ Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». arXiv:2303.03915. [6]
- ↑ «BigScience OpenRAIL-M». BigScience Blog. [7]
- ↑ Heikkilä, M. «BLOOM is the first AI model to be under a...». X. [8]