---
title: "BLOOM (language model) (RO)"
source: "https://systems-analysis.info/int/BLOOM_(language_model)_(RO)"
wiki: "systems-analysis.info/int"
article: "BLOOM_(language_model)_(RO)"
language: "ro"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Romanian"
revision_id: 662
wiki_created_at: 2026-09-06T22:37:05Z
wiki_modified_at: 2026-09-06T22:37:05Z
downloaded_at: 2026-09-07T22:41:33Z
---

# BLOOM (language model) (RO)

**BLOOM** (**B**igScience **L**arge **O**pen-science **O**pen-access **M**ultilingual Language Model) — este un model lingvistic de mari dimensiuni (LLM) cu acces deschis, conținând **176 de miliarde** de parametri. A fost dezvoltat în 2022 în cadrul proiectului **BigScience** — o colaborare internațională a peste 1000 de cercetători din 70 de țări, sub egida companiei Hugging Face<sup>[\[1\]](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_note-bloom_blog-1)</sup>.

BLOOM este un model transformer autoregresiv, capabil să genereze text coerent în **46 de limbi naturale** și **13 limbaje de programare**. Modelul a fost antrenat pe supercomputerul Jean Zay din Franța și a devenit una dintre primele alternative cu adevărat deschise față de modelele închise, precum GPT-3 de la OpenAI<sup>[\[2\]](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_note-lescao2022-2)</sup>.

## Istoric și dezvoltare

Inițiativa **BigScience** a fost lansată în mai 2021 cu scopul de a democratiza cercetarea în domeniul IA prin crearea colaborativă a unui model lingvistic mare și deschis<sup>[\[1\]](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_note-bloom_blog-1)</sup>. La acel moment, LLM-urile de vârf, precum GPT-3, erau dezvoltate în mod închis în cadrul unor companii mari, care nu divulgau arhitectura, datele de antrenament și codul sursă. Proiectul BigScience a reunut peste o mie de cercetători voluntari din întreaga lume pentru a crea un model competitiv și complet deschis.

Proiectul a primit un grant pentru resurse de calcul pe supercomputerul francez **Jean Zay** (IDRIS/CNRS). Antrenamentul modelului s-a desfășurat între 11 martie și 6 iulie 2022<sup>[\[3\]](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_note-siliconangle_2022-3)</sup>. Dezvoltarea a fost realizată cu maximă transparență: echipa a publicat informații privind selecția datelor, configurațiile de antrenament și a organizat dezbateri publice, respectând carta etică adoptată a proiectului.

## Arhitectură și antrenament

### Arhitectura modelului

BLOOM este construit pe arhitectura transformer de tip autoregresiv (*decoder-only*), similară modelului GPT-3<sup>[\[2\]](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_note-lescao2022-2)</sup>.

| Parametru                      | Caracteristică                     |
|--------------------------------|------------------------------------|
| **Tip**                        | Transformer decoder-only           |
| **Parametri**                  | 176 247 271 424                    |
| **Straturi (layers)**          | 70                                 |
| **Capete de atenție**          | 112                                |
| **Dimensiunea stării ascunse** | 14 336                             |
| **Lungimea secvenței**         | 2048 tokenuri                      |
| **Funcția de activare**        | GeLU; codificări poziționale ALiBi |

Caracteristici arhitecturale ale BLOOM<sup>[\[4\]](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_note-huggingface_model_card-4)</sup>

Modelul a fost implementat pe baza framework-urilor **Megatron-LM** și **DeepSpeed**, dezvoltate de Nvidia și, respectiv, Microsoft, cu o serie de modificări pentru antrenamentul distribuit eficient<sup>[\[5\]](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_note-tech_behind_bloom-5)</sup>.

### Datele de antrenament

BLOOM a fost antrenat pe un corpus de date text creat special, denumit **ROOTS** (The **R**esponsible **O**pen-science **O**pen-collaboration **T**ext **S**ources). Volumul total al datelor a fost de **1,6 teraocteți** de text curățat și deduplicat (≈366 miliarde de tokenuri)<sup>[\[6\]](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_note-roots_paper-6)</sup>.

Corpusul include texte în **59 de limbi**:

- **46 de limbi naturale**, incluzând engleza (30% din tokenuri), chineza, franceza, spaniola, araba, precum și numeroase limbi cu resurse reduse (de exemplu, Chi Tumbuka — 0,00002% din tokenuri).
- **13 limbaje de programare**, incluzând Python, Java, JavaScript și C++.

Acest dataset multilingv și multidomeniu a fost colectat în mod intenționat, pentru a face modelul utilizabil pentru o gamă largă de comunități lingvistice.

## Performanță și aplicare

BLOOM demonstrează rezultate competitive pe diverse benchmark-uri, comparabile cu modele de dimensiuni similare, precum OPT-175B de la Meta, în ciuda multilingvismului său<sup>[\[2\]](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_note-lescao2022-2)</sup>.

Modelul este capabil să execute o gamă largă de sarcini în regim *zero-shot* (fără antrenament suplimentar), incluzând:

- Generarea de text într-un stil dat.
- Sumarizarea documentelor.
- Răspunsuri la întrebări pe baza contextului.
- Traducerea între limbi.
- Generarea de cod simplu.

Pentru îmbunătățirea utilității practice, echipa BigScience a efectuat ulterior un fine-tuning multisarcină suplimentar al modelului, creând versiunea **BLOOMZ**, care urmează mai precis instrucțiunile utilizatorului.

## Licențiere și acces deschis

Modelul complet BLOOM cu 176 de miliarde de parametri, codul său sursă și datele au fost publicate în iulie 2022. Modelul este distribuit sub licența special elaborată **RAIL (Responsible AI License) v1.0**<sup>[\[7\]](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_note-rail_license-7)</sup>.

Această licență permite utilizarea gratuită și modificarea modelului, dar impune o serie de restricții privind utilizarea sa în anumite domenii. În special, este interzisă utilizarea BLOOM în scopuri contrare normelor etice BigScience, precum:

- Supravegherea în masă.
- Discriminarea algoritmică.
- Răspândirea dezinformării.
- Controlul armamentului letal.

BLOOM a devenit primul model mare de IA lansat sub o licență cu clauze explicite privind utilizarea responsabilă<sup>[\[8\]](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_note-heikkila_2022-8)</sup>.

## Bibliografie

- Hendrycks, D.; Gimpel, K. (2016). *Gaussian Error Linear Units (GELUs)*. arXiv:1606.08415.
- Shoeybi, M.; et al. (2019). *Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism*. arXiv:1909.08053.
- Rajbhandari, S.; et al. (2020). *ZeRO: Memory Optimizations Toward Training Trillion Parameter Models*. arXiv:1910.02054.
- Press, O.; et al. (2021). *Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation*. arXiv:2108.12409.
- Le Scao, T.; et al. (2022). *BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model*. arXiv:2211.05100.
- Muennighoff, N.; et al. (2022). *BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning*. arXiv:2211.01786.
- BigScience Workshop (2022). *BigScience OpenRAIL‑M License v1.0*. Online specification.
- Akiki, C.; et al. (2022). *BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model*. arXiv:2212.04960.
- Yong, Z.‑X.; et al. (2022). *BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting*. arXiv:2212.09535.
- Biderman, S.; et al. (2023). *The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset*. arXiv:2303.03915.

## Note

1.  <span id="cite_note-bloom_blog-1">↑ <sup>[1.0](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_ref-bloom_blog_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_ref-bloom_blog_1-1)</sup> «BLOOM». *BigScience Blog*. <a href="https://bigscience.huggingface.co/blog/bloom" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-lescao2022-2">↑ <sup>[2.0](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_ref-lescao2022_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_ref-lescao2022_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_ref-lescao2022_2-2)</sup> Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». *arXiv:2211.05100*. <a href="https://arxiv.org/abs/2211.05100" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-siliconangle_2022-3">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_ref-siliconangle_2022_3-0) «Researchers open-source neural network with 176B parameters». *SiliconANGLE*. <a href="https://siliconangle.com/2022/07/12/researchers-open-source-neural-network-176b-parameters/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-huggingface_model_card-4">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_ref-huggingface_model_card_4-0) «bigscience/bloom». *Hugging Face*. <a href="https://huggingface.co/bigscience/bloom" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-tech_behind_bloom-5">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_ref-tech_behind_bloom_5-0) «The Technology Behind BLOOM Training». *Hugging Face Blog*. <a href="https://huggingface.co/blog/bloom-megatron-deepspeed" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-roots_paper-6">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_ref-roots_paper_6-0) Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». *arXiv:2303.03915*. <a href="https://arxiv.org/abs/2303.03915" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-rail_license-7">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_ref-rail_license_7-0) «BigScience OpenRAIL-M». *BigScience Blog*. <a href="https://bigscience.huggingface.co/blog/bigscience-openrail-m" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-heikkila_2022-8">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(RO)#cite_ref-heikkila_2022_8-0) Heikkilä, M. «BLOOM is the first AI model to be under a...». *X*. <a href="https://mobile.twitter.com/Melissahei/status/1546870957402427393" class="external autonumber" rel="nofollow">[8]</a></span>
