---
title: "BLOOM (language model) (NL)"
source: "https://systems-analysis.info/int/BLOOM_(language_model)_(NL)"
wiki: "systems-analysis.info/int"
article: "BLOOM_(language_model)_(NL)"
language: "nl"
categories:
  - "Category:Dutch"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 660
wiki_created_at: 2026-09-06T22:37:04Z
wiki_modified_at: 2026-09-06T22:37:04Z
downloaded_at: 2026-09-07T22:41:32Z
---

# BLOOM (language model) (NL)

**BLOOM** (**B**igScience **L**arge **O**pen-science **O**pen-access **M**ultilingual Language Model) — is een grote taalmodel (LLM) met open toegang, bestaande uit **176 miljard** parameters. Het werd ontwikkeld in 2022 in het kader van het project **BigScience** — een internationale samenwerking van meer dan 1000 onderzoekers uit 70 landen onder auspiciën van het bedrijf Hugging Face<sup>[\[1\]](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_note-bloom_blog-1)</sup>.

BLOOM is een autogressief transformer-model dat in staat is samenhangende tekst te genereren in **46 natuurlijke talen** en **13 programmeertalen**. Het model werd getraind op de supercomputer Jean Zay in Frankrijk en werd een van de eerste werkelijk open alternatieven voor gesloten modellen zoals GPT-3 van OpenAI<sup>[\[2\]](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_note-lescao2022-2)</sup>.

## Voorgeschiedenis en ontwikkeling

Het initiatief **BigScience** werd in mei 2021 gelanceerd met als doel de democratisering van AI-onderzoek door middel van het gezamenlijk creëren van een groot open taalmodel<sup>[\[1\]](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_note-bloom_blog-1)</sup>. Op dat moment werden de meest geavanceerde LLM's, zoals GPT-3, in beslotenheid ontwikkeld door grote bedrijven die de architectuur, trainingsdata en broncode niet vrijgaven. Het project BigScience bracht meer dan duizend vrijwillige onderzoekers van over de hele wereld samen om een concurrerend en volledig open model te bouwen.

Het project ontving een subsidie voor rekencapaciteit op de Franse supercomputer **Jean Zay** (IDRIS/CNRS). De training van het model vond plaats van 11 maart tot 6 juli 2022<sup>[\[3\]](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_note-siliconangle_2022-3)</sup>. De ontwikkeling verliep zo transparant mogelijk: het team publiceerde informatie over de dataselectie, trainingsparameters en organiseerde publieke discussies in overeenstemming met het aangenomen ethisch handvest van het project.

## Architectuur en training

### Architectuur van het model

BLOOM is gebouwd op een autogressieve transformer-architectuur (*decoder-only*), vergelijkbaar met het model GPT-3<sup>[\[2\]](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_note-lescao2022-2)</sup>.

| Parameter                      | Kenmerk                            |
|--------------------------------|------------------------------------|
| **Type**                       | Decoder-only transformer           |
| **Parameters**                 | 176 247 271 424                    |
| **Lagen (layers)**             | 70                                 |
| **Attention-koppen**           | 112                                |
| **Grootte verborgen toestand** | 14 336                             |
| **Sequentielengte**            | 2048 tokens                        |
| **Activeringsfunctie**         | GeLU; positionele coderingen ALiBi |

Architectuurkenmerken van BLOOM<sup>[\[4\]](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_note-huggingface_model_card-4)</sup>

Het model werd geïmplementeerd op basis van de frameworks **Megatron-LM** en **DeepSpeed**, ontwikkeld door respectievelijk Nvidia en Microsoft, met een aantal aanpassingen voor efficiënte gedistribueerde training<sup>[\[5\]](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_note-tech_behind_bloom-5)</sup>.

### Trainingsdata

BLOOM werd getraind op het speciaal samengestelde tekstcorpus **ROOTS** (The **R**esponsible **O**pen-science **O**pen-collaboration **T**ext **S**ources). Het totale datavolume bedroeg **1,6 terabyte** aan gereinigde en gededupliceerde tekst (≈366 miljard tokens)<sup>[\[6\]](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_note-roots_paper-6)</sup>.

Het corpus omvat teksten in **59 talen**:

- **46 natuurlijke talen**, waaronder Engels (30% van de tokens), Chinees, Frans, Spaans, Arabisch, en ook tal van talen met weinig beschikbare middelen (bijvoorbeeld Chi Tumbuka — 0,00002% van de tokens).
- **13 programmeertalen**, waaronder Python, Java, JavaScript en C++.

Deze meertalige en multi-domein dataset werd bewust samengesteld om het model bruikbaar te maken voor een breed scala aan taalgemeenschappen.

## Prestaties en toepassingen

BLOOM behaalt concurrerende resultaten op uiteenlopende benchmarks, vergelijkbaar met modellen van vergelijkbare omvang zoals OPT-175B van Meta, ondanks zijn meertaligheid<sup>[\[2\]](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_note-lescao2022-2)</sup>.

Het model is in staat een breed scala aan taken uit te voeren in *zero-shot*-modus (zonder aanvullende training), waaronder:

- Het genereren van tekst in een gewenste stijl.
- Het samenvatten van documenten.
- Het beantwoorden van vragen op basis van context.
- Vertaling tussen talen.
- Het genereren van eenvoudige programmacode.

Ter verbetering van de praktische bruikbaarheid voerde het BigScience-team later aanvullende multi-taak fine-tuning uit op het model, waarmee de versie **BLOOMZ** werd gecreëerd, die nauwkeuriger de instructies van de gebruiker opvolgt.

## Licentie en open toegang

Het volledige BLOOM-model met 176 miljard parameters, de broncode en de data werden in juli 2022 gepubliceerd. Het model wordt verspreid onder de speciaal ontwikkelde licentie **RAIL (Responsible AI License) v1.0**<sup>[\[7\]](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_note-rail_license-7)</sup>.

Deze licentie staat gratis gebruik en aanpassing van het model toe, maar legt een aantal beperkingen op aan het gebruik ervan in bepaalde domeinen. In het bijzonder is het verboden BLOOM te gebruiken voor doeleinden die in strijd zijn met de ethische normen van BigScience, zoals:

- Massatoezicht.
- Algoritmische discriminatie.
- Verspreiding van desinformatie.
- Aansturing van dodelijke wapensystemen.

BLOOM werd het eerste grote AI-model dat werd uitgebracht onder een licentie met expliciete bepalingen voor verantwoord gebruik<sup>[\[8\]](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_note-heikkila_2022-8)</sup>.

## Literatuur

- Hendrycks, D.; Gimpel, K. (2016). *Gaussian Error Linear Units (GELUs)*. arXiv:1606.08415.
- Shoeybi, M.; et al. (2019). *Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism*. arXiv:1909.08053.
- Rajbhandari, S.; et al. (2020). *ZeRO: Memory Optimizations Toward Training Trillion Parameter Models*. arXiv:1910.02054.
- Press, O.; et al. (2021). *Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation*. arXiv:2108.12409.
- Le Scao, T.; et al. (2022). *BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model*. arXiv:2211.05100.
- Muennighoff, N.; et al. (2022). *BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning*. arXiv:2211.01786.
- BigScience Workshop (2022). *BigScience OpenRAIL‑M License v1.0*. Online specification.
- Akiki, C.; et al. (2022). *BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model*. arXiv:2212.04960.
- Yong, Z.‑X.; et al. (2022). *BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting*. arXiv:2212.09535.
- Biderman, S.; et al. (2023). *The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset*. arXiv:2303.03915.

## Noten

1.  <span id="cite_note-bloom_blog-1">↑ <sup>[1.0](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_ref-bloom_blog_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_ref-bloom_blog_1-1)</sup> «BLOOM». *BigScience Blog*. <a href="https://bigscience.huggingface.co/blog/bloom" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-lescao2022-2">↑ <sup>[2.0](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_ref-lescao2022_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_ref-lescao2022_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_ref-lescao2022_2-2)</sup> Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». *arXiv:2211.05100*. <a href="https://arxiv.org/abs/2211.05100" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-siliconangle_2022-3">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_ref-siliconangle_2022_3-0) «Researchers open-source neural network with 176B parameters». *SiliconANGLE*. <a href="https://siliconangle.com/2022/07/12/researchers-open-source-neural-network-176b-parameters/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-huggingface_model_card-4">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_ref-huggingface_model_card_4-0) «bigscience/bloom». *Hugging Face*. <a href="https://huggingface.co/bigscience/bloom" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-tech_behind_bloom-5">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_ref-tech_behind_bloom_5-0) «The Technology Behind BLOOM Training». *Hugging Face Blog*. <a href="https://huggingface.co/blog/bloom-megatron-deepspeed" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-roots_paper-6">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_ref-roots_paper_6-0) Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». *arXiv:2303.03915*. <a href="https://arxiv.org/abs/2303.03915" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-rail_license-7">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_ref-rail_license_7-0) «BigScience OpenRAIL-M». *BigScience Blog*. <a href="https://bigscience.huggingface.co/blog/bigscience-openrail-m" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-heikkila_2022-8">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(NL)#cite_ref-heikkila_2022_8-0) Heikkilä, M. «BLOOM is the first AI model to be under a...». *X*. <a href="https://mobile.twitter.com/Melissahei/status/1546870957402427393" class="external autonumber" rel="nofollow">[8]</a></span>
