BLOOM (language model) (NL)
BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) — is een grote taalmodel (LLM) met open toegang, bestaande uit 176 miljard parameters. Het werd ontwikkeld in 2022 in het kader van het project BigScience — een internationale samenwerking van meer dan 1000 onderzoekers uit 70 landen onder auspiciën van het bedrijf Hugging Face[1].
BLOOM is een autogressief transformer-model dat in staat is samenhangende tekst te genereren in 46 natuurlijke talen en 13 programmeertalen. Het model werd getraind op de supercomputer Jean Zay in Frankrijk en werd een van de eerste werkelijk open alternatieven voor gesloten modellen zoals GPT-3 van OpenAI[2].
Voorgeschiedenis en ontwikkeling
Het initiatief BigScience werd in mei 2021 gelanceerd met als doel de democratisering van AI-onderzoek door middel van het gezamenlijk creëren van een groot open taalmodel[1]. Op dat moment werden de meest geavanceerde LLM's, zoals GPT-3, in beslotenheid ontwikkeld door grote bedrijven die de architectuur, trainingsdata en broncode niet vrijgaven. Het project BigScience bracht meer dan duizend vrijwillige onderzoekers van over de hele wereld samen om een concurrerend en volledig open model te bouwen.
Het project ontving een subsidie voor rekencapaciteit op de Franse supercomputer Jean Zay (IDRIS/CNRS). De training van het model vond plaats van 11 maart tot 6 juli 2022[3]. De ontwikkeling verliep zo transparant mogelijk: het team publiceerde informatie over de dataselectie, trainingsparameters en organiseerde publieke discussies in overeenstemming met het aangenomen ethisch handvest van het project.
Architectuur en training
Architectuur van het model
BLOOM is gebouwd op een autogressieve transformer-architectuur (decoder-only), vergelijkbaar met het model GPT-3[2].
| Parameter | Kenmerk |
|---|---|
| Type | Decoder-only transformer |
| Parameters | 176 247 271 424 |
| Lagen (layers) | 70 |
| Attention-koppen | 112 |
| Grootte verborgen toestand | 14 336 |
| Sequentielengte | 2048 tokens |
| Activeringsfunctie | GeLU; positionele coderingen ALiBi |
Het model werd geïmplementeerd op basis van de frameworks Megatron-LM en DeepSpeed, ontwikkeld door respectievelijk Nvidia en Microsoft, met een aantal aanpassingen voor efficiënte gedistribueerde training[5].
Trainingsdata
BLOOM werd getraind op het speciaal samengestelde tekstcorpus ROOTS (The Responsible Open-science Open-collaboration Text Sources). Het totale datavolume bedroeg 1,6 terabyte aan gereinigde en gededupliceerde tekst (≈366 miljard tokens)[6].
Het corpus omvat teksten in 59 talen:
- 46 natuurlijke talen, waaronder Engels (30% van de tokens), Chinees, Frans, Spaans, Arabisch, en ook tal van talen met weinig beschikbare middelen (bijvoorbeeld Chi Tumbuka — 0,00002% van de tokens).
- 13 programmeertalen, waaronder Python, Java, JavaScript en C++.
Deze meertalige en multi-domein dataset werd bewust samengesteld om het model bruikbaar te maken voor een breed scala aan taalgemeenschappen.
Prestaties en toepassingen
BLOOM behaalt concurrerende resultaten op uiteenlopende benchmarks, vergelijkbaar met modellen van vergelijkbare omvang zoals OPT-175B van Meta, ondanks zijn meertaligheid[2].
Het model is in staat een breed scala aan taken uit te voeren in zero-shot-modus (zonder aanvullende training), waaronder:
- Het genereren van tekst in een gewenste stijl.
- Het samenvatten van documenten.
- Het beantwoorden van vragen op basis van context.
- Vertaling tussen talen.
- Het genereren van eenvoudige programmacode.
Ter verbetering van de praktische bruikbaarheid voerde het BigScience-team later aanvullende multi-taak fine-tuning uit op het model, waarmee de versie BLOOMZ werd gecreëerd, die nauwkeuriger de instructies van de gebruiker opvolgt.
Licentie en open toegang
Het volledige BLOOM-model met 176 miljard parameters, de broncode en de data werden in juli 2022 gepubliceerd. Het model wordt verspreid onder de speciaal ontwikkelde licentie RAIL (Responsible AI License) v1.0[7].
Deze licentie staat gratis gebruik en aanpassing van het model toe, maar legt een aantal beperkingen op aan het gebruik ervan in bepaalde domeinen. In het bijzonder is het verboden BLOOM te gebruiken voor doeleinden die in strijd zijn met de ethische normen van BigScience, zoals:
- Massatoezicht.
- Algoritmische discriminatie.
- Verspreiding van desinformatie.
- Aansturing van dodelijke wapensystemen.
BLOOM werd het eerste grote AI-model dat werd uitgebracht onder een licentie met expliciete bepalingen voor verantwoord gebruik[8].
Literatuur
- Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
- Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
- Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
- Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
- BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
- Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
- Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
- Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.
Noten
- ↑ 1.0 1.1 «BLOOM». BigScience Blog. [1]
- ↑ 2.0 2.1 2.2 Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». arXiv:2211.05100. [2]
- ↑ «Researchers open-source neural network with 176B parameters». SiliconANGLE. [3]
- ↑ «bigscience/bloom». Hugging Face. [4]
- ↑ «The Technology Behind BLOOM Training». Hugging Face Blog. [5]
- ↑ Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». arXiv:2303.03915. [6]
- ↑ «BigScience OpenRAIL-M». BigScience Blog. [7]
- ↑ Heikkilä, M. «BLOOM is the first AI model to be under a...». X. [8]