---
title: "BLOOM (language model) (TL)"
source: "https://systems-analysis.info/int/BLOOM_(language_model)_(TL)"
wiki: "systems-analysis.info/int"
article: "BLOOM_(language_model)_(TL)"
language: "tl"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Tagalog"
revision_id: 665
wiki_created_at: 2026-09-06T22:37:08Z
wiki_modified_at: 2026-09-06T22:37:08Z
downloaded_at: 2026-09-07T22:41:34Z
---

# BLOOM (language model) (TL)

**BLOOM** (**B**igScience **L**arge **O**pen-science **O**pen-access **M**ultilingual Language Model) — ito ay isang malaking language model (LLM) na may bukas na access, na naglalaman ng **176 bilyong** parameter. Ito ay binuo noong 2022 sa loob ng proyektong **BigScience** — isang internasyonal na pakikipagtulungan ng mahigit 1000 mananaliksik mula sa 70 bansa sa ilalim ng pangangasiwa ng kumpanyang Hugging Face<sup>[\[1\]](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_note-bloom_blog-1)</sup>.

Ang BLOOM ay isang autoregressive transformer model na kayang bumuo ng magkakaugnay na teksto sa **46 natural na wika** at **13 programming language**. Ang modelo ay sinanay sa supercomputer na Jean Zay sa Pransya at naging isa sa mga unang tunay na bukas na alternatibo sa mga saradong modelo, tulad ng GPT-3 ng OpenAI<sup>[\[2\]](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_note-lescao2022-2)</sup>.

## Kasaysayan at Pagbuo

Ang inisyatibang **BigScience** ay inilunsad noong Mayo 2021 na may layuning demokratisahin ang pananaliksik sa larangan ng AI sa pamamagitan ng magkasamang paglikha ng isang malaki at bukas na language model<sup>[\[1\]](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_note-bloom_blog-1)</sup>. Sa panahong iyon, ang mga nangunguna sa larangan ng LLM, tulad ng GPT-3, ay binubuo nang lihim sa malalaking kumpanya na hindi nagbubunyag ng arkitektura, datos ng pagsasanay, at source code. Pinagisa ng proyektong BigScience ang mahigit isang libong boluntaryong mananaliksik mula sa buong mundo upang lumikha ng mapagkumpetensya at ganap na bukas na modelo.

Nakatanggap ang proyekto ng grant para sa mga mapagkukunan ng pagkalkula sa Pranses na supercomputer na **Jean Zay** (IDRIS/CNRS). Ang pagsasanay ng modelo ay isinasagawa mula ika-11 ng Marso hanggang ika-6 ng Hulyo 2022<sup>[\[3\]](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_note-siliconangle_2022-3)</sup>. Ang pagbuo ay isinagawa nang may pinakamataas na antas ng transparency: inilathala ng koponan ang impormasyon tungkol sa pagpili ng datos, mga setting ng pagsasanay, at nagsagawa ng mga pampublikong talakayan, alinsunod sa tinanggap na etikal na charter ng proyekto.

## Arkitektura at Pagsasanay

### Arkitektura ng Modelo

Ang BLOOM ay itinayo sa arkitektura ng autoregressive transformer (*decoder-only*), katulad ng modelo ng GPT-3<sup>[\[2\]](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_note-lescao2022-2)</sup>.

| Parameter                 | Katangian                          |
|---------------------------|------------------------------------|
| **Uri**                   | Decoder-only transformer           |
| **Mga Parameter**         | 176 247 271 424                    |
| **Mga Layer**             | 70                                 |
| **Mga Attention Head**    | 112                                |
| **Sukat ng Hidden State** | 14 336                             |
| **Haba ng Sequence**      | 2048 token                         |
| **Activation Function**   | GeLU; positional encoding na ALiBi |

Mga katangian ng arkitektura ng BLOOM<sup>[\[4\]](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_note-huggingface_model_card-4)</sup>

Ang modelo ay naisakatuparan batay sa mga framework na **Megatron-LM** at **DeepSpeed**, na binuo ng Nvidia at Microsoft ayon sa pagkakabanggit, na may ilang pagbabago para sa mahusay na distributed na pagsasanay<sup>[\[5\]](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_note-tech_behind_bloom-5)</sup>.

### Datos ng Pagsasanay

Ang BLOOM ay sinanay sa espesyal na likhang corpus ng tekstwal na datos na **ROOTS** (The **R**esponsible **O**pen-science **O**pen-collaboration **T**ext **S**ources). Ang kabuuang dami ng datos ay umabot sa **1.6 terabyte** ng nalinis at na-deduplicate na teksto (≈366 bilyong token)<sup>[\[6\]](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_note-roots_paper-6)</sup>.

Ang corpus ay naglalaman ng mga teksto sa **59 wika**:

- **46 natural na wika**, kabilang ang Ingles (30% ng mga token), Tsino, Pranses, Espanyol, Arabe, pati na rin ang maraming wika na may maliit na bilang ng mapagkukunan (halimbawa, Chi Tumbuka — 0.00002% ng mga token).
- **13 programming language**, kabilang ang Python, Java, JavaScript, at C++.

Ang ganitong multilingual at multidomain na dataset ay sadyang pinagsama-sama upang gawing angkop ang modelo para sa malawak na hanay ng mga komunidad ng wika.

## Pagganap at Paggamit

Ipinakikita ng BLOOM ang mga mapagkumpetensyang resulta sa iba't ibang benchmark, na maihahambing sa mga modelo ng katulad na sukat, tulad ng OPT-175B ng Meta, sa kabila ng pagiging multilingual nito<sup>[\[2\]](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_note-lescao2022-2)</sup>.

Kayang isakatuparan ng modelo ang malawak na hanay ng mga gawain sa *zero-shot* na paraan (nang walang karagdagang pagsasanay), kabilang ang:

- Pagbuo ng teksto sa isang ibinigay na istilo.
- Pagbubuod ng mga dokumento.
- Pagsagot sa mga tanong batay sa konteksto.
- Pagsasalin sa pagitan ng mga wika.
- Pagbuo ng simpleng code ng programa.

Upang mapabuti ang praktikal na pagiging kapaki-pakinabang, naglunsad ang koponan ng BigScience ng karagdagang multitask na fine-tuning ng modelo, na lumikha ng bersyong **BLOOMZ**, na mas tumpak na sumusunod sa mga tagubilin ng gumagamit.

## Paglilisensya at Bukas na Access

Ang buong 176-bilyong modelo ng BLOOM, ang source code nito, at ang datos ay inilathala noong Hulyo 2022. Ang modelo ay ipinamamahagi sa ilalim ng espesyal na likhang lisensyang **RAIL (Responsible AI License) v1.0**<sup>[\[7\]](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_note-rail_license-7)</sup>.

Pinapayagan ng lisensyang ito ang libreng paggamit at pagbabago ng modelo, ngunit nagtatakda ng ilang mga paghihigpit sa paggamit nito sa ilang mga larangan. Sa partikular, ipinagbabawal ang paggamit ng BLOOM para sa mga layuning salungat sa mga etikal na pamantayan ng BigScience, tulad ng:

- Malawakang pagmamatyag.
- Algorithmic na diskriminasyon.
- Pagpapakalat ng maling impormasyon.
- Pamamahala ng mga mapanganib na sandata.

Naging unang malaking modelo ng AI ang BLOOM na inilabas sa ilalim ng lisensya na may malinaw na mga probisyon ukol sa responsableng paggamit<sup>[\[8\]](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_note-heikkila_2022-8)</sup>.

## Mga Sanggunian

- Hendrycks, D.; Gimpel, K. (2016). *Gaussian Error Linear Units (GELUs)*. arXiv:1606.08415.
- Shoeybi, M.; et al. (2019). *Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism*. arXiv:1909.08053.
- Rajbhandari, S.; et al. (2020). *ZeRO: Memory Optimizations Toward Training Trillion Parameter Models*. arXiv:1910.02054.
- Press, O.; et al. (2021). *Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation*. arXiv:2108.12409.
- Le Scao, T.; et al. (2022). *BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model*. arXiv:2211.05100.
- Muennighoff, N.; et al. (2022). *BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning*. arXiv:2211.01786.
- BigScience Workshop (2022). *BigScience OpenRAIL‑M License v1.0*. Online specification.
- Akiki, C.; et al. (2022). *BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model*. arXiv:2212.04960.
- Yong, Z.‑X.; et al. (2022). *BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting*. arXiv:2212.09535.
- Biderman, S.; et al. (2023). *The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset*. arXiv:2303.03915.

## Mga Tala

1.  <span id="cite_note-bloom_blog-1">↑ <sup>[1.0](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_ref-bloom_blog_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_ref-bloom_blog_1-1)</sup> «BLOOM». *BigScience Blog*. <a href="https://bigscience.huggingface.co/blog/bloom" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-lescao2022-2">↑ <sup>[2.0](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_ref-lescao2022_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_ref-lescao2022_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_ref-lescao2022_2-2)</sup> Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». *arXiv:2211.05100*. <a href="https://arxiv.org/abs/2211.05100" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-siliconangle_2022-3">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_ref-siliconangle_2022_3-0) «Researchers open-source neural network with 176B parameters». *SiliconANGLE*. <a href="https://siliconangle.com/2022/07/12/researchers-open-source-neural-network-176b-parameters/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-huggingface_model_card-4">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_ref-huggingface_model_card_4-0) «bigscience/bloom». *Hugging Face*. <a href="https://huggingface.co/bigscience/bloom" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-tech_behind_bloom-5">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_ref-tech_behind_bloom_5-0) «The Technology Behind BLOOM Training». *Hugging Face Blog*. <a href="https://huggingface.co/blog/bloom-megatron-deepspeed" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-roots_paper-6">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_ref-roots_paper_6-0) Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». *arXiv:2303.03915*. <a href="https://arxiv.org/abs/2303.03915" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-rail_license-7">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_ref-rail_license_7-0) «BigScience OpenRAIL-M». *BigScience Blog*. <a href="https://bigscience.huggingface.co/blog/bigscience-openrail-m" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-heikkila_2022-8">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(TL)#cite_ref-heikkila_2022_8-0) Heikkilä, M. «BLOOM is the first AI model to be under a...». *X*. <a href="https://mobile.twitter.com/Melissahei/status/1546870957402427393" class="external autonumber" rel="nofollow">[8]</a></span>
