BLOOM (language model) (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) — ito ay isang malaking language model (LLM) na may bukas na access, na naglalaman ng 176 bilyong parameter. Ito ay binuo noong 2022 sa loob ng proyektong BigScience — isang internasyonal na pakikipagtulungan ng mahigit 1000 mananaliksik mula sa 70 bansa sa ilalim ng pangangasiwa ng kumpanyang Hugging Face[1].

Ang BLOOM ay isang autoregressive transformer model na kayang bumuo ng magkakaugnay na teksto sa 46 natural na wika at 13 programming language. Ang modelo ay sinanay sa supercomputer na Jean Zay sa Pransya at naging isa sa mga unang tunay na bukas na alternatibo sa mga saradong modelo, tulad ng GPT-3 ng OpenAI[2].

Kasaysayan at Pagbuo

Ang inisyatibang BigScience ay inilunsad noong Mayo 2021 na may layuning demokratisahin ang pananaliksik sa larangan ng AI sa pamamagitan ng magkasamang paglikha ng isang malaki at bukas na language model[1]. Sa panahong iyon, ang mga nangunguna sa larangan ng LLM, tulad ng GPT-3, ay binubuo nang lihim sa malalaking kumpanya na hindi nagbubunyag ng arkitektura, datos ng pagsasanay, at source code. Pinagisa ng proyektong BigScience ang mahigit isang libong boluntaryong mananaliksik mula sa buong mundo upang lumikha ng mapagkumpetensya at ganap na bukas na modelo.

Nakatanggap ang proyekto ng grant para sa mga mapagkukunan ng pagkalkula sa Pranses na supercomputer na Jean Zay (IDRIS/CNRS). Ang pagsasanay ng modelo ay isinasagawa mula ika-11 ng Marso hanggang ika-6 ng Hulyo 2022[3]. Ang pagbuo ay isinagawa nang may pinakamataas na antas ng transparency: inilathala ng koponan ang impormasyon tungkol sa pagpili ng datos, mga setting ng pagsasanay, at nagsagawa ng mga pampublikong talakayan, alinsunod sa tinanggap na etikal na charter ng proyekto.

Arkitektura at Pagsasanay

Arkitektura ng Modelo

Ang BLOOM ay itinayo sa arkitektura ng autoregressive transformer (decoder-only), katulad ng modelo ng GPT-3[2].

Mga katangian ng arkitektura ng BLOOM[4]
Parameter Katangian
Uri Decoder-only transformer
Mga Parameter 176 247 271 424
Mga Layer 70
Mga Attention Head 112
Sukat ng Hidden State 14 336
Haba ng Sequence 2048 token
Activation Function GeLU; positional encoding na ALiBi

Ang modelo ay naisakatuparan batay sa mga framework na Megatron-LM at DeepSpeed, na binuo ng Nvidia at Microsoft ayon sa pagkakabanggit, na may ilang pagbabago para sa mahusay na distributed na pagsasanay[5].

Datos ng Pagsasanay

Ang BLOOM ay sinanay sa espesyal na likhang corpus ng tekstwal na datos na ROOTS (The Responsible Open-science Open-collaboration Text Sources). Ang kabuuang dami ng datos ay umabot sa 1.6 terabyte ng nalinis at na-deduplicate na teksto (≈366 bilyong token)[6].

Ang corpus ay naglalaman ng mga teksto sa 59 wika:

  • 46 natural na wika, kabilang ang Ingles (30% ng mga token), Tsino, Pranses, Espanyol, Arabe, pati na rin ang maraming wika na may maliit na bilang ng mapagkukunan (halimbawa, Chi Tumbuka — 0.00002% ng mga token).
  • 13 programming language, kabilang ang Python, Java, JavaScript, at C++.

Ang ganitong multilingual at multidomain na dataset ay sadyang pinagsama-sama upang gawing angkop ang modelo para sa malawak na hanay ng mga komunidad ng wika.

Pagganap at Paggamit

Ipinakikita ng BLOOM ang mga mapagkumpetensyang resulta sa iba't ibang benchmark, na maihahambing sa mga modelo ng katulad na sukat, tulad ng OPT-175B ng Meta, sa kabila ng pagiging multilingual nito[2].

Kayang isakatuparan ng modelo ang malawak na hanay ng mga gawain sa zero-shot na paraan (nang walang karagdagang pagsasanay), kabilang ang:

  • Pagbuo ng teksto sa isang ibinigay na istilo.
  • Pagbubuod ng mga dokumento.
  • Pagsagot sa mga tanong batay sa konteksto.
  • Pagsasalin sa pagitan ng mga wika.
  • Pagbuo ng simpleng code ng programa.

Upang mapabuti ang praktikal na pagiging kapaki-pakinabang, naglunsad ang koponan ng BigScience ng karagdagang multitask na fine-tuning ng modelo, na lumikha ng bersyong BLOOMZ, na mas tumpak na sumusunod sa mga tagubilin ng gumagamit.

Paglilisensya at Bukas na Access

Ang buong 176-bilyong modelo ng BLOOM, ang source code nito, at ang datos ay inilathala noong Hulyo 2022. Ang modelo ay ipinamamahagi sa ilalim ng espesyal na likhang lisensyang RAIL (Responsible AI License) v1.0[7].

Pinapayagan ng lisensyang ito ang libreng paggamit at pagbabago ng modelo, ngunit nagtatakda ng ilang mga paghihigpit sa paggamit nito sa ilang mga larangan. Sa partikular, ipinagbabawal ang paggamit ng BLOOM para sa mga layuning salungat sa mga etikal na pamantayan ng BigScience, tulad ng:

  • Malawakang pagmamatyag.
  • Algorithmic na diskriminasyon.
  • Pagpapakalat ng maling impormasyon.
  • Pamamahala ng mga mapanganib na sandata.

Naging unang malaking modelo ng AI ang BLOOM na inilabas sa ilalim ng lisensya na may malinaw na mga probisyon ukol sa responsableng paggamit[8].

Mga Sanggunian

  • Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
  • Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
  • Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
  • Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
  • BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
  • Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
  • Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
  • Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.

Mga Tala

  1. 1.0 1.1 «BLOOM». BigScience Blog. [1]
  2. 2.0 2.1 2.2 Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». arXiv:2211.05100. [2]
  3. «Researchers open-source neural network with 176B parameters». SiliconANGLE. [3]
  4. «bigscience/bloom». Hugging Face. [4]
  5. «The Technology Behind BLOOM Training». Hugging Face Blog. [5]
  6. Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». arXiv:2303.03915. [6]
  7. «BigScience OpenRAIL-M». BigScience Blog. [7]
  8. Heikkilä, M. «BLOOM is the first AI model to be under a...». X. [8]