BLOOM (language model) (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) — egy nyílt hozzáférésű nagy nyelvi modell (LLM), amely 176 milliárd paramétert tartalmaz. 2022-ben fejlesztették ki a BigScience projekt keretében — egy nemzetközi együttműködés során, amelyben több mint 1000 kutató vett részt 70 országból, a Hugging Face vállalat égisze alatt[1].

A BLOOM egy autoregresszív transformer modell, amely képes összefüggő szöveget generálni 46 természetes nyelven és 13 programozási nyelven. A modellt a franciaországi Jean Zay szuperszámítógépen tanították be, és az egyik első valóban nyílt alternatívává vált a zárt modellek, például az OpenAI GPT-3 modellje mellett[2].

Előzmények és fejlesztés

A BigScience kezdeményezést 2021 májusában indították el azzal a céllal, hogy demokratizálják a mesterséges intelligencia kutatását egy nagy, nyílt nyelvi modell közös fejlesztésén keresztül[1]. Abban az időben az élvonalbeli LLM-eket, mint például a GPT-3, zárt körben fejlesztették nagy vállalatoknál, amelyek nem hozták nyilvánosságra az architektúrát, a tanítási adatokat és a forráskódot. A BigScience projekt több mint ezer önkéntes kutatót tömörített a világ minden tájáról egy versenyképes és teljesen nyílt modell létrehozása érdekében.

A projekt számítási erőforrásokra vonatkozó támogatást kapott a franciaországi Jean Zay szuperszámítógépen (IDRIS/CNRS). A modell betanítása 2022. március 11-től július 6-ig tartott[3]. A fejlesztés a lehető legnagyobb átláthatósággal zajlott: a csapat közzétette az adatkiválasztásról és a tanítási beállításokról szóló információkat, nyilvános vitákat tartott, és követte a projekt elfogadott etikai chartáját.

Architektúra és betanítás

A modell architektúrája

A BLOOM autoregresszív transformer architektúrára (decoder-only) épül, amely hasonló a GPT-3 modell felépítéséhez[2].

A BLOOM architektúrájának jellemzői[4]
Paraméter Jellemző
Típus Csak dekóderes transformer
Paraméterek 176 247 271 424
Rétegek (layers) 70
Figyelemfejek 112
Rejtett állapot mérete 14 336
Szekvencia hossza 2048 token
Aktivációs függvény GeLU; ALiBi pozicionális kódolások

A modell a Megatron-LM és a DeepSpeed keretrendszerek alapján valósult meg, amelyeket az Nvidia, illetve a Microsoft fejlesztett, számos módosítással a hatékony elosztott betanítás érdekében[5].

Tanítási adatok

A BLOOM-ot egy kifejezetten erre a célra létrehozott szöveges adatkorpuszon, a ROOTS-on (The Responsible Open-science Open-collaboration Text Sources) tanították be. Az adatok teljes mennyisége 1,6 terabájt megtisztított és deduplikált szöveg (≈366 milliárd token)[6].

A korpusz 59 nyelven tartalmaz szövegeket:

  • 46 természetes nyelven, köztük angolul (a tokenek 30%-a), kínaiul, franciául, spanyolul, arabul, valamint számos alacsony erőforrású nyelven (például Chi Tumbuka — a tokenek 0,00002%-a).
  • 13 programozási nyelven, köztük Python, Java, JavaScript és C++.

Ezt a többnyelvű és többdoménes datasetet szándékosan állították össze, hogy a modell széles körű nyelvi közösségek számára is alkalmazható legyen.

Teljesítmény és alkalmazás

A BLOOM versenyképes eredményeket mutat különféle benchmarkokon, amelyek összehasonlíthatók az azonos méretű modellekével, mint például a Meta OPT-175B modellje, annak ellenére, hogy többnyelvű[2].

A modell képes feladatok széles körét ellátni zero-shot módban (további betanítás nélkül), beleértve:

  • Szöveg generálását adott stílusban.
  • Dokumentumok összefoglalását.
  • Kontextuson alapuló kérdések megválaszolását.
  • Nyelvek közötti fordítást.
  • Egyszerű programkód generálását.

A gyakorlati hasznosság javítása érdekében a BigScience csapata később elvégzett egy kiegészítő többfeladatos fine-tuning folyamatot a modellen, és létrehozta a BLOOMZ verziót, amely pontosabban követi a felhasználói utasításokat.

Licencelés és nyílt hozzáférés

A teljes, 176 milliárd paraméteres BLOOM modellt, forráskódját és adatait 2022 júliusában tették közzé. A modell a kifejezetten erre a célra kidolgozott RAIL (Responsible AI License) v1.0 licenc alatt terjesztik[7].

Ez a licenc engedélyezi a modell ingyenes használatát és módosítását, de bizonyos területeken korlátozásokat ír elő az alkalmazásra vonatkozóan. Különösen tilos a BLOOM-ot olyan célokra használni, amelyek ellentétesek a BigScience etikai normáival, mint például:

  • Tömeges megfigyelés.
  • Algoritmikus diszkrimináció.
  • Dezinformáció terjesztése.
  • Halálos fegyverek irányítása.

A BLOOM volt az első nagy AI modell, amelyet kifejezett felelős használatra vonatkozó kikötéseket tartalmazó licenc alatt adtak ki[8].

Irodalom

  • Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
  • Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
  • Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
  • Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
  • BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
  • Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
  • Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
  • Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.

Jegyzetek

  1. 1.0 1.1 «BLOOM». BigScience Blog. [1]
  2. 2.0 2.1 2.2 Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». arXiv:2211.05100. [2]
  3. «Researchers open-source neural network with 176B parameters». SiliconANGLE. [3]
  4. «bigscience/bloom». Hugging Face. [4]
  5. «The Technology Behind BLOOM Training». Hugging Face Blog. [5]
  6. Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». arXiv:2303.03915. [6]
  7. «BigScience OpenRAIL-M». BigScience Blog. [7]
  8. Heikkilä, M. «BLOOM is the first AI model to be under a...». X. [8]