BLOOM (Sprachmodell)

From Systems analysis Wiki
Jump to navigation Jump to search

BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) ist ein großes Sprachmodell (LLM) mit offenem Zugang, das 176 Milliarden Parameter enthält. Es wurde 2022 im Rahmen des BigScience-Projekts entwickelt – einer internationalen Zusammenarbeit von über 1000 Forschern aus 70 Ländern unter der Schirmherrschaft des Unternehmens Hugging Face[1].

BLOOM ist ein autoregressives Transformer-Modell, das in der Lage ist, kohärenten Text in 46 natürlichen Sprachen und 13 Programmiersprachen zu generieren. Das Modell wurde auf dem Supercomputer Jean Zay in Frankreich trainiert und war eine der ersten wirklich offenen Alternativen zu geschlossenen Modellen wie GPT-3 von OpenAI[2].

Hintergrund und Entwicklung

Die Initiative BigScience wurde im Mai 2021 mit dem Ziel ins Leben gerufen, die Forschung im Bereich der KI durch die gemeinsame Entwicklung eines großen, offenen Sprachmodells zu demokratisieren[1]. Zu dieser Zeit wurden führende LLMs wie GPT-3 unter Verschluss in großen Unternehmen entwickelt, die weder die Architektur, noch die Trainingsdaten oder den Quellcode offenlegten. Das BigScience-Projekt brachte über tausend freiwillige Forscher aus der ganzen Welt zusammen, um ein wettbewerbsfähiges und vollständig offenes Modell zu schaffen.

Das Projekt erhielt einen Zuschuss für Rechenressourcen auf dem französischen Supercomputer Jean Zay (IDRIS/CNRS). Das Training des Modells fand vom 11. März bis zum 6. Juli 2022 statt[3]. Die Entwicklung wurde so transparent wie möglich gestaltet: Das Team veröffentlichte Informationen über die Datenauswahl, die Trainingseinstellungen und führte öffentliche Diskussionen im Einklang mit der Ethik-Charta des Projekts durch.

Architektur und Training

Modellarchitektur

BLOOM basiert auf einer autoregressiven Transformer-Architektur (decoder-only), ähnlich dem GPT-3-Modell[2].

Architektonische Merkmale von BLOOM[4]
Parameter Eigenschaft
Typ Decoder-only Transformer
Parameter 176.247.271.424
Schichten (Layers) 70
Attention Heads 112
Dimension des Hidden State 14.336
Sequenzlänge 2048 Tokens
Aktivierungsfunktion GeLU; ALiBi Positionale Encodings

Das Modell wurde auf Basis der Frameworks Megatron-LM und DeepSpeed implementiert, die von Nvidia bzw. Microsoft entwickelt wurden, und enthielt eine Reihe von Modifikationen für ein effizientes verteiltes Training[5].

Trainingsdaten

BLOOM wurde auf dem speziell erstellten Textkorpus ROOTS (The Responsible Open-science Open-collaboration Text Sources) trainiert. Der Gesamtumfang der Daten betrug 1,6 Terabyte an bereinigtem und dedupliziertem Text (ca. 366 Milliarden Tokens)[6].

Der Korpus umfasst Texte in 59 Sprachen:

  • 46 natürliche Sprachen, darunter Englisch (30 % der Tokens), Chinesisch, Französisch, Spanisch, Arabisch sowie zahlreiche ressourcenarme Sprachen (z. B. Chi Tumbuka – 0,00002 % der Tokens).
  • 13 Programmiersprachen, darunter Python, Java, JavaScript und C++.

Dieser mehrsprachige und multidisziplinäre Datensatz wurde gezielt zusammengestellt, um das Modell für eine breite Palette von Sprachgemeinschaften nutzbar zu machen.

Leistung und Anwendung

BLOOM zeigt auf verschiedenen Benchmarks wettbewerbsfähige Ergebnisse, die trotz seiner Mehrsprachigkeit mit Modellen ähnlicher Größe wie OPT-175B von Meta vergleichbar sind[2].

Das Modell kann eine Vielzahl von Aufgaben im Zero-Shot-Modus (ohne zusätzliches Training) ausführen, darunter:

  • Textgenerierung in einem bestimmten Stil.
  • Zusammenfassung von Dokumenten.
  • Beantwortung von Fragen basierend auf Kontext.
  • Übersetzung zwischen Sprachen.
  • Generierung von einfachem Programmcode.

Um die praktische Anwendbarkeit zu verbessern, führte das BigScience-Team später ein zusätzliches Multi-Task-Fine-Tuning des Modells durch und erstellte die Version BLOOMZ, die den Anweisungen des Benutzers genauer folgt.

Lizenzierung und Open Access

Das vollständige 176-Milliarden-Parameter-Modell BLOOM, sein Quellcode und die Daten wurden im Juli 2022 veröffentlicht. Das Modell wird unter der speziell entwickelten Lizenz RAIL (Responsible AI License) v1.0 vertrieben[7].

Diese Lizenz gestattet die kostenlose Nutzung und Modifikation des Modells, unterliegt jedoch einer Reihe von Einschränkungen für seine Anwendung in bestimmten Bereichen. Insbesondere ist es verboten, BLOOM für Zwecke zu verwenden, die den ethischen Grundsätzen von BigScience widersprechen, wie zum Beispiel:

  • Massenüberwachung.
  • Algorithmische Diskriminierung.
  • Verbreitung von Desinformation.
  • Steuerung tödlicher Waffensysteme.

BLOOM war das erste große KI-Modell, das unter einer Lizenz mit expliziten Klauseln zur verantwortungsvollen Nutzung veröffentlicht wurde[8].

Literatur

  • Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
  • Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
  • Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
  • Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
  • BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
  • Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
  • Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
  • Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.

Einzelnachweise

  1. 1.0 1.1 „BLOOM“. BigScience Blog. [1]
  2. 2.0 2.1 2.2 Le Scao, T., et al. (2022). „BLOOM: A 176B-Parameter Open-Access Multilingual Language Model“. arXiv:2211.05100. [2]
  3. „Researchers open-source neural network with 176B parameters“. SiliconANGLE. [3]
  4. „bigscience/bloom“. Hugging Face. [4]
  5. „The Technology Behind BLOOM Training“. Hugging Face Blog. [5]
  6. Biderman, S. et al. (2023). „The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset“. arXiv:2303.03915. [6]
  7. „BigScience OpenRAIL-M“. BigScience Blog. [7]
  8. Heikkilä, M. „BLOOM is the first AI model to be under a...“. X. [8]