BLOOM (language model) (IT)

From Systems analysis Wiki
Jump to navigation Jump to search

BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) — è un grande modello linguistico (LLM) ad accesso aperto, contenente 176 miliardi di parametri. È stato sviluppato nel 2022 nell'ambito del progetto BigScience — una collaborazione internazionale di oltre 1000 ricercatori provenienti da 70 paesi sotto l'egida dell'azienda Hugging Face[1].

BLOOM è un modello transformer autoregressivo, capace di generare testo coerente in 46 lingue naturali e 13 linguaggi di programmazione. Il modello è stato addestrato sul supercomputer Jean Zay in Francia ed è diventato una delle prime vere alternative aperte ai modelli chiusi, come GPT-3 di OpenAI[2].

Contesto e sviluppo

L'iniziativa BigScience è stata avviata nel maggio 2021 con l'obiettivo di democratizzare la ricerca nel campo dell'IA attraverso la creazione collaborativa di un grande modello linguistico aperto[1]. All'epoca, i principali LLM, come GPT-3, venivano sviluppati in modo chiuso all'interno di grandi aziende che non divulgavano architettura, dati di addestramento e codice sorgente. Il progetto BigScience ha riunito oltre mille ricercatori volontari da tutto il mondo per creare un modello competitivo e completamente aperto.

Il progetto ha ricevuto un grant per le risorse computazionali sul supercomputer francese Jean Zay (IDRIS/CNRS). L'addestramento del modello si è svolto dall'11 marzo al 6 luglio 2022[3]. Lo sviluppo è stato condotto con la massima trasparenza: il team pubblicava informazioni sulla selezione dei dati, sulle impostazioni di addestramento e organizzava discussioni pubbliche, seguendo la carta etica adottata dal progetto.

Architettura e addestramento

Architettura del modello

BLOOM è costruito sull'architettura transformer di tipo autoregressivo (decoder-only), analoga al modello GPT-3[2].

Caratteristiche architetturali di BLOOM[4]
Parametro Caratteristica
Tipo Transformer decoder-only
Parametri 176 247 271 424
Strati (layers) 70
Teste di attenzione 112
Dimensione dello stato nascosto 14 336
Lunghezza della sequenza 2048 token
Funzione di attivazione GeLU; codifiche posizionali ALiBi

Il modello è stato implementato sulla base dei framework Megatron-LM e DeepSpeed, sviluppati rispettivamente da Nvidia e Microsoft, con una serie di modifiche per un efficiente addestramento distribuito[5].

Dati di addestramento

BLOOM è stato addestrato su un corpus di dati testuali appositamente creato, denominato ROOTS (The Responsible Open-science Open-collaboration Text Sources). Il volume totale dei dati ammonta a 1,6 terabyte di testo pulito e deduplicato (≈366 miliardi di token)[6].

Il corpus include testi in 59 lingue:

  • 46 lingue naturali, tra cui inglese (30% dei token), cinese, francese, spagnolo, arabo, nonché numerose lingue con poche risorse disponibili (ad esempio, Chi Tumbuka — 0,00002% dei token).
  • 13 linguaggi di programmazione, tra cui Python, Java, JavaScript e C++.

Questo dataset multilingue e multidominio è stato raccolto intenzionalmente per rendere il modello adatto a un'ampia varietà di comunità linguistiche.

Prestazioni e applicazioni

BLOOM dimostra risultati competitivi su diversi benchmark, paragonabili a quelli di modelli di dimensioni analoghe, come OPT-175B di Meta, nonostante la sua natura multilingue[2].

Il modello è in grado di svolgere un'ampia gamma di compiti in modalità zero-shot (senza addestramento aggiuntivo), tra cui:

  • Generazione di testo in uno stile prestabilito.
  • Riassunto di documenti.
  • Risposta a domande basate sul contesto.
  • Traduzione tra lingue.
  • Generazione di semplice codice sorgente.

Per migliorare l'utilità pratica, il team di BigScience ha successivamente eseguito un ulteriore fine-tuning multitask del modello, creando la versione BLOOMZ, che segue le istruzioni dell'utente in modo più preciso.

Licenza e accesso aperto

Il modello BLOOM completo da 176 miliardi di parametri, il suo codice sorgente e i dati sono stati pubblicati nel luglio 2022. Il modello è distribuito sotto la licenza appositamente sviluppata RAIL (Responsible AI License) v1.0[7].

Questa licenza consente l'utilizzo e la modifica gratuita del modello, ma impone una serie di restrizioni al suo utilizzo in determinati ambiti. In particolare, è vietato utilizzare BLOOM per scopi contrari alle norme etiche di BigScience, quali:

  • Sorveglianza di massa.
  • Discriminazione algoritmica.
  • Diffusione di disinformazione.
  • Gestione di armamenti letali.

BLOOM è diventato il primo grande modello di IA rilasciato con una licenza contenente esplicite clausole sull'uso responsabile[8].

Bibliografia

  • Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
  • Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
  • Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
  • Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
  • BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
  • Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
  • Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
  • Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.

Note

  1. 1.0 1.1 «BLOOM». BigScience Blog. [1]
  2. 2.0 2.1 2.2 Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». arXiv:2211.05100. [2]
  3. «Researchers open-source neural network with 176B parameters». SiliconANGLE. [3]
  4. «bigscience/bloom». Hugging Face. [4]
  5. «The Technology Behind BLOOM Training». Hugging Face Blog. [5]
  6. Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». arXiv:2303.03915. [6]
  7. «BigScience OpenRAIL-M». BigScience Blog. [7]
  8. Heikkilä, M. «BLOOM is the first AI model to be under a...». X. [8]