---
title: "BLOOM (language model) (IT)"
source: "https://systems-analysis.info/int/BLOOM_(language_model)_(IT)"
wiki: "systems-analysis.info/int"
article: "BLOOM_(language_model)_(IT)"
language: "it"
categories:
  - "Category:Italian"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 658
wiki_created_at: 2026-09-06T22:37:02Z
wiki_modified_at: 2026-09-06T22:37:02Z
downloaded_at: 2026-09-07T22:41:31Z
---

# BLOOM (language model) (IT)

**BLOOM** (**B**igScience **L**arge **O**pen-science **O**pen-access **M**ultilingual Language Model) — è un grande modello linguistico (LLM) ad accesso aperto, contenente **176 miliardi** di parametri. È stato sviluppato nel 2022 nell'ambito del progetto **BigScience** — una collaborazione internazionale di oltre 1000 ricercatori provenienti da 70 paesi sotto l'egida dell'azienda Hugging Face<sup>[\[1\]](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_note-bloom_blog-1)</sup>.

BLOOM è un modello transformer autoregressivo, capace di generare testo coerente in **46 lingue naturali** e **13 linguaggi di programmazione**. Il modello è stato addestrato sul supercomputer Jean Zay in Francia ed è diventato una delle prime vere alternative aperte ai modelli chiusi, come GPT-3 di OpenAI<sup>[\[2\]](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_note-lescao2022-2)</sup>.

## Contesto e sviluppo

L'iniziativa **BigScience** è stata avviata nel maggio 2021 con l'obiettivo di democratizzare la ricerca nel campo dell'IA attraverso la creazione collaborativa di un grande modello linguistico aperto<sup>[\[1\]](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_note-bloom_blog-1)</sup>. All'epoca, i principali LLM, come GPT-3, venivano sviluppati in modo chiuso all'interno di grandi aziende che non divulgavano architettura, dati di addestramento e codice sorgente. Il progetto BigScience ha riunito oltre mille ricercatori volontari da tutto il mondo per creare un modello competitivo e completamente aperto.

Il progetto ha ricevuto un grant per le risorse computazionali sul supercomputer francese **Jean Zay** (IDRIS/CNRS). L'addestramento del modello si è svolto dall'11 marzo al 6 luglio 2022<sup>[\[3\]](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_note-siliconangle_2022-3)</sup>. Lo sviluppo è stato condotto con la massima trasparenza: il team pubblicava informazioni sulla selezione dei dati, sulle impostazioni di addestramento e organizzava discussioni pubbliche, seguendo la carta etica adottata dal progetto.

## Architettura e addestramento

### Architettura del modello

BLOOM è costruito sull'architettura transformer di tipo autoregressivo (*decoder-only*), analoga al modello GPT-3<sup>[\[2\]](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_note-lescao2022-2)</sup>.

| Parametro                           | Caratteristica                    |
|-------------------------------------|-----------------------------------|
| **Tipo**                            | Transformer decoder-only          |
| **Parametri**                       | 176 247 271 424                   |
| **Strati (layers)**                 | 70                                |
| **Teste di attenzione**             | 112                               |
| **Dimensione dello stato nascosto** | 14 336                            |
| **Lunghezza della sequenza**        | 2048 token                        |
| **Funzione di attivazione**         | GeLU; codifiche posizionali ALiBi |

Caratteristiche architetturali di BLOOM<sup>[\[4\]](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_note-huggingface_model_card-4)</sup>

Il modello è stato implementato sulla base dei framework **Megatron-LM** e **DeepSpeed**, sviluppati rispettivamente da Nvidia e Microsoft, con una serie di modifiche per un efficiente addestramento distribuito<sup>[\[5\]](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_note-tech_behind_bloom-5)</sup>.

### Dati di addestramento

BLOOM è stato addestrato su un corpus di dati testuali appositamente creato, denominato **ROOTS** (The **R**esponsible **O**pen-science **O**pen-collaboration **T**ext **S**ources). Il volume totale dei dati ammonta a **1,6 terabyte** di testo pulito e deduplicato (≈366 miliardi di token)<sup>[\[6\]](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_note-roots_paper-6)</sup>.

Il corpus include testi in **59 lingue**:

- **46 lingue naturali**, tra cui inglese (30% dei token), cinese, francese, spagnolo, arabo, nonché numerose lingue con poche risorse disponibili (ad esempio, Chi Tumbuka — 0,00002% dei token).
- **13 linguaggi di programmazione**, tra cui Python, Java, JavaScript e C++.

Questo dataset multilingue e multidominio è stato raccolto intenzionalmente per rendere il modello adatto a un'ampia varietà di comunità linguistiche.

## Prestazioni e applicazioni

BLOOM dimostra risultati competitivi su diversi benchmark, paragonabili a quelli di modelli di dimensioni analoghe, come OPT-175B di Meta, nonostante la sua natura multilingue<sup>[\[2\]](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_note-lescao2022-2)</sup>.

Il modello è in grado di svolgere un'ampia gamma di compiti in modalità *zero-shot* (senza addestramento aggiuntivo), tra cui:

- Generazione di testo in uno stile prestabilito.
- Riassunto di documenti.
- Risposta a domande basate sul contesto.
- Traduzione tra lingue.
- Generazione di semplice codice sorgente.

Per migliorare l'utilità pratica, il team di BigScience ha successivamente eseguito un ulteriore fine-tuning multitask del modello, creando la versione **BLOOMZ**, che segue le istruzioni dell'utente in modo più preciso.

## Licenza e accesso aperto

Il modello BLOOM completo da 176 miliardi di parametri, il suo codice sorgente e i dati sono stati pubblicati nel luglio 2022. Il modello è distribuito sotto la licenza appositamente sviluppata **RAIL (Responsible AI License) v1.0**<sup>[\[7\]](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_note-rail_license-7)</sup>.

Questa licenza consente l'utilizzo e la modifica gratuita del modello, ma impone una serie di restrizioni al suo utilizzo in determinati ambiti. In particolare, è vietato utilizzare BLOOM per scopi contrari alle norme etiche di BigScience, quali:

- Sorveglianza di massa.
- Discriminazione algoritmica.
- Diffusione di disinformazione.
- Gestione di armamenti letali.

BLOOM è diventato il primo grande modello di IA rilasciato con una licenza contenente esplicite clausole sull'uso responsabile<sup>[\[8\]](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_note-heikkila_2022-8)</sup>.

## Bibliografia

- Hendrycks, D.; Gimpel, K. (2016). *Gaussian Error Linear Units (GELUs)*. arXiv:1606.08415.
- Shoeybi, M.; et al. (2019). *Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism*. arXiv:1909.08053.
- Rajbhandari, S.; et al. (2020). *ZeRO: Memory Optimizations Toward Training Trillion Parameter Models*. arXiv:1910.02054.
- Press, O.; et al. (2021). *Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation*. arXiv:2108.12409.
- Le Scao, T.; et al. (2022). *BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model*. arXiv:2211.05100.
- Muennighoff, N.; et al. (2022). *BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning*. arXiv:2211.01786.
- BigScience Workshop (2022). *BigScience OpenRAIL‑M License v1.0*. Online specification.
- Akiki, C.; et al. (2022). *BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model*. arXiv:2212.04960.
- Yong, Z.‑X.; et al. (2022). *BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting*. arXiv:2212.09535.
- Biderman, S.; et al. (2023). *The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset*. arXiv:2303.03915.

## Note

1.  <span id="cite_note-bloom_blog-1">↑ <sup>[1.0](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_ref-bloom_blog_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_ref-bloom_blog_1-1)</sup> «BLOOM». *BigScience Blog*. <a href="https://bigscience.huggingface.co/blog/bloom" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-lescao2022-2">↑ <sup>[2.0](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_ref-lescao2022_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_ref-lescao2022_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_ref-lescao2022_2-2)</sup> Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». *arXiv:2211.05100*. <a href="https://arxiv.org/abs/2211.05100" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-siliconangle_2022-3">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_ref-siliconangle_2022_3-0) «Researchers open-source neural network with 176B parameters». *SiliconANGLE*. <a href="https://siliconangle.com/2022/07/12/researchers-open-source-neural-network-176b-parameters/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-huggingface_model_card-4">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_ref-huggingface_model_card_4-0) «bigscience/bloom». *Hugging Face*. <a href="https://huggingface.co/bigscience/bloom" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-tech_behind_bloom-5">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_ref-tech_behind_bloom_5-0) «The Technology Behind BLOOM Training». *Hugging Face Blog*. <a href="https://huggingface.co/blog/bloom-megatron-deepspeed" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-roots_paper-6">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_ref-roots_paper_6-0) Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». *arXiv:2303.03915*. <a href="https://arxiv.org/abs/2303.03915" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-rail_license-7">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_ref-rail_license_7-0) «BigScience OpenRAIL-M». *BigScience Blog*. <a href="https://bigscience.huggingface.co/blog/bigscience-openrail-m" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-heikkila_2022-8">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_(IT)#cite_ref-heikkila_2022_8-0) Heikkilä, M. «BLOOM is the first AI model to be under a...». *X*. <a href="https://mobile.twitter.com/Melissahei/status/1546870957402427393" class="external autonumber" rel="nofollow">[8]</a></span>
