---
title: "BLOOM (language model) — ブルーム"
source: "https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0"
wiki: "systems-analysis.info/int"
article: "BLOOM_(language_model)_—_ブルーム"
language: "ja"
categories:
  - "Category:Japanese"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 670
wiki_created_at: 2026-09-06T22:37:12Z
wiki_modified_at: 2026-09-06T22:37:12Z
downloaded_at: 2026-09-07T22:41:36Z
---

# BLOOM (language model) — ブルーム

**BLOOM**（**B**igScience **L**arge **O**pen-science **O**pen-access **M**ultilingual Language Model）は、**1760億**のパラメータを持つオープンアクセスの大規模言語モデル（LLM）です。このモデルは2022年、Hugging Face社の支援のもと、70カ国から1000人以上の研究者が参加する国際的な共同プロジェクト**BigScience**の一環として開発されました<sup>[\[1\]](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_note-bloom_blog-1)</sup>。

BLOOMは自己回帰型のトランスフォーマーモデルであり、**46の自然言語**と**13のプログラミング言語**で一貫性のあるテキストを生成する能力を持っています。このモデルはフランスのスーパーコンピュータ「Jean Zay」で学習され、OpenAIのGPT-3のようなクローズドモデルに対する、真にオープンな代替案の最初の1つとなりました<sup>[\[2\]](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_note-lescao2022-2)</sup>。

## 背景と開発

**BigScience**イニシアチブは、大規模なオープン言語モデルを共同で作成し、AI研究の民主化を目指す目的で2021年5月に発足しました<sup>[\[1\]](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_note-bloom_blog-1)</sup>。当時、GPT-3のような最先端のLLMは、アーキテクチャ、学習データ、ソースコードを公開しない大企業によって非公開で開発されていました。BigScienceプロジェクトは、競争力のある完全にオープンなモデルを構築するために、世界中から1000人以上のボランティア研究者を集めました。

このプロジェクトは、フランスのスーパーコンピュータ**Jean Zay**（IDRIS/CNRS）の計算リソースに対する助成金を受けました。モデルの学習は2022年3月11日から7月6日まで行われました<sup>[\[3\]](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_note-siliconangle_2022-3)</sup>。開発は最大限の透明性をもって進められました。チームはデータ選定や学習設定に関する情報を公開し、プロジェクトで採択された倫理憲章に従って公開討論を行いました。

## アーキテクチャと学習

### モデルのアーキテクチャ

BLOOMは、GPT-3モデルと同様の自己回帰型（*decoder-only*）のトランスフォーマーアーキテクチャに基づいています<sup>[\[2\]](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_note-lescao2022-2)</sup>。

| パラメータ               | 仕様                                   |
|--------------------------|----------------------------------------|
| **タイプ**               | デコーダーオンリー・トランスフォーマー |
| **パラメータ数**         | 176,247,271,424                        |
| **層（layers）**         | 70                                     |
| **アテンションヘッド数** | 112                                    |
| **隠れ状態の次元数**     | 14,336                                 |
| **シーケンス長**         | 2048トークン                           |
| **活性化関数**           | GeLU、ALiBi位置エンコーディング        |

BLOOMのアーキテクチャ仕様<sup>[\[4\]](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_note-huggingface_model_card-4)</sup>

モデルは、NvidiaとMicrosoftがそれぞれ開発したフレームワーク**Megatron-LM**と**DeepSpeed**をベースに実装され、効率的な分散学習のためにいくつかの変更が加えられています<sup>[\[5\]](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_note-tech_behind_bloom-5)</sup>。

### 学習データ

BLOOMは、特別に作成されたテキストデータコーパス**ROOTS**（The **R**esponsible **O**pen-science **O**pen-collaboration **T**ext **S**ources）で学習されました。データの総量は、クレンジングおよび重複排除されたテキストで**1.6テラバイト**（約3660億トークン）に及びます<sup>[\[6\]](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_note-roots_paper-6)</sup>。

このコーパスには、**59の言語**のテキストが含まれています：

- **46の自然言語**：英語（トークンの30%）、中国語、フランス語、スペイン語、アラビア語に加え、リソースの少ない多くの言語（例：チトゥンブカ語 - トークンの0.00002%）が含まれます。
- **13のプログラミング言語**：Python、Java、JavaScript、C++などが含まれます。

このような多言語・多領域のデータセットは、幅広い言語コミュニティでモデルが利用できるように意図的に収集されました。

## パフォーマンスと応用

BLOOMは、その多言語性にもかかわらず、Meta社のOPT-175Bのような同規模のモデルに匹敵する競争力のある結果を様々なベンチマークで示しています<sup>[\[2\]](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_note-lescao2022-2)</sup>。

このモデルは、*zero-shot*モード（追加学習なし）で幅広いタスクを実行できます。これには以下が含まれます：

- 指定されたスタイルでのテキスト生成。
- 文書の要約。
- 文脈に基づいた質疑応答。
- 言語間の翻訳。
- 簡単なプログラムコードの生成。

実用性を向上させるため、BigScienceチームは後に追加のマルチタスクファインチューニング（*fine-tuning*）を行い、ユーザーの指示により正確に従うバージョン**BLOOMZ**を作成しました。

## ライセンスとオープンアクセス

1760億パラメータの完全なBLOOMモデル、そのソースコード、データは2022年7月に公開されました。モデルは、特別に策定されたライセンス**RAIL (Responsible AI License) v1.0**の下で配布されています<sup>[\[7\]](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_note-rail_license-7)</sup>。

このライセンスはモデルの無料使用と改変を許可していますが、特定の分野での利用にはいくつかの制限を課しています。特に、BigScienceの倫理規範に反する目的でのBLOOMの使用は禁止されています。例えば、以下のような目的です：

- 大規模な監視。
- アルゴリズムによる差別。
- 偽情報の拡散。
- 致死性兵器の管理。

BLOOMは、責任ある使用に関する明確な条項を持つライセンスの下でリリースされた初の主要なAIモデルとなりました<sup>[\[8\]](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_note-heikkila_2022-8)</sup>。

## 参考文献

- Hendrycks, D.; Gimpel, K. (2016). *Gaussian Error Linear Units (GELUs)*. <a href="https://arxiv.org/abs/1606.08415" class="external text" rel="nofollow">arXiv:1606.08415</a>.
- Shoeybi, M.; et al. (209). *Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism*. <a href="https://arxiv.org/abs/1909.08053" class="external text" rel="nofollow">arXiv:1909.08053</a>.
- Rajbhandari, S.; et al. (2020). *ZeRO: Memory Optimizations Toward Training Trillion Parameter Models*. <a href="https://arxiv.org/abs/1910.02054" class="external text" rel="nofollow">arXiv:1910.02054</a>.
- Press, O.; et al. (2021). *Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation*. <a href="https://arxiv.org/abs/2108.12409" class="external text" rel="nofollow">arXiv:2108.12409</a>.
- Le Scao, T.; et al. (2022). *BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model*. <a href="https://arxiv.org/abs/2211.05100" class="external text" rel="nofollow">arXiv:2211.05100</a>.
- Muennighoff, N.; et al. (2022). *BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning*. <a href="https://arxiv.org/abs/2211.01786" class="external text" rel="nofollow">arXiv:2211.01786</a>.
- BigScience Workshop (2022). *BigScience OpenRAIL‑M License v1.0*. <a href="https://bigscience.huggingface.co/blog/bigscience-openrail-m" class="external text" rel="nofollow">Online specification</a>.
- Akiki, C.; et al. (2022). *BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model*. <a href="https://arxiv.org/abs/2212.04960" class="external text" rel="nofollow">arXiv:2212.04960</a>.
- Yong, Z.‑X.; et al. (2022). *BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting*. <a href="https://arxiv.org/abs/2212.09535" class="external text" rel="nofollow">arXiv:2212.09535</a>.
- Biderman, S.; et al. (2023). *The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset*. <a href="https://arxiv.org/abs/2303.03915" class="external text" rel="nofollow">arXiv:2303.03915</a>.

## 脚注

1.  <span id="cite_note-bloom_blog-1">↑ <sup>[1.0](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_ref-bloom_blog_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_ref-bloom_blog_1-1)</sup> 「BLOOM」。*BigScience Blog*。<a href="https://bigscience.huggingface.co/blog/bloom" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-lescao2022-2">↑ <sup>[2.0](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_ref-lescao2022_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_ref-lescao2022_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_ref-lescao2022_2-2)</sup> Le Scao, T., et al. (2022). 「BLOOM: A 176B-Parameter Open-Access Multilingual Language Model」。*arXiv:2211.05100*。<a href="https://arxiv.org/abs/2211.05100" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-siliconangle_2022-3">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_ref-siliconangle_2022_3-0) 「Researchers open-source neural network with 176B parameters」。*SiliconANGLE*。<a href="https://siliconangle.com/2022/07/12/researchers-open-source-neural-network-176b-parameters/" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-huggingface_model_card-4">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_ref-huggingface_model_card_4-0) 「bigscience/bloom」。*Hugging Face*。<a href="https://huggingface.co/bigscience/bloom" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-tech_behind_bloom-5">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_ref-tech_behind_bloom_5-0) 「The Technology Behind BLOOM Training」。*Hugging Face Blog*。<a href="https://huggingface.co/blog/bloom-megatron-deepspeed" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-roots_paper-6">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_ref-roots_paper_6-0) Biderman, S. et al. (2023). 「The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset」。*arXiv:2303.03915*。<a href="https://arxiv.org/abs/2303.03915" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-rail_license-7">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_ref-rail_license_7-0) 「BigScience OpenRAIL-M」。*BigScience Blog*。<a href="https://bigscience.huggingface.co/blog/bigscience-openrail-m" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-heikkila_2022-8">[↑](https://systems-analysis.info/int/BLOOM_(language_model)_%E2%80%94_%E3%83%96%E3%83%AB%E3%83%BC%E3%83%A0#cite_ref-heikkila_2022_8-0) Heikkilä, M. 「BLOOM is the first AI model to be under a...」。*X*。<a href="https://mobile.twitter.com/Melissahei/status/1546870957402427393" class="external autonumber" rel="nofollow">[8]</a></span>
