BLOOM (language model) (KO)
BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) — 개방형 대규모 언어 모델(LLM)로, 1,760억 개의 파라미터를 보유하고 있습니다. 이 모델은 2022년 BigScience 프로젝트의 일환으로 개발되었으며, Hugging Face의 후원 하에 70개국 1,000명 이상의 연구자들이 참여한 국제 협력의 결과물입니다[1].
BLOOM은 자기회귀 transformer 모델로, 46개의 자연어와 13개의 프로그래밍 언어로 일관성 있는 텍스트를 생성할 수 있습니다. 이 모델은 프랑스의 슈퍼컴퓨터 Jean Zay에서 훈련되었으며, OpenAI의 GPT-3과 같은 폐쇄형 모델에 대한 진정한 개방형 대안 중 하나로 자리매김했습니다[2].
배경 및 개발
BigScience 이니셔티브는 2021년 5월, 대규모 개방형 언어 모델을 공동으로 개발함으로써 AI 연구의 민주화를 목표로 출범했습니다[1]. 당시 GPT-3과 같은 최첨단 LLM은 대형 기업들이 폐쇄적으로 개발하고 있었으며, 아키텍처·훈련 데이터·소스 코드를 공개하지 않았습니다. BigScience 프로젝트는 전 세계 1,000명 이상의 자원봉사 연구자들을 모아 경쟁력 있고 완전히 개방된 모델을 만들고자 했습니다.
프로젝트는 프랑스의 슈퍼컴퓨터 Jean Zay (IDRIS/CNRS)에서의 컴퓨팅 자원 지원을 받았습니다. 모델 훈련은 2022년 3월 11일부터 7월 6일까지 진행되었습니다[3]. 개발 과정은 최대한 투명하게 진행되었으며, 팀은 데이터 선정, 훈련 설정에 관한 정보를 공개하고 프로젝트의 윤리 헌장에 따라 공개 토론을 진행했습니다.
아키텍처 및 훈련
모델 아키텍처
BLOOM은 GPT-3과 유사한 자기회귀 방식의 (decoder-only) transformer 아키텍처를 기반으로 구축되었습니다[2].
| 파라미터 | 특성 |
|---|---|
| 유형 | Decoder-only transformer |
| 파라미터 수 | 176 247 271 424 |
| 레이어 수 (layers) | 70 |
| 어텐션 헤드 수 | 112 |
| 은닉 상태 크기 | 14 336 |
| 시퀀스 길이 | 2048 token |
| 활성화 함수 | GeLU; 위치 인코딩 ALiBi |
모델은 각각 Nvidia와 Microsoft가 개발한 Megatron-LM과 DeepSpeed 프레임워크를 기반으로 구현되었으며, 효율적인 분산 훈련을 위한 여러 수정이 적용되었습니다[5].
훈련 데이터
BLOOM은 특별히 제작된 텍스트 데이터 코퍼스 ROOTS (The Responsible Open-science Open-collaboration Text Sources)로 훈련되었습니다. 총 데이터 규모는 정제 및 중복 제거된 텍스트 기준 1.6테라바이트 (약 3,660억 token)입니다[6].
코퍼스에는 59개 언어의 텍스트가 포함되어 있습니다:
- 46개의 자연어: 영어(전체 token의 30%), 중국어, 프랑스어, 스페인어, 아랍어를 포함하며, 리소스가 적은 다양한 언어도 포함됩니다 (예: Chi Tumbuka — 전체 token의 0.00002%).
- 13개의 프로그래밍 언어: Python, Java, JavaScript, C++ 등.
이러한 다국어·다분야 dataset은 다양한 언어 커뮤니티에서 모델을 활용할 수 있도록 의도적으로 구성되었습니다.
성능 및 활용
BLOOM은 다양한 benchmark에서 경쟁력 있는 결과를 보여주며, 다국어 지원에도 불구하고 Meta의 OPT-175B와 같은 유사 규모의 모델과 비교 가능한 수준의 성능을 발휘합니다[2].
이 모델은 추가 훈련 없이 zero-shot 방식으로 다양한 작업을 수행할 수 있습니다:
- 지정된 스타일의 텍스트 생성.
- 문서 요약.
- 문맥 기반 질의응답.
- 언어 간 번역.
- 간단한 프로그램 코드 생성.
실용적 유용성을 향상시키기 위해 BigScience 팀은 이후 모델에 대한 추가적인 다중 작업 fine-tuning을 수행하여 사용자의 지시를 더욱 정확하게 따르는 BLOOMZ 버전을 개발했습니다.
라이선스 및 개방형 접근
1,760억 파라미터의 전체 BLOOM 모델, 소스 코드 및 데이터는 2022년 7월에 공개되었습니다. 모델은 특별히 개발된 RAIL (Responsible AI License) v1.0 라이선스 하에 배포됩니다[7].
이 라이선스는 모델의 무료 사용 및 수정을 허용하지만, 특정 분야에서의 사용에는 일부 제한을 부과합니다. 특히 BigScience의 윤리 기준에 위배되는 다음과 같은 목적의 사용은 금지됩니다:
- 대규모 감시.
- 알고리즘 기반 차별.
- 허위 정보 유포.
- 치명적 무기 통제.
BLOOM은 책임 있는 사용에 관한 명시적 조항이 포함된 라이선스로 출시된 최초의 대규모 AI 모델이 되었습니다[8].
참고 문헌
- Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
- Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
- Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
- Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
- BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
- Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
- Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
- Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.
주석
- ↑ 1.0 1.1 «BLOOM». BigScience Blog. [1]
- ↑ 2.0 2.1 2.2 Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». arXiv:2211.05100. [2]
- ↑ «Researchers open-source neural network with 176B parameters». SiliconANGLE. [3]
- ↑ «bigscience/bloom». Hugging Face. [4]
- ↑ «The Technology Behind BLOOM Training». Hugging Face Blog. [5]
- ↑ Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». arXiv:2303.03915. [6]
- ↑ «BigScience OpenRAIL-M». BigScience Blog. [7]
- ↑ Heikkilä, M. «BLOOM is the first AI model to be under a...». X. [8]