BLOOM (language model) (KO)

From Systems analysis Wiki
Jump to navigation Jump to search

BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) — 개방형 대규모 언어 모델(LLM)로, 1,760억 개의 파라미터를 보유하고 있습니다. 이 모델은 2022년 BigScience 프로젝트의 일환으로 개발되었으며, Hugging Face의 후원 하에 70개국 1,000명 이상의 연구자들이 참여한 국제 협력의 결과물입니다[1].

BLOOM은 자기회귀 transformer 모델로, 46개의 자연어13개의 프로그래밍 언어로 일관성 있는 텍스트를 생성할 수 있습니다. 이 모델은 프랑스의 슈퍼컴퓨터 Jean Zay에서 훈련되었으며, OpenAI의 GPT-3과 같은 폐쇄형 모델에 대한 진정한 개방형 대안 중 하나로 자리매김했습니다[2].

배경 및 개발

BigScience 이니셔티브는 2021년 5월, 대규모 개방형 언어 모델을 공동으로 개발함으로써 AI 연구의 민주화를 목표로 출범했습니다[1]. 당시 GPT-3과 같은 최첨단 LLM은 대형 기업들이 폐쇄적으로 개발하고 있었으며, 아키텍처·훈련 데이터·소스 코드를 공개하지 않았습니다. BigScience 프로젝트는 전 세계 1,000명 이상의 자원봉사 연구자들을 모아 경쟁력 있고 완전히 개방된 모델을 만들고자 했습니다.

프로젝트는 프랑스의 슈퍼컴퓨터 Jean Zay (IDRIS/CNRS)에서의 컴퓨팅 자원 지원을 받았습니다. 모델 훈련은 2022년 3월 11일부터 7월 6일까지 진행되었습니다[3]. 개발 과정은 최대한 투명하게 진행되었으며, 팀은 데이터 선정, 훈련 설정에 관한 정보를 공개하고 프로젝트의 윤리 헌장에 따라 공개 토론을 진행했습니다.

아키텍처 및 훈련

모델 아키텍처

BLOOM은 GPT-3과 유사한 자기회귀 방식의 (decoder-only) transformer 아키텍처를 기반으로 구축되었습니다[2].

BLOOM의 아키텍처 특성[4]
파라미터 특성
유형 Decoder-only transformer
파라미터 수 176 247 271 424
레이어 수 (layers) 70
어텐션 헤드 수 112
은닉 상태 크기 14 336
시퀀스 길이 2048 token
활성화 함수 GeLU; 위치 인코딩 ALiBi

모델은 각각 Nvidia와 Microsoft가 개발한 Megatron-LMDeepSpeed 프레임워크를 기반으로 구현되었으며, 효율적인 분산 훈련을 위한 여러 수정이 적용되었습니다[5].

훈련 데이터

BLOOM은 특별히 제작된 텍스트 데이터 코퍼스 ROOTS (The Responsible Open-science Open-collaboration Text Sources)로 훈련되었습니다. 총 데이터 규모는 정제 및 중복 제거된 텍스트 기준 1.6테라바이트 (약 3,660억 token)입니다[6].

코퍼스에는 59개 언어의 텍스트가 포함되어 있습니다:

  • 46개의 자연어: 영어(전체 token의 30%), 중국어, 프랑스어, 스페인어, 아랍어를 포함하며, 리소스가 적은 다양한 언어도 포함됩니다 (예: Chi Tumbuka — 전체 token의 0.00002%).
  • 13개의 프로그래밍 언어: Python, Java, JavaScript, C++ 등.

이러한 다국어·다분야 dataset은 다양한 언어 커뮤니티에서 모델을 활용할 수 있도록 의도적으로 구성되었습니다.

성능 및 활용

BLOOM은 다양한 benchmark에서 경쟁력 있는 결과를 보여주며, 다국어 지원에도 불구하고 Meta의 OPT-175B와 같은 유사 규모의 모델과 비교 가능한 수준의 성능을 발휘합니다[2].

이 모델은 추가 훈련 없이 zero-shot 방식으로 다양한 작업을 수행할 수 있습니다:

  • 지정된 스타일의 텍스트 생성.
  • 문서 요약.
  • 문맥 기반 질의응답.
  • 언어 간 번역.
  • 간단한 프로그램 코드 생성.

실용적 유용성을 향상시키기 위해 BigScience 팀은 이후 모델에 대한 추가적인 다중 작업 fine-tuning을 수행하여 사용자의 지시를 더욱 정확하게 따르는 BLOOMZ 버전을 개발했습니다.

라이선스 및 개방형 접근

1,760억 파라미터의 전체 BLOOM 모델, 소스 코드 및 데이터는 2022년 7월에 공개되었습니다. 모델은 특별히 개발된 RAIL (Responsible AI License) v1.0 라이선스 하에 배포됩니다[7].

이 라이선스는 모델의 무료 사용 및 수정을 허용하지만, 특정 분야에서의 사용에는 일부 제한을 부과합니다. 특히 BigScience의 윤리 기준에 위배되는 다음과 같은 목적의 사용은 금지됩니다:

  • 대규모 감시.
  • 알고리즘 기반 차별.
  • 허위 정보 유포.
  • 치명적 무기 통제.

BLOOM은 책임 있는 사용에 관한 명시적 조항이 포함된 라이선스로 출시된 최초의 대규모 AI 모델이 되었습니다[8].

참고 문헌

  • Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
  • Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
  • Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
  • Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
  • BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
  • Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
  • Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
  • Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.

주석

  1. 1.0 1.1 «BLOOM». BigScience Blog. [1]
  2. 2.0 2.1 2.2 Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». arXiv:2211.05100. [2]
  3. «Researchers open-source neural network with 176B parameters». SiliconANGLE. [3]
  4. «bigscience/bloom». Hugging Face. [4]
  5. «The Technology Behind BLOOM Training». Hugging Face Blog. [5]
  6. Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». arXiv:2303.03915. [6]
  7. «BigScience OpenRAIL-M». BigScience Blog. [7]
  8. Heikkilä, M. «BLOOM is the first AI model to be under a...». X. [8]