BLOOM (language model) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) — یک مدل زبانی بزرگ (LLM) با دسترسی آزاد است که دارای ۱۷۶ میلیارد پارامتر می‌باشد. این مدل در سال ۲۰۲۲ در چارچوب پروژه BigScience — همکاری بین‌المللی بیش از ۱۰۰۰ پژوهشگر از ۷۰ کشور زیر نظر شرکت Hugging Face — توسعه یافت[1].

BLOOM یک مدل transformer خودبازگشتی است که قادر به تولید متن منسجم به ۴۶ زبان طبیعی و ۱۳ زبان برنامه‌نویسی است. این مدل بر روی ابررایانه Jean Zay در فرانسه آموزش دیده و به یکی از اولین جایگزین‌های واقعاً آزاد برای مدل‌های بسته‌ای مانند GPT-3 ساخت OpenAI تبدیل شده است[2].

پیشینه و توسعه

ابتکار BigScience در مه ۲۰۲۱ با هدف دموکراتیزه‌کردن پژوهش در حوزه هوش مصنوعی از طریق ساخت مشترک یک مدل زبانی بزرگ و آزاد راه‌اندازی شد[1]. در آن زمان، LLMهای پیشرفته‌ای مانند GPT-3 به‌صورت بسته در شرکت‌های بزرگ توسعه می‌یافتند و معماری، داده‌های آموزشی و کد منبع آن‌ها فاش نمی‌شد. پروژه BigScience بیش از هزار پژوهشگر داوطلب از سراسر جهان را برای ساخت یک مدل رقابتی و کاملاً آزاد گرد هم آورد.

این پروژه گرانتی برای منابع محاسباتی بر روی ابررایانه فرانسوی Jean Zay (IDRIS/CNRS) دریافت کرد. آموزش مدل از ۱۱ مارس تا ۶ جولای ۲۰۲۲ ادامه یافت[3]. توسعه با حداکثر شفافیت انجام شد: تیم اطلاعاتی درباره انتخاب داده‌ها و تنظیمات آموزشی منتشر کرد و بحث‌های عمومی برگزار نمود و منشور اخلاقی پذیرفته‌شده پروژه را دنبال کرد.

معماری و آموزش

معماری مدل

BLOOM بر پایه معماری transformer خودبازگشتی (decoder-only) ساخته شده که مشابه مدل GPT-3 است[2].

مشخصات معماری BLOOM[4]
پارامتر مشخصه
نوع Transformer از نوع Decoder-only
پارامترها 176 247 271 424
لایه‌ها (layers) 70
سرهای توجه (attention heads) 112
اندازه حالت پنهان 14 336
طول دنباله 2048 توکن
تابع فعال‌سازی GeLU؛ کدگذاری‌های موضعی ALiBi

مدل بر پایه فریم‌ورک‌های Megatron-LM و DeepSpeed، که به‌ترتیب توسط Nvidia و Microsoft توسعه یافته‌اند، با تعدادی تغییر برای آموزش توزیع‌شده کارآمد پیاده‌سازی شده است[5].

داده‌های آموزشی

BLOOM بر روی مجموعه داده متنی ساخته‌شده به‌طور ویژه به نام ROOTS (The Responsible Open-science Open-collaboration Text Sources) آموزش دیده است. حجم کل داده‌ها ۱٫۶ ترابایت متن پاک‌سازی‌شده و حذف‌تکراری‌شده (≈۳۶۶ میلیارد توکن) بود[6].

این مجموعه داده شامل متون به ۵۹ زبان است:

  • ۴۶ زبان طبیعی، از جمله انگلیسی (۳۰٪ توکن‌ها)، چینی، فرانسوی، اسپانیایی، عربی، و همچنین بسیاری از زبان‌های کم‌منبع (مثلاً Chi Tumbuka — ۰٫۰۰۰۰۲٪ توکن‌ها).
  • ۱۳ زبان برنامه‌نویسی، از جمله Python، Java، JavaScript و C++.

این dataset چندزبانه و چندحوزه‌ای به‌عمد گردآوری شد تا مدل برای طیف گسترده‌ای از جوامع زبانی قابل استفاده باشد.

عملکرد و کاربرد

BLOOM نتایج رقابتی بر روی benchmark‌های گوناگون نشان می‌دهد که با مدل‌های هم‌اندازه‌ای مانند OPT-175B ساخت Meta قابل مقایسه است، با وجود ماهیت چندزبانه‌اش[2].

این مدل قادر است طیف گسترده‌ای از وظایف را در حالت zero-shot (بدون آموزش اضافی) انجام دهد، از جمله:

  • تولید متن به سبک مشخص.
  • خلاصه‌سازی اسناد.
  • پاسخ به سؤالات بر اساس متن.
  • ترجمه میان زبان‌ها.
  • تولید کد برنامه‌نویسی ساده.

برای بهبود سودمندی عملی، تیم BigScience بعداً fine-tuning چندوظیفه‌ای اضافی بر روی مدل انجام داد و نسخه‌ای به نام BLOOMZ ایجاد کرد که دستورالعمل‌های کاربر را با دقت بیشتری دنبال می‌کند.

مجوز و دسترسی آزاد

مدل کامل ۱۷۶ میلیارد پارامتری BLOOM، کد منبع و داده‌های آن در جولای ۲۰۲۲ منتشر شدند. مدل تحت مجوز ویژه‌طراحی‌شده RAIL (Responsible AI License) v1.0 توزیع می‌شود[7].

این مجوز استفاده و تغییر رایگان مدل را مجاز می‌داند، اما تعدادی محدودیت بر کاربرد آن در حوزه‌های خاص اعمال می‌کند. به‌ویژه، استفاده از BLOOM برای اهدافی که با هنجارهای اخلاقی BigScience در تضاد است ممنوع می‌باشد، مانند:

  • نظارت گسترده.
  • تبعیض الگوریتمی.
  • انتشار اطلاعات غلط.
  • کنترل تسلیحات کشنده.

BLOOM اولین مدل بزرگ هوش مصنوعی بود که تحت مجوزی با قید صریح استفاده مسئولانه منتشر شد[8].

منابع

  • Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
  • Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
  • Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
  • Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
  • BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
  • Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
  • Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
  • Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.

یادداشت‌ها

  1. 1.0 1.1 «BLOOM». BigScience Blog. [۱]
  2. 2.0 2.1 2.2 Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». arXiv:2211.05100. [۲]
  3. «Researchers open-source neural network with 176B parameters». SiliconANGLE. [۳]
  4. «bigscience/bloom». Hugging Face. [۴]
  5. «The Technology Behind BLOOM Training». Hugging Face Blog. [۵]
  6. Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». arXiv:2303.03915. [۶]
  7. «BigScience OpenRAIL-M». BigScience Blog. [۷]
  8. Heikkilä, M. «BLOOM is the first AI model to be under a...». X. [۸]