BLOOM (language model) (TR)

From Systems analysis Wiki
Jump to navigation Jump to search

BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) — açık erişimli, 176 milyar parametreli büyük bir dil modelidir (LLM). Model, Hugging Face şirketinin himayesinde 70 ülkeden 1000'den fazla araştırmacının uluslararası iş birliğiyle oluşturulan BigScience projesi kapsamında 2022 yılında geliştirilmiştir[1].

BLOOM, 46 doğal dil ve 13 programlama dilinde tutarlı metin üretebilen bir otoregressif transformer modelidir. Model, Fransa'daki Jean Zay süperbilgisayarında eğitilmiş ve OpenAI'nin GPT-3'ü gibi kapalı modellere karşı gerçek anlamda açık olan ilk alternatiflerden biri hâline gelmiştir[2].

Arka Plan ve Geliştirme

BigScience girişimi, büyük bir açık dil modelinin ortaklaşa oluşturulması yoluyla yapay zeka araştırmalarını demokratikleştirme amacıyla Mayıs 2021'de başlatılmıştır[1]. O dönemde GPT-3 gibi öncü LLM'ler, mimarilerini, eğitim verilerini ve kaynak kodlarını kamuoyuyla paylaşmayan büyük şirketler tarafından kapalı bir şekilde geliştiriliyordu. BigScience projesi, rekabetçi ve tamamen açık bir model oluşturmak amacıyla dünyanın dört bir yanından binden fazla gönüllü araştırmacıyı bir araya getirmiştir.

Proje, Fransız süperbilgisayarı Jean Zay (IDRIS/CNRS) üzerindeki hesaplama kaynakları için hibe almıştır. Modelin eğitimi 11 Mart - 6 Temmuz 2022 tarihleri arasında gerçekleştirilmiştir[3]. Geliştirme süreci mümkün olan en şeffaf biçimde yürütülmüş; ekip, projenin kabul edilmiş etik tüzüğüne uygun olarak veri seçimi ve eğitim ayarlarına ilişkin bilgileri yayımlamış, kamuya açık tartışmalar düzenlemiştir.

Mimari ve Eğitim

Model Mimarisi

BLOOM, GPT-3 modeline benzer şekilde otoregressif türde bir transformer mimarisi (decoder-only) üzerine inşa edilmiştir[2].

BLOOM'un Mimari Özellikleri[4]
Parametre Özellik
Tür Yalnızca decoder'dan oluşan transformer
Parametreler 176 247 271 424
Katmanlar (layers) 70
Attention başlıkları 112
Gizli durum boyutu 14 336
Dizi uzunluğu 2048 token
Aktivasyon fonksiyonu GeLU; ALiBi konumsal kodlamaları

Model, sırasıyla Nvidia ve Microsoft tarafından geliştirilen Megatron-LM ve DeepSpeed framework'leri temel alınarak, verimli dağıtık eğitim için bir dizi değişiklikle hayata geçirilmiştir[5].

Eğitim Verileri

BLOOM, özel olarak oluşturulan ROOTS (The Responsible Open-science Open-collaboration Text Sources) metin veri kümesi üzerinde eğitilmiştir. Toplam veri hacmi, temizlenmiş ve tekilleştirilmiş metinden oluşan 1,6 terabayt (≈366 milyar token) düzeyindedir[6].

Veri kümesi 59 dildeki metinleri kapsamaktadır:

  • İngilizce (token'ların %30'u), Çince, Fransızca, İspanyolca, Arapça ve kaynakları kısıtlı pek çok dil dahil olmak üzere (örneğin Chi Tumbuka — token'ların %0,00002'si) 46 doğal dil.
  • Python, Java, JavaScript ve C++ dahil olmak üzere 13 programlama dili.

Bu çok dilli ve çok alanlı dataset, modeli geniş bir dil topluluğu yelpazesine uygun hâle getirmek amacıyla bilinçli olarak bir araya getirilmiştir.

Performans ve Kullanım Alanları

BLOOM, çok dilli yapısına karşın Meta'nın OPT-175B'si gibi benzer büyüklükteki modellerle kıyaslanabilir düzeyde olmak üzere çeşitli benchmark'larda rekabetçi sonuçlar sergilemektedir[2].

Model, ek eğitim gerektirmeksizin zero-shot modunda aşağıdakiler de dahil olmak üzere geniş bir görev yelpazesini yerine getirebilmektedir:

  • Belirli bir üslupta metin üretimi.
  • Belge özetleme.
  • Bağlama dayalı soru yanıtlama.
  • Diller arası çeviri.
  • Basit program kodu üretimi.

Pratik kullanışlılığı artırmak amacıyla BigScience ekibi daha sonra modele ek çok görevli fine-tuning uygulamış ve kullanıcı talimatlarını daha doğru biçimde izleyen BLOOMZ sürümünü oluşturmuştur.

Lisanslama ve Açık Erişim

176 milyar parametreli BLOOM modelinin tamamı, kaynak kodu ve verileri Temmuz 2022'de yayımlanmıştır. Model, özel olarak tasarlanan RAIL (Responsible AI License) v1.0 lisansı kapsamında dağıtılmaktadır[7].

Bu lisans, modelin ücretsiz kullanımına ve değiştirilmesine izin vermekle birlikte belirli alanlarda uygulanmasına yönelik birtakım kısıtlamalar getirmektedir. Özellikle BLOOM'un aşağıdakiler gibi BigScience'ın etik normlarıyla çelişen amaçlarla kullanılması yasaktır:

  • Toplu gözetleme.
  • Algoritmik ayrımcılık.
  • Dezenformasyon yayma.
  • Öldürücü silah sistemlerinin yönetimi.

BLOOM, sorumlu kullanıma ilişkin açık hükümler içeren bir lisansla yayımlanan ilk büyük yapay zeka modeli olmuştur[8].

Kaynakça

  • Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
  • Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
  • Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
  • Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
  • BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
  • Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
  • Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
  • Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.

Notlar

  1. 1.0 1.1 «BLOOM». BigScience Blog. [1]
  2. 2.0 2.1 2.2 Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». arXiv:2211.05100. [2]
  3. «Researchers open-source neural network with 176B parameters». SiliconANGLE. [3]
  4. «bigscience/bloom». Hugging Face. [4]
  5. «The Technology Behind BLOOM Training». Hugging Face Blog. [5]
  6. Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». arXiv:2303.03915. [6]
  7. «BigScience OpenRAIL-M». BigScience Blog. [7]
  8. Heikkilä, M. «BLOOM is the first AI model to be under a...». X. [8]