PaLM (Pathways Language Model) (TR)

From Systems analysis Wiki
Jump to navigation Jump to search

PaLM (Pathways Language Model) — Google tarafından geliştirilen büyük dil modelleri (LLM) ailesidir. Nisan 2022'de tanıtılan modelin ilk sürümü 540 milyar parametre içermekte olup, o dönemde dünyanın en büyük dil modellerinden biri olmuş ve büyük ölçekli genişlemenin sonucunda ortaya çıkan çığır açıcı yetenekler sergilemiştir[1].

PaLM'in temel teknolojik altyapısını Pathways oluşturmaktadır. Bu, Google'ın yeni makine öğrenmesi sistemi mimarisi olup binlerce hızlandırıcı çip üzerinde dağıtık hesaplamaları verimli biçimde koordine etmeyi mümkün kılmaktadır[2]. PaLM, bu sistemin ilk büyük ölçekli gösterimi olmuş ve devasa ölçeklerde eşi görülmemiş bir eğitim verimliliği ortaya koymuştur.

Pathways Sistemi: Ölçeklendirmenin Temeli

Google'ın 2021 yılında tanıttığı Pathways kavramı, farklı alanlardaki bilgileri etkin biçimde genelleştirebilen ve binlerce görevi aynı anda yerine getirebilen tek bir sinir ağının oluşturulmasını öngörmekteydi. PaLM bu sistemin ilk büyük ölçekli uygulaması oldu: eğitimi, iki bulut kümesinde (TPU v4 Pod'ları) bir araya getirilen 6144 adet özel TPU v4 işlemci üzerinde paralel olarak gerçekleştirildi[1].

Oluşturulduğu dönemde bu, tek bir modelin eğitimi için kullanılan en büyük TPU konfigürasyonuydu. Sistem, donanım kapasitesinin kullanımında rekor bir verimlilik (%57,8 FLOPs) elde etti; bu sayede önceki projeler büyük ölçüde aşıldı ve yarım trilyonun üzerinde parametreye sahip model başarıyla eğitildi[3].

Mimari ve Eğitim Verileri

Model Mimarisi

PaLM, GPT serisi modellere benzer şekilde "yalnızca-çözücü" (decoder-only) mimariye sahip, yoğun (seyrek olmayan) bir dil modelidir. Bu mimari, bir sonraki token'ı tahmin etme görevlerine yönelik olup metin üretimi için oldukça uygundur. Standart transformer mimarisinden farklı olarak PaLM, verimliliği artırmak amacıyla birkaç temel değişiklik kullanmaktadır[1]:

  • Paralel katmanlar: Dikkat mekanizmaları ve tam bağlantılı katmanlar paralel olarak hesaplanmakta; bu durum eğitimi yaklaşık %15 oranında hızlandırmıştır.
  • SwiGLU aktivasyonu: Standart ReLU yerine SwiGLU aktivasyon fonksiyonunun kullanılması, modelin kalitesini önemli ölçüde artırmıştır.

Eğitim Verileri

PaLM, 780 milyar token hacminde yüksek kaliteli bir veri kümesi üzerinde eğitilmiştir. Veri kümesi çok dilli ve çeşitli yapıda olup şunları kapsamaktadır[1]:

  • Yüksek kaliteli web belgeleri ve kitaplar.
  • Vikipedi makaleleri.
  • Sosyal medya diyalogları (külliyatın %50'si).
  • GitHub'dan alınan kaynak kodlar (külliyatın %5'i).

Verilerin yaklaşık %78'i İngilizce, geri kalan %22'si ise çok dilli içerikten oluşmaktadır. Token'laştırma için tüm boşlukları koruyan (kod için kritik öneme sahip) ve tanınmayan Unicode karakterlerini baytlara ayıran özel bir "kayıpsız" yöntem kullanılmıştır.

Yetenekler ve Sonuçlar

Ortaya Çıkan (Emergent) Yetenekler ve Few-Shot Öğrenme

PaLM, model ölçeğinin, veri hacminin ve hesaplama kapasitesinin artırılmasının ortaya çıkan (beklenmedik biçimde beliren) yeteneklere yol açabileceğini göstermiştir. Pek çok görevde modelin performansı yalnızca maksimum ölçeğe ulaşıldığında ani ve doğrusal olmayan biçimde artmış; bu durum daha önce gözlemlenmemiş yeni yeteneklerin ortaya çıkmasına işaret etmiştir[3].

Model, few-shot öğrenme modunda (ince ayar yapılmaksızın, prompt içinde birkaç örnekle) değerlendirilmiş ve 29 popüler NLP benchmark'ının 28'inde GPT-3 ve LaMDA gibi önceki büyük modelleri geride bırakmıştır. Kapsamlı BIG-bench görev kümesinde PaLM, sonuçları insan test katılımcılarının ortalama düzeyini aşan ilk model olmuştur[1].

Chain-of-Thought (Düşünce Zinciri) ile Akıl Yürütme

PaLM'in en dikkat çekici başarılarından biri, "düşünce zinciri" (chain-of-thought prompting) tekniği kullanıldığında çok adımlı mantıksal akıl yürütme yeteneğidir[1]. Bu yöntem, modele bir görevi adım adım çözüme kavuşturan örneklerin sunulmasını içermektedir. Bu tür örnekler üzerinde eğitilen PaLM, aşağıdaki gibi yeni ve karmaşık görevleri çözmek için kendi "düşünce zincirini" üretebilmiştir:

  • Matematik görevleri: GSM8K testinde (ilkokul düzeyindeki görevler) PaLM görevlerin %58'ini çözerek daha önce ince ayarlı bir model tarafından ulaşılan state-of-the-art sonucunu geride bırakmıştır.
  • Sağduyu gerektiren görevler: Model, daha önce karşılaşılmamış fıkraları yorumlamak gibi alışılmışın dışındaki görevler için ayrıntılı açıklamalar üretebilmiştir.

Bu yetenek, modelin "düşünme" sürecini daha şeffaf ve insana özgü bir görünüme kavuşturmuştur.

Kod Üretimi ve Çok Dillilik

Kaynak kodların eğitim verilerinin yalnızca %5'ini oluşturmasına karşın PaLM, kod üretimi ve dönüştürme görevlerinde OpenAI'nin özelleşmiş modeli Codex ile kıyaslanabilir bir düzey sergilemiştir. Model ayrıca çeviri dahil çok dilli görevlerde güçlü yetenekler ortaya koymuştur[3].

Evrim ve Ardıllar: PaLM Ailesi

PaLM, Google tarafından geliştirilen tüm bir modeller ailesinin temeli haline gelmiştir.

PaLM 2

Mayıs 2023'te tanıtılan PaLM 2, daha verimli ve çok dilli bir ardıl olarak öne çıkmaktadır. Parametre sayısını artırmak yerine odak noktası eğitim verilerinin kalitesine ve mimari verimliliğe kaydırılmıştır. PaLM 2, 100'den fazla dilde metinler üzerinde eğitilmiş olup mantık yürütme, programlama ve çeviri alanlarında gelişmiş yetenekler sergilemektedir[4]. Model dört boyutta sunulmaktadır (küçükten büyüğe): Gecko, Otter, Bison ve Unicorn. En kompakt sürüm olan Gecko, mobil cihazlarda çevrimdışı çalışabilecek kadar hafiftir.

Özelleştirilmiş Sürümler

PaLM ve PaLM 2 temel alınarak belirli alanlara yönelik sürümler oluşturulmuştur:

  • Med-PaLM 2: Tıp alanına özel bir model. ABD'de tıp lisans sınavı sorularında (USMLE) uzman düzeyine ulaşan ilk yapay zeka sistemi olmuştur[4].
  • Sec-PaLM 2: Siber güvenliğe yönelik bir model olup güvenlik açıklarını tespit etmek ve zararlı kodu analiz etmek üzere eğitilmiştir[5].

PaLM-E: Çok Modlu Sürüm

PaLM-E (Pathways Language Model Embodied), PaLM dil modelini Vision Transformer (ViT) görsel verileriyle birleştiren çok modlu bir modeldir. Bu sayede model hem metin hem de görüntü işleyebilmekte; örneğin robot kontrolü gibi fiziksel dünyayla ilgili görevleri yerine getirebilmektedir[6].

Etik Boyutlar ve Sınırlılıklar

PaLM'in geliştiricileri, büyük dil modellerinin geliştirilmesinde sorumlu bir yaklaşımın gerekliliğini vurgulamaktadır. Resmi bilimsel makalede, modelin ürettiği metindeki olası önyargılar ve toksisite analiz edilmiştir. Şeffaflığı sağlamak amacıyla Google, PaLM için bir model kartı (Model Card) ve veri pasaportu (Datasheet) yayımlamış; bu belgeler veri kümesi özelliklerini, test sonuçlarını ve tespit edilen sınırlılıkları belgelemektedir[1]. Bu önlemler, sorumlu yapay zeka konusundaki çağdaş uygulamalarla örtüşmekte ve önyargılar ile zararlı içerik üretimiyle ilişkili riskleri azaltmayı hedeflemektedir.

Dış bağlantılar

  • Google'ın PaLM hakkındaki resmi blogu
  • Geliştiriciler için PaLM API

Kaynakça

  • Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
  • Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
  • Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  • Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
  • Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
  • Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
  • Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
  • Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.

Notlar

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [1]
  2. «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [2]
  3. 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [3]
  4. 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [4]
  5. «New AI capabilities that can help address your security challenges». Google Cloud Blog. [5]
  6. «PaLM-E: An embodied multimodal language model». Google Research Blog. [6]