PaLM (Pathways Language Model) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

PaLM (Pathways Language Model) — यह Google कंपनी द्वारा विकसित बड़े भाषा मॉडलों (LLM) का एक परिवार है। अप्रैल 2022 में प्रस्तुत मॉडल के पहले संस्करण में 540 अरब पैरामीटर थे और यह उस समय दुनिया के सबसे बड़े भाषा मॉडलों में से एक बन गया, जिसने बड़े पैमाने पर स्केलिंग के परिणामस्वरूप अभूतपूर्व क्षमताओं का प्रदर्शन किया[1]

PaLM की प्रमुख तकनीकी नींव Pathways रही — यह Google की Machine Learning प्रणालियों की एक नई आर्किटेक्चर है, जो हजारों एक्सेलेरेटर चिप्स पर वितरित गणनाओं को कुशलतापूर्वक समन्वित करने में सक्षम है[2]। PaLM इस प्रणाली का पहला बड़े पैमाने पर प्रदर्शन बना, जिसने विशाल स्तरों पर प्रशिक्षण की अभूतपूर्व दक्षता दर्शाई।

Pathways प्रणाली: स्केलिंग का आधार

2021 में Google द्वारा प्रस्तुत Pathways की अवधारणा में एक एकल Neural Network बनाने की परिकल्पना थी, जो विभिन्न डोमेन के लिए ज्ञान को कुशलतापूर्वक सामान्यीकृत कर सके और एक साथ हजारों कार्य कर सके। PaLM इस प्रणाली का पहला बड़े पैमाने पर उपयोग बनी: इसका प्रशिक्षण दो क्लाउड क्लस्टरों (TPU v4 Pods) में संयुक्त 6144 विशेष TPU v4 प्रोसेसरों पर समानांतर रूप से किया गया[1]

अपनी रचना के समय यह किसी एक मॉडल के प्रशिक्षण के लिए उपयोग की गई अब तक की सबसे बड़ी TPU कॉन्फ़िगरेशन थी। प्रणाली ने हार्डवेयर क्षमताओं के उपयोग की रिकॉर्ड दक्षता (57.8% FLOPs) हासिल की, जिससे पूर्ववर्ती परियोजनाओं को पैमाने में उल्लेखनीय रूप से पीछे छोड़ना और आधे ट्रिलियन से अधिक पैरामीटर वाले मॉडल को सफलतापूर्वक प्रशिक्षित करना संभव हुआ[3]

आर्किटेक्चर और प्रशिक्षण डेटा

मॉडल आर्किटेक्चर

PaLM एक सघन (असरल) भाषा मॉडल है जिसमें "केवल डिकोडर" (decoder-only) आर्किटेक्चर है, जो GPT श्रृंखला के मॉडलों के समान है। यह आर्किटेक्चर अगले token की भविष्यवाणी के कार्यों पर केंद्रित है और टेक्स्ट उत्पन्न करने के लिए उपयुक्त है। मानक transformer आर्किटेक्चर के विपरीत, PaLM दक्षता बढ़ाने के लिए कई प्रमुख संशोधनों का उपयोग करती है[1]:

  • समानांतर परतें: Attention तंत्र और फुली-कनेक्टेड परतों की गणना समानांतर में की जाती है, जिससे प्रशिक्षण लगभग 15% तेज हो गया।
  • SwiGLU सक्रियण: मानक ReLU के बजाय SwiGLU सक्रियण फ़ंक्शन का उपयोग, जिसने मॉडल की गुणवत्ता में उल्लेखनीय सुधार किया।

प्रशिक्षण डेटा

PaLM को 780 अरब token के उच्च-गुणवत्ता वाले डेटा कॉर्पस पर प्रशिक्षित किया गया था। डेटासेट बहुभाषी और विविध था, जिसमें शामिल थे[1]:

  • उच्च-गुणवत्ता वाले वेब दस्तावेज़ और पुस्तकें।
  • Wikipedia के लेख।
  • सोशल नेटवर्क के संवाद (कॉर्पस का 50%)।
  • GitHub से स्रोत कोड (कॉर्पस का 5%)।

लगभग 78% डेटा अंग्रेज़ी में था, और शेष 22% बहुभाषी सेट था। Tokenization के लिए एक विशेष "हानिरहित" तकनीक का उपयोग किया गया, जो सभी रिक्त स्थान सुरक्षित रखती थी (कोड के लिए अत्यंत महत्वपूर्ण) और अपरिचित Unicode प्रतीकों को bytes में विभाजित करती थी।

क्षमताएँ और परिणाम

Emergent क्षमताएँ और few-shot सीखना

PaLM ने यह प्रदर्शित किया कि मॉडल के पैमाने, डेटा की मात्रा और कम्प्यूटेशनल क्षमताओं में वृद्धि से emergent (अप्रत्याशित रूप से उभरने वाली) क्षमताएँ उत्पन्न हो सकती हैं। कई कार्यों में मॉडल का प्रदर्शन केवल अधिकतम पैमाने पर पहुँचने पर ही तीव्र और अरैखिक रूप से बढ़ता था, जो नई, पहले न देखी गई क्षमताओं के उभरने का संकेत था[3]

मॉडल का मूल्यांकन few-shot सीखने के तरीके में किया गया (fine-tuning के बिना, prompt में कुछ उदाहरणों के साथ) और इसने 29 में से 28 लोकप्रिय NLP-benchmark पर पिछले बड़े मॉडलों (जैसे GPT-3 और LaMDA) को पीछे छोड़ दिया। BIG-bench के जटिल कार्यों के सेट पर PaLM पहला मॉडल बना जिसके परिणामों ने मानव परीक्षकों के औसत स्तर को पार किया[1]

Chain-of-Thought रीजनिंग

PaLM की सबसे उल्लेखनीय उपलब्धियों में से एक "chain-of-thought prompting" तकनीक का उपयोग करते हुए बहुचरणीय तार्किक रीजनिंग की क्षमता थी[1]। इस पद्धति में मॉडल को ऐसे उदाहरण प्रदान करना शामिल है जहाँ समस्या का समाधान चरण-दर-चरण लिखा होता है। ऐसे उदाहरणों पर प्रशिक्षण के बाद, PaLM नई जटिल समस्याओं को हल करने के लिए अपनी "विचार-श्रृंखला" उत्पन्न करने में सक्षम हुई, जैसे:

  • गणित की समस्याएँ: GSM8K परीक्षण (प्राथमिक विद्यालय स्तर की समस्याएँ) पर PaLM ने 58% समस्याएँ हल कीं, जो fine-tuned मॉडल द्वारा प्राप्त पिछले state-of-the-art परिणाम से बेहतर था।
  • सामान्य बोध की समस्याएँ: मॉडल गैर-तुच्छ समस्याओं के लिए विस्तृत व्याख्याएँ उत्पन्न करने में सक्षम रहा, उदाहरण के लिए पहले न देखे गए चुटकुलों की व्याख्या करना।

इस क्षमता ने मॉडल की "सोच" की प्रक्रिया को अधिक पारदर्शी और मानवीय बनाया।

कोड उत्पन्न करना और बहुभाषिकता

इस तथ्य के बावजूद कि स्रोत कोड प्रशिक्षण डेटा का केवल 5% था, PaLM ने कोड उत्पन्न करने और रूपांतरित करने के कार्यों में OpenAI के विशेष मॉडल Codex के बराबर स्तर प्रदर्शित किया। मॉडल ने अनुवाद सहित बहुभाषी कार्यों में भी मजबूत क्षमताएँ दर्शाईं[3]

विकास और उत्तराधिकारी: PaLM परिवार

PaLM, Google द्वारा विकसित मॉडलों के पूरे परिवार का आधार बना।

PaLM 2

मई 2023 में प्रस्तुत PaLM 2 एक अधिक कुशल और बहुभाषी उत्तराधिकारी बना। पैरामीटरों की संख्या की दौड़ के बजाय, ध्यान प्रशिक्षण डेटा की गुणवत्ता और आर्किटेक्चर की दक्षता पर केंद्रित किया गया। PaLM 2 को 100 से अधिक भाषाओं के पाठों पर प्रशिक्षित किया गया है और यह तर्क, प्रोग्रामिंग तथा अनुवाद में बेहतर क्षमताएँ प्रदर्शित करता है[4]। मॉडल चार आकारों में उपलब्ध है (सबसे छोटे से बड़े तक): Gecko, Otter, Bison और Unicorn। सबसे कॉम्पैक्ट संस्करण (Gecko) ऑफ़लाइन मोड में मोबाइल उपकरणों पर चलाने के लिए पर्याप्त हल्का है।

विशेष संस्करण

PaLM और PaLM 2 के आधार पर विशिष्ट डोमेन के लिए संस्करण बनाए गए:

  • Med-PaLM 2: चिकित्सा के लिए विशेष मॉडल। यह अमेरिका में चिकित्सक लाइसेंस परीक्षा (USMLE) के प्रश्नों पर विशेषज्ञ स्तर तक पहुँचने वाली पहली AI प्रणाली बनी[4]
  • Sec-PaLM 2: साइबर सुरक्षा पर केंद्रित मॉडल, जिसे कमजोरियों की पहचान करने और दुर्भावनापूर्ण कोड का विश्लेषण करने के लिए प्रशिक्षित किया गया है[5]

PaLM-E: Multimodal संस्करण

PaLM-E (Pathways Language Model Embodied) — यह एक multimodal मॉडल है जो PaLM भाषा मॉडल को Vision Transformer (ViT) से दृश्य डेटा के साथ जोड़ता है। यह मॉडल को टेक्स्ट और छवियाँ दोनों संसाधित करने तथा भौतिक दुनिया से संबंधित कार्यों को हल करने में सक्षम बनाता है, उदाहरण के लिए रोबोट नियंत्रण के लिए[6]

नैतिक पहलू और सीमाएँ

PaLM के निर्माता बड़े भाषा मॉडलों के विकास में जिम्मेदार दृष्टिकोण की आवश्यकता पर जोर देते हैं। आधिकारिक वैज्ञानिक लेख में मॉडलीकृत टेक्स्ट में संभावित पूर्वाग्रहों और विषाक्तता का विश्लेषण किया गया। पारदर्शिता सुनिश्चित करने के लिए Google ने PaLM के लिए Model Card और Datasheet प्रकाशित किया, जहाँ dataset की विशेषताएँ, परीक्षण के परिणाम और पहचानी गई सीमाएँ दर्ज हैं[1]। ये उपाय जिम्मेदार AI की आधुनिक प्रथाओं के अनुरूप हैं और पूर्वाग्रहों तथा हानिकारक सामग्री उत्पन्न करने से जुड़े जोखिमों को कम करने के लिए बनाए गए हैं।

संदर्भ

  • PaLM के बारे में Google का आधिकारिक ब्लॉग
  • डेवलपर्स के लिए PaLM API

साहित्य

  • Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
  • Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
  • Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  • Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
  • Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
  • Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
  • Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
  • Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.

टिप्पणियाँ

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [१]
  2. «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [२]
  3. 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [३]
  4. 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [४]
  5. «New AI capabilities that can help address your security challenges». Google Cloud Blog. [५]
  6. «PaLM-E: An embodied multimodal language model». Google Research Blog. [६]