Chinchilla (language model) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

Chinchilla — यह एक बड़ा भाषा मॉडल (LLM) है, जिसे DeepMind की शोध टीम ने विकसित किया और मार्च 2022 में प्रस्तुत किया[1]। इस मॉडल में लगभग 70 अरब parameters हैं और इसे 1.4 खरब tokens के पाठ corpus पर प्रशिक्षित किया गया था।

Chinchilla की प्रमुख विशेषता इसका गणनात्मक रूप से अनुकूलतम (computationally optimal) प्रशिक्षण दृष्टिकोण है। पिछले मॉडलों के विपरीत, जहाँ मुख्य ज़ोर parameters की संख्या बढ़ाने पर था, Chinchilla को इस परिकल्पना के आधार पर बनाया गया था कि मॉडल के आकार और प्रशिक्षण डेटा की मात्रा दोनों को आनुपातिक रूप से बढ़ाना आवश्यक है। इस दृष्टिकोण के कारण Chinchilla ने Gopher (280 अरब parameters) और GPT-3 (175 अरब parameters) जैसे बड़े मॉडलों की तुलना में भाषाई कार्यों की एक विस्तृत श्रृंखला पर श्रेष्ठता प्रदर्शित की[2]

पृष्ठभूमि और निर्माण का इतिहास

Chinchilla का विकास DeepMind में Gopher मॉडल परिवार के आधार पर किए जा रहे LLM scaling शोध का परिणाम था[3]। 2021 में प्रस्तुत Gopher मॉडल में 280 अरब parameters थे, लेकिन इसे तुलनात्मक रूप से छोटे 300 अरब tokens के corpus पर प्रशिक्षित किया गया था। उस समय उद्योग में यह दृष्टिकोण हावी था कि मॉडलों का प्रदर्शन मुख्यतः उनके आकार (parameters की संख्या) में वृद्धि से बढ़ता है, जबकि डेटा की मात्रा अपेक्षाकृत स्थिर रहती है।

गणनात्मक रूप से अनुकूलतम प्रशिक्षण की परिकल्पना

DeepMind के शोधकर्ताओं ने यह परिकल्पना प्रस्तुत की कि Gopher सहित कई बड़े मॉडल अपने आकार के सापेक्ष अल्प-प्रशिक्षित (undertrained) थे। वे निर्धारित गणनात्मक बजट में अधिकतम संभव गुणवत्ता प्राप्त नहीं कर पाते थे, क्योंकि उनके पास प्रशिक्षण के लिए पर्याप्त डेटा नहीं था[2]

इस परिकल्पना का सार यह था कि गणनात्मक संसाधनों के अनुकूलतम उपयोग के लिए मॉडल के आकार और प्रशिक्षण डेटा की मात्रा को आनुपातिक रूप से एक साथ बढ़ाना चाहिए। दूसरे शब्दों में, मॉडल के parameters की संख्या दोगुनी करने पर प्रशिक्षण tokens की संख्या भी लगभग दोगुनी करनी चाहिए[1]। यह निष्कर्ष पिछले शोधों से भिन्न था, जो मॉडल के आकार में वृद्धि के मूल्य को अधिक आँकते थे, क्योंकि वे शोध डेटा की निश्चित मात्रा के साथ किए गए थे।

इस परिकल्पना को परखने के लिए DeepMind की टीम ने व्यापक प्रयोग किए और 5 से 500 अरब tokens के datasets पर विभिन्न आकारों के 400 से अधिक मॉडलों को प्रशिक्षित किया। परिणामों ने यह सिद्ध किया कि समानांतर scaling एक अनुकूलतम रणनीति है। इन्हीं निष्कर्षों के आधार पर नई प्रतिमान के व्यावहारिक परीक्षण के रूप में Chinchilla मॉडल विकसित किया गया[4]

आर्किटेक्चर और प्रशिक्षण

आर्किटेक्चर की विशेषताएँ

Chinchilla autoregressive transformer परिवार से संबंधित है और आर्किटेक्चर की दृष्टि से GPT-2/GPT-3 मॉडलों के निकट है[3]। इसने Gopher से कई समाधान विरासत में लिए, लेकिन नेटवर्क की गहराई बनाए रखते हुए आकार कम करने के उद्देश्य से कुछ महत्वपूर्ण अंतरों के साथ:

  • Parameters: ~70 अरब parameters, 80 परतों में वितरित।
  • मॉडल की चौड़ाई: Self-attention heads की संख्या घटाकर 64 कर दी गई (Gopher में 128 थी) और परतों की आंतरिक dimension घटाकर 8192 कर दी गई (Gopher में ~16384 थी)।
  • Optimizer: Adam के स्थान पर AdamW का उपयोग किया जाता है, जो बड़े datasets पर convergence को बेहतर बनाता है[3]

इस आर्किटेक्चर ने Chinchilla को Gopher जितनी ही नेटवर्क गहराई बनाए रखने की अनुमति दी, लेकिन काफी कम parameters के साथ, जिससे memory और गणनात्मक संसाधनों की आवश्यकता कम हो गई।

Scaling और प्रशिक्षण डेटा

परिकल्पना को परखने के लिए Chinchilla को उतने ही गणनात्मक बजट के साथ प्रशिक्षित किया गया जितने से Gopher को, लेकिन संसाधनों को डेटा की ओर पुनर्वितरित करके। 70 अरब parameters वाले मॉडल को 1.4 खरब tokens के corpus पर प्रशिक्षित किया गया, जो Gopher के लिए उपयोग किए गए डेटा की मात्रा से लगभग 4 गुना अधिक है[1]

यह अनुपात, लगभग प्रत्येक parameter के लिए 20 tokens, Chinchilla Point के नाम से जाना जाने लगा और यह आधुनिक LLM के गणनात्मक रूप से अनुकूलतम प्रशिक्षण के लिए एक मानक बन गया है[5]। इस प्रयोग ने पुष्टि की कि इस अनुकूलतम सीमा के निकट प्रशिक्षित होने के कारण Chinchilla अल्प-प्रशिक्षित लेकिन अधिक बड़े मॉडलों की तुलना में अपनी क्षमता को अधिक पूर्णता से साकार कर सकी।

परिणाम और प्रदर्शन

मानक परीक्षणों के व्यापक समूह पर Chinchilla ने पिछले मॉडलों की तुलना में उल्लेखनीय श्रेष्ठता प्रदर्शित की। उसने न केवल Gopher को, बल्कि उस समय के अन्य अत्याधुनिक LLM को भी पीछे छोड़ा, जिनमें OpenAI GPT-3 (175 अरब parameters) और Megatron-Turing NLG (530 अरब parameters) शामिल हैं[1]

सबसे उल्लेखनीय परिणाम MMLU (Measuring Massive Multitask Language Understanding) benchmark पर रहा, जो सैकड़ों विविध कार्यों में ज्ञान और तर्कशक्ति का मूल्यांकन करता है। Chinchilla ने 67.5% की औसत सटीकता प्राप्त की, जो इस श्रेणी के मॉडलों के लिए एक नया रिकॉर्ड था और Gopher के परिणाम से 7 प्रतिशत अंक अधिक था[4]

उच्च दक्षता के अलावा, Chinchilla ने उपयोग में किफायत भी प्रदर्शित की। मॉडल का छोटा आकार (समकक्ष मॉडलों के 175+ अरब की तुलना में 70 अरब parameters) का अर्थ है कि logical inference (inference) और fine-tuning के लिए काफी कम गणनात्मक संसाधनों की आवश्यकता होती है, जिससे इसका व्यावहारिक उपयोग सरल हो जाता है।

महत्व और प्रभाव

Chinchilla के शोध ने बड़े भाषा मॉडलों के प्रशिक्षण के दृष्टिकोणों पर मौलिक प्रभाव डाला।

  • Chinchilla scaling laws (Chinchilla scaling laws): मॉडल के आकार और डेटा की मात्रा के बीच पहचाना गया अनुकूलतम अनुपात उद्योग में बाद के विकास के लिए एक वास्तविक मानक और दिशानिर्देश बन गया।
  • आकार से डेटा की ओर ध्यान का स्थानांतरण: इस कार्य ने उद्योग को केवल parameters की संख्या अनियंत्रित रूप से बढ़ाने के बजाय प्रशिक्षण corpus के निर्माण, शुद्धिकरण और विस्तार पर अधिक ध्यान देने के लिए प्रेरित किया।
  • Multimodal प्रणालियों में उपयोग: Chinchilla को DeepMind के multimodal मॉडल Flamingo में मुख्य भाषाई घटक के रूप में उपयोग किया गया, जो छवियों और पाठ को समझने में सक्षम है[6]

यद्यपि Chinchilla मॉडल को स्वयं सार्वजनिक पहुँच के लिए जारी नहीं किया गया था, लेकिन वैज्ञानिक पत्र में प्रकाशित इसकी अवधारणाओं और परिणामों ने LLM के पूरे क्षेत्र के विकास की दिशा बदल दी, और कृत्रिम बुद्धिमत्ता की क्षमताओं के अधिक कुशल और संतुलित विकास का मार्ग प्रशस्त किया।

साहित्य

  • Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
  • Loshchilov, I.; Hutter, F. (2017). Decoupled Weight Decay Regularization. arXiv:1711.05101.
  • Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
  • Kaplan, J.; et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Brown, T. B.; et al. (2020). Language Models are Few‑Shot Learners. arXiv:2005.14165.
  • Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Rae, J.; et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Hoffmann, J.; et al. (2022). Training Compute‑Optimal Large Language Models. arXiv:2203.15556.
  • Alayrac, J.‑B.; et al. (2022). Flamingo: A Visual Language Model for Few‑Shot Learning. arXiv:2204.14198.
  • Hendrycks, D.; et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.

टिप्पणियाँ

  1. 1.0 1.1 1.2 1.3 Hoffmann, J. et al. (2022). «Training Compute-Optimal Large Language Models». NeurIPS 2022. [१]
  2. 2.0 2.1 Wali, K. (2022). «DeepMind launches GPT-3 rival, Chinchilla». Analytics India Magazine. [२]
  3. 3.0 3.1 3.2 Rae, J. et al. (2022). «Scaling Language Models: Methods, Analysis & Insights from Training Gopher». arXiv:2112.11446.
  4. 4.0 4.1 «Training Compute-Optimal Large Language Models». proceedings.neurips.cc.
  5. «What is the Chinchilla Point ("Chinchilla Optimal")?». Legal Genie.
  6. «Chinchilla (language model)». Wikipedia.