In-Context Learning (HI)
संदर्भ अधिगम (अंग्रेज़ी: In-Context Learning, ICL) — यह बड़े भाषा मॉडलों (LLM) की एक मूलभूत क्षमता है, जिसके द्वारा वे नए कार्यों को "तत्काल" सीख सकते हैं — केवल उन उदाहरणों (प्रदर्शनों) का उपयोग करके जो अनुरोध के संदर्भ (prompt) में प्रदान किए गए हों। इसकी प्रमुख विशेषता यह है कि यह अनुकूलन प्रक्रिया मॉडल के भार (parameters) को अद्यतन किए बिना होती है, अर्थात पारंपरिक fine-tuning के बिना[1][2]।
यह तंत्र मॉडलों को놀라जनक लचीलापन प्रदर्शित करने में सक्षम बनाता है, जिससे वे ऐसे कार्यों को भी हल कर सकते हैं जिनके लिए उन्हें विशेष रूप से प्रशिक्षित नहीं किया गया था। ICL उन प्रमुख सफलताओं में से एक बन गया है जिसने बड़े भाषा मॉडलों को इतना शक्तिशाली और बहुमुखी बनाया[3]।
कार्य प्रणाली
ICL वास्तव में कैसे काम करता है, इसकी सटीक समझ अनुसंधान का एक सक्रिय क्षेत्र बना हुआ है, हालांकि इस घटना को समझाने के लिए कई प्रमुख सिद्धांत मौजूद हैं।
Transformer - मेटा-अनुकूलक के रूप में
एक लोकप्रिय सिद्धांत के अनुसार, Transformer की वास्तुकला पूर्व-प्रशिक्षण के दौरान अपने forward passes में अधिगम एल्गोरिदम को लागू करना सीखती है। जब मॉडल को उदाहरणों सहित एक prompt प्राप्त होता है, तो वह भार के बजाय अपनी आंतरिक अवस्थाओं (activations) को समायोजित करते हुए प्रस्तुत कार्य को हल करने के लिए एक प्रकार का अनुकूलन अप्रत्यक्ष रूप से निष्पादित करता है[4]।
बेयेसियन अनुमान
एक अन्य सिद्धांत ICL को बेयेसियन अनुमान के एक रूप के रूप में देखता है। विशाल डेटा संग्रह पर पूर्व-प्रशिक्षित मॉडल के पास अनेक अवधारणाओं के बारे में पूर्व (prior) ज्ञान होता है। संदर्भ में दिए गए उदाहरण साक्ष्य के रूप में कार्य करते हैं, जो मॉडल को छिपी हुई अवधारणाओं पर अपने उत्तरकालिक (posterior) संभाव्यता वितरण को परिष्कृत करने में सहायता करते हैं। दूसरे शब्दों में, उदाहरण मॉडल को यह "समझने" में मदद करते हैं कि इस समय उसे अपने ज्ञात हजारों कार्यों में से ठीक कौन-सा कार्य हल करना है[5]।
In-Context Learning के प्रकार
प्रदान किए गए उदाहरणों की संख्या के आधार पर ICL को तीन मुख्य प्रकारों में विभाजित किया जाता है।
- Few-shot Learning (कुछ उदाहरणों पर अधिगम): यह सबसे सामान्य और संतुलित दृष्टिकोण है। मॉडल को कुछ (सामान्यतः 2 से 10) प्रदर्शन उदाहरण प्रदान किए जाते हैं।
उदाहरण (भाव वर्गीकरण):
Текст: "Какой прекрасный день!" Тональность: Позитивная Текст: "Я ненавижу стоять в пробках." Тональность: Негативная Текст: "Этот фильм был довольно средним." Тональность:
अपेक्षित उत्तर:
Нейтральная
- One-shot Learning (एक उदाहरण पर अधिगम): मॉडल को केवल एक उदाहरण दिया जाता है। यह अक्सर उत्तर का प्रारूप निर्धारित करने और zero-shot दृष्टिकोण की तुलना में प्रदर्शन में उल्लेखनीय सुधार के लिए पर्याप्त होता है।
- Zero-shot Learning (बिना उदाहरण के अधिगम): मॉडल को कोई उदाहरण नहीं दिया जाता, केवल निर्देश या कार्य का विवरण दिया जाता है। इस स्थिति में मॉडल पूरी तरह से पूर्व-प्रशिक्षण के दौरान अर्जित ज्ञान पर निर्भर करता है।
व्यावहारिक अनुप्रयोग
ICL का सही उपयोग बिना महंगे विकास और fine-tuning के कार्यों की एक विस्तृत श्रृंखला को हल करने में सक्षम बनाता है।
- रचनात्मक और शैलीगत कार्यों के लिए (एक निश्चित शैली में कोड उत्पन्न करना, किसी विशेष लेखक की शैली में पाठ लिखना):
- Few-shot Learning की अनुशंसा की जाती है।
- उदाहरण मॉडल को आवश्यक शैली, प्रारूप और आउटपुट संरचना को समझने में सहायता करते हैं।
- स्पष्ट निर्देशों वाले सरल कार्यों के लिए (अनुवाद, सारांश, सरल प्रश्नों के उत्तर):
- Zero-shot Learning अक्सर पर्याप्त होता है।
- आधुनिक मॉडल ऐसे कार्यों को पर्याप्त रूप से अच्छी तरह संभालते हैं, यदि वे उनके पूर्व-प्रशिक्षण का हिस्सा रहे हों।
- ऐसे कार्यों के लिए जहाँ आउटपुट का प्रारूप महत्वपूर्ण हो (JSON उत्पन्न करना, इकाइयाँ निकालना):
- One-shot या Few-shot Learning की अनुशंसा की जाती है।
- यहाँ तक कि एक उदाहरण भी आवश्यक उत्तर संरचना को स्पष्ट रूप से निर्धारित कर सकता है, जिससे प्रारूपण संबंधी त्रुटियाँ रोकी जा सकती हैं।
लाभ और हानियाँ
| लाभ | हानियाँ |
|---|---|
|
|
अन्य प्रतिमानों से तुलना
ICL vs. Fine-tuning
Fine-tuning (पुनः प्रशिक्षण) मॉडल के भार को बदलता है, उसमें नए ज्ञान को "अंकित" करता है। इससे मॉडल एक संकीर्ण क्षेत्र में विशेषज्ञ बन जाता है, लेकिन उसका समग्र लचीलापन कम हो जाता है। इसके विपरीत, ICL भार नहीं बदलता और अधिक लचीला होता है, लेकिन संकीर्ण विशेषीकृत कार्यों में जहाँ गहन डोमेन ज्ञान की आवश्यकता होती है, वहाँ प्रदर्शन में पिछड़ सकता है।
ICL vs. RAG (Retrieval-Augmented Generation)
दोनों विधियाँ मॉडल के संदर्भ का विस्तार करती हैं, लेकिन अलग-अलग उद्देश्यों के लिए:
- ICL उदाहरणों का उपयोग करता है ताकि मॉडल को यह सिखाया जा सके कि कार्य कैसे निष्पादित करना है (कौशल का प्रदर्शन)।
- RAG निकाली गई जानकारी का उपयोग करता है ताकि मॉडल को उत्तर के लिए आवश्यक तथ्य प्रदान किए जा सकें (ज्ञान की आपूर्ति)।
व्यवहार में, ICL और RAG को अक्सर सर्वोत्तम परिणाम प्राप्त करने के लिए संयुक्त रूप से उपयोग किया जाता है।
साहित्य
- Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
- Dai, D. et al. (2022). Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers. arXiv:2212.10559.
- Panwar, M.; Ahuja, K.; Goyal, N. (2024). In-Context Learning through the Bayesian Prism. arXiv:2306.04891.
- Müller, S. et al. (2021). Transformers Can Do Bayesian Inference. arXiv:2112.10510.
- Garg, S. et al. (2022). What Can Transformers Learn In-Context? A Case Study of Simple Function Classes. arXiv:2208.01066.
- Min, S. et al. (2022). Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?. arXiv:2202.12837.
- Wang, X. et al. (2023). Explaining and Finding Good Demonstrations for In-Context Learning. arXiv:2302.13971.
- Xie, S. et al. (2024). A Survey on In-Context Learning. arXiv:2301.00234.
- Yu, Z.; Ananiadou, S. (2024). How Do Large Language Models Learn In-Context? Query and Key Matrices of In-Context Heads Are Two Towers for Metric Learning. arXiv:2402.02872.
- Wibisono, K. C.; Wang, Y. (2024). From Unstructured Data to In-Context Learning: Exploring What Tasks Can Be Learned and When. arXiv:2406.00131.
- Chan, J. K. et al. (2022). Data Distributional Properties Drive Emergent In-Context Learning in Transformers. arXiv:2205.05055.
- Hahn, M.; Goyal, N. (2023). A Theory of Emergent In-Context Learning as Implicit Structure Induction. arXiv:2303.07971.
टिप्पणियाँ
- ↑ What is In-Context Learning (ICL)? // Lakera.ai
- ↑ In-Context Learning (ICL) // Hopsworks.ai
- ↑ In-Context Learning, In Context // The Gradient
- ↑ Why Can GPT Learn In-Context? Language Models Secretly Perform Gradient Descent as Meta-Optimizers // arXiv, 2022.
- ↑ Understanding In-Context Learning // Stanford Human-Centered AI, 2023.