In-Context Learning (BN)
প্রসঙ্গ-ভিত্তিক শিক্ষণ (ইংরেজি: In-Context Learning, ICL) — এটি বৃহৎ ভাষা মডেলের (LLM) একটি মৌলিক সক্ষমতা, যার মাধ্যমে মডেলগুলি কেবলমাত্র অনুরোধের প্রসঙ্গে (prompt-এ) প্রদত্ত উদাহরণ (প্রদর্শনী) ব্যবহার করে নতুন কাজ "তাৎক্ষণিকভাবে" শিখতে পারে। এর মূল বৈশিষ্ট্য হলো যে এই অভিযোজন প্রক্রিয়াটি মডেলের ওজন (প্যারামিটার) আপডেট না করেই ঘটে, অর্থাৎ প্রচলিত fine-tuning ছাড়াই[1][2]।
এই প্রক্রিয়াটি মডেলগুলিকে অসাধারণ নমনীয়তা প্রদর্শন করতে সক্ষম করে, এমন কাজ সমাধান করতে পারে যার জন্য সেগুলিকে বিশেষভাবে প্রশিক্ষিত করা হয়নি। ICL বৃহৎ ভাষা মডেলগুলিকে এতটাই শক্তিশালী ও বহুমুখী করে তোলার ক্ষেত্রে অন্যতম প্রধান অগ্রগতি হিসেবে বিবেচিত হয়[3]।
কার্যপ্রণালী
ICL কীভাবে কাজ করে তার সঠিক বোঝাপড়া এখনো সক্রিয় গবেষণার বিষয়, তবে এই ঘটনাটি ব্যাখ্যা করার জন্য বেশ কয়েকটি প্রধান তত্ত্ব রয়েছে।
Transformer হিসেবে মেটা-অপ্টিমাইজার
একটি জনপ্রিয় তত্ত্ব অনুযায়ী, Transformer আর্কিটেকচার প্রাক-প্রশিক্ষণের সময় তার forward pass-এ শিক্ষণ অ্যালগরিদম বাস্তবায়ন করতে শেখে। যখন মডেলটি উদাহরণসহ একটি prompt পায়, তখন এটি উপস্থাপিত কাজটি সমাধানের জন্য একধরনের অন্তর্নিহিত অপ্টিমাইজেশন সম্পাদন করে — ওজন নয়, বরং তার অভ্যন্তরীণ অবস্থা (activation) সামঞ্জস্য করে[4]।
Bayesian অনুমান
আরেকটি তত্ত্ব ICL-কে Bayesian অনুমানের একটি রূপ হিসেবে বিবেচনা করে। বিশাল তথ্যভান্ডারে প্রাক-প্রশিক্ষিত মডেলটির অনেক ধারণা সম্পর্কে পূর্বধারণা (prior) থাকে। প্রসঙ্গের উদাহরণগুলি প্রমাণ হিসেবে কাজ করে, যা মডেলকে সুপ্ত ধারণাগুলির উপর তার পশ্চাৎবর্তী সম্ভাবনা বিতরণ (posterior distribution) পরিশোধন করতে সাহায্য করে। অন্য কথায়, উদাহরণগুলি মডেলকে "বুঝতে" সাহায্য করে যে তার জানা হাজারো কাজের মধ্যে এই মুহূর্তে ঠিক কোনটি সমাধান করতে হবে[5]।
In-Context Learning-এর প্রকারভেদ
প্রদত্ত উদাহরণের সংখ্যার উপর নির্ভর করে ICL-কে তিনটি প্রধান প্রকারে ভাগ করা হয়।
- Few-shot Learning (কয়েকটি উদাহরণে শিক্ষণ): এটি সবচেয়ে প্রচলিত ও সুষম পদ্ধতি। মডেলকে কয়েকটি (সাধারণত ২ থেকে ১০টি) প্রদর্শনী উদাহরণ দেওয়া হয়।
উদাহরণ (অনুভূতি শ্রেণিবিভাগ):
Текст: "Какой прекрасный день!" Тональность: Позитивная Текст: "Я ненавижу стоять в пробках." Тональность: Негативная Текст: "Этот фильм был довольно средним." Тональность:
প্রত্যাশিত উত্তর:
Нейтральная
- One-shot Learning (একটি উদাহরণে শিক্ষণ): মডেলকে মাত্র একটি উদাহরণ দেওয়া হয়। উত্তরের বিন্যাস নির্ধারণ করতে এবং zero-shot পদ্ধতির তুলনায় কার্যক্ষমতা উল্লেখযোগ্যভাবে উন্নত করতে এটি প্রায়ই যথেষ্ট।
- Zero-shot Learning (উদাহরণ ছাড়া শিক্ষণ): মডেলকে কোনো উদাহরণ দেওয়া হয় না, শুধুমাত্র একটি নির্দেশনা বা কাজের বিবরণ দেওয়া হয়। এই ক্ষেত্রে মডেলটি সম্পূর্ণরূপে প্রাক-প্রশিক্ষণের সময় অর্জিত জ্ঞানের উপর নির্ভর করে।
ব্যবহারিক প্রয়োগ
ICL-এর সঠিক প্রয়োগ ব্যয়বহুল উন্নয়ন ও fine-tuning ছাড়াই বিস্তৃত পরিসরের সমস্যা সমাধান করতে সক্ষম করে।
- সৃজনশীল ও শৈলীগত কাজের জন্য (নির্দিষ্ট শৈলীতে কোড তৈরি, কোনো নির্দিষ্ট লেখকের ভঙ্গিতে লেখা):
- Few-shot Learning সুপারিশ করা হয়।
- উদাহরণগুলি মডেলকে প্রয়োজনীয় শৈলী, বিন্যাস ও আউটপুটের কাঠামো আঁকতে সাহায্য করে।
- স্পষ্ট নির্দেশনাসহ সহজ কাজের জন্য (অনুবাদ, সারসংক্ষেপ, সহজ প্রশ্নের উত্তর):
- প্রায়ই Zero-shot Learning যথেষ্ট।
- আধুনিক মডেলগুলি এই ধরনের কাজে বেশ ভালো ফল দেয়, যদি সেগুলি তাদের প্রাক-প্রশিক্ষণের অংশ ছিল।
- যেখানে আউটপুটের বিন্যাস গুরুত্বপূর্ণ এমন কাজের জন্য (JSON তৈরি, সত্তা নিষ্কাশন):
- One-shot বা Few-shot Learning সুপারিশ করা হয়।
- এমনকি একটি উদাহরণও প্রয়োজনীয় উত্তরের কাঠামো স্পষ্টভাবে নির্ধারণ করতে পারে, বিন্যাস ত্রুটি প্রতিরোধ করে।
সুবিধা ও অসুবিধা
| সুবিধা | অসুবিধা |
|---|---|
|
|
অন্যান্য প্রতিমান (Paradigm)-এর সাথে তুলনা
ICL বনাম Fine-tuning
Fine-tuning মডেলের ওজন পরিবর্তন করে, নতুন জ্ঞান তাতে "মুদ্রিত" করে। এটি মডেলকে একটি সংকীর্ণ ক্ষেত্রে বিশেষজ্ঞ করে তোলে, তবে তার সামগ্রিক নমনীয়তা হ্রাস পায়। ICL, বিপরীতভাবে, ওজন পরিবর্তন করে না এবং বেশি নমনীয়, তবে গভীর ডোমেন জ্ঞানের প্রয়োজন এমন সংকীর্ণ বিশেষায়িত কাজে কার্যক্ষমতায় পিছিয়ে থাকতে পারে।
ICL বনাম RAG (Retrieval-Augmented Generation)
উভয় পদ্ধতিই মডেলের প্রসঙ্গ বিস্তৃত করে, তবে ভিন্ন উদ্দেশ্যে:
- ICL উদাহরণ ব্যবহার করে মডেলকে শেখায় যে কাজটি কীভাবে করতে হবে (দক্ষতার প্রদর্শনী)।
- RAG উত্তরের জন্য প্রয়োজনীয় তথ্য মডেলকে জানাতে পুনরুদ্ধার করা তথ্য ব্যবহার করে (জ্ঞান প্রদান)।
ব্যবহারিকভাবে, সর্বোত্তম ফলাফল অর্জনের জন্য ICL ও RAG প্রায়ই একত্রে ব্যবহার করা হয়।
সাহিত্য
- Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
- Dai, D. et al. (2022). Why Can GPT Learn In-Context? Language Models Implicitly Perform Gradient Descent as Meta-Optimizers. arXiv:2212.10559.
- Panwar, M.; Ahuja, K.; Goyal, N. (2024). In-Context Learning through the Bayesian Prism. arXiv:2306.04891.
- Müller, S. et al. (2021). Transformers Can Do Bayesian Inference. arXiv:2112.10510.
- Garg, S. et al. (2022). What Can Transformers Learn In-Context? A Case Study of Simple Function Classes. arXiv:2208.01066.
- Min, S. et al. (2022). Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?. arXiv:2202.12837.
- Wang, X. et al. (2023). Explaining and Finding Good Demonstrations for In-Context Learning. arXiv:2302.13971.
- Xie, S. et al. (2024). A Survey on In-Context Learning. arXiv:2301.00234.
- Yu, Z.; Ananiadou, S. (2024). How Do Large Language Models Learn In-Context? Query and Key Matrices of In-Context Heads Are Two Towers for Metric Learning. arXiv:2402.02872.
- Wibisono, K. C.; Wang, Y. (2024). From Unstructured Data to In-Context Learning: Exploring What Tasks Can Be Learned and When. arXiv:2406.00131.
- Chan, J. K. et al. (2022). Data Distributional Properties Drive Emergent In-Context Learning in Transformers. arXiv:2205.05055.
- Hahn, M.; Goyal, N. (2023). A Theory of Emergent In-Context Learning as Implicit Structure Induction. arXiv:2303.07971.
পাদটীকা
- ↑ What is In-Context Learning (ICL)? // Lakera.ai
- ↑ In-Context Learning (ICL) // Hopsworks.ai
- ↑ In-Context Learning, In Context // The Gradient
- ↑ Why Can GPT Learn In-Context? Language Models Secretly Perform Gradient Descent as Meta-Optimizers // arXiv, 2022.
- ↑ Understanding In-Context Learning // Stanford Human-Centered AI, 2023.