Contextual forgetting — প্রাসঙ্গিক বিস্মরণ
বৃহৎ ভাষা মডেলে প্রাসঙ্গিক বিস্মরণ — এটি একটি বহুমাত্রিক ঘটনা, যেখানে একটি বৃহৎ ভাষা মডেল (LLM) একটি একক মিথস্ক্রিয়ার মধ্যে পূর্বে প্রদত্ত তথ্য হারিয়ে ফেলে, উপেক্ষা করে বা অকার্যকরভাবে ব্যবহার করে[1]। মানুষের স্মৃতির বিপরীতে, LLM-এর কোনো দীর্ঘমেয়াদী অবস্থা সংরক্ষণের ব্যবস্থা নেই এবং এগুলো কেবলমাত্র context window-এর উপর নির্ভর করে — টোকেনে পরিমাপ করা সীমিত পরিমাণ টেক্সট, যা মডেলটি একসাথে প্রক্রিয়া করতে পারে। এই উইন্ডোটি মডেলের স্বল্পমেয়াদী বা কার্যকরী স্মৃতির ভূমিকা পালন করে[2]।
এই সীমাবদ্ধতার সবচেয়ে পরিচিত প্রকাশ হলো "মাঝখানে হারিয়ে যাওয়া" (Lost in the Middle) সমস্যা — মডেলগুলির একটি প্রবণতা যেখানে দীর্ঘ প্রসঙ্গের শুরু এবং শেষে অবস্থিত তথ্য ভালোভাবে প্রক্রিয়া করা হয়, কিন্তু মাঝখানেরটি কম কার্যকরভাবে প্রক্রিয়া করা হয়[2]। এই ঘটনাটি কোনো ত্রুটি নয়, বরং transformer আর্কিটেকচার এবং এর প্রশিক্ষণ নীতিগুলি থেকে উদ্ভূত একটি মৌলিক বৈশিষ্ট্য।
দুই ধরনের বিস্মরণ: প্রাসঙ্গিক এবং বিপর্যয়কর
LLM-এ দুটি মৌলিকভাবে ভিন্ন ধরনের "বিস্মরণ" আলাদা করা গুরুত্বপূর্ণ: প্রসঙ্গ-অভ্যন্তরীণ এবং বিপর্যয়কর।
প্রসঙ্গ-অভ্যন্তরীণ বিস্মরণ (মাঝখানে হারিয়ে যাওয়া)
এই ধরনের বিস্মরণ ইতিমধ্যে প্রশিক্ষিত মডেলের সাথে একটি মিথস্ক্রিয়া সেশন চলাকালীন (inference) ঘটে। এটি context window-এর সীমাবদ্ধতার সাথে সম্পর্কিত। যখন কোনো সংলাপ বা নথির পরিমাণ উইন্ডোর আকার ছাড়িয়ে যায়, তখন নতুন তথ্যের জন্য জায়গা করতে মডেলটি সবচেয়ে পুরনো অংশগুলি "ভুলে যায়"। এমনকি উইন্ডোর মধ্যেও, প্রসঙ্গের মাঝখানের তথ্য কম কার্যকরভাবে ব্যবহার করা হতে পারে। এটি মডেলের কার্যকরী স্মৃতির একটি সীমাবদ্ধতা[3]। সাংবাদিকতায় এই ঘটনাকে "context degradation syndrome" (Context Degradation Syndrome, CDS)ও বলা হয়[1]।
বিপর্যয়কর বিস্মরণ (মডেল drift)
"মডেল drift" (model drift) নামেও পরিচিত এই ধরনের বিস্মরণ নতুন ডেটায় মডেলের fine-tuning প্রক্রিয়া চলাকালীন ঘটে। যখন সাধারণ জ্ঞানের বিশাল ভান্ডারে পূর্ব-প্রশিক্ষিত একটি মডেলকে অত্যন্ত বিশেষায়িত dataset-এ (যেমন চিকিৎসা পাঠ্যে) fine-tune করা হয়, তখন এর weights পরিবর্তিত হয়। এটি নতুন কাজের সাথে সম্পর্কহীন পূর্বে শেখা জ্ঞান ও দক্ষতার অবনতি বা "মুছে ফেলার" দিকে নিয়ে যেতে পারে[4]।
কারণ ও প্রক্রিয়াসমূহ
প্রাসঙ্গিক বিস্মরণ হলো transformer আর্কিটেকচার এবং ভেক্টর স্থানের জ্যামিতির একটি প্রত্যক্ষ পরিণতি।
"মাঝখানে হারিয়ে যাওয়া" প্রভাব (Lost in the Middle)
স্ট্যানফোর্ড বিশ্ববিদ্যালয়ের ২০২৩ সালের "Lost in the Middle" নামক গবেষণাটি স্পষ্টভাবে প্রদর্শন করেছে যে দীর্ঘ প্রসঙ্গ থেকে তথ্য উদ্ধারে LLM-এর কর্মক্ষমতার একটি U-আকৃতির বক্ররেখা রয়েছে[2]। উত্তরের নির্ভুলতা সর্বোচ্চ হয় যখন প্রাসঙ্গিক তথ্য প্রসঙ্গের একদম শুরুতে (প্রাথমিকতা প্রভাব) বা একদম শেষে (নতুনত্ব প্রভাব) থাকে, এবং যদি তা মাঝখানে "লুকানো" থাকে তাহলে উল্লেখযোগ্যভাবে হ্রাস পায়। এই ঘটনার কারণগুলি:
- Attention প্রক্রিয়া: Transformer আর্কিটেকচার স্বভাবগতভাবে বৈশ্বিক সংহতি বজায় রাখতে প্রারম্ভিক টোকেনগুলিতে (তথাকথিত "attention sink") এবং স্থানীয় প্রসঙ্গে অসামঞ্জস্যপূর্ণভাবে বেশি মনোযোগ দেয়, যা মাঝখানে "ফোকাস" দুর্বল হওয়ার দিকে নিয়ে যায়[5]।
- Pre-training ডেটা: মডেলগুলি প্রায়শই অপেক্ষাকৃত ছোট টেক্সটে প্রশিক্ষিত হয়, যেখানে গুরুত্বপূর্ণ তথ্য বিরলভাবে শুরু থেকে দশ হাজার টোকেন দূরে থাকে, যা তাদের অত্যন্ত দীর্ঘ প্রসঙ্গ কার্যকরভাবে ব্যবহার করতে বাধা দেয়[6]।
প্রকাশ ও পরিণতিসমূহ
- Context Degradation Syndrome: দীর্ঘ সংলাপের সময় মডেলটি "কথোপকথনের সূত্র হারিয়ে ফেলতে" শুরু করে, উত্তর পুনরাবৃত্তি করে, পূর্বে প্রতিষ্ঠিত তথ্যের বিরোধিতা করে এবং ক্রমবর্ধমানভাবে সাধারণ ও অস্পষ্ট উত্তর দেয়[1]।
- বহু-ধাপ কাজে ব্যর্থতা: যে কাজগুলিতে শর্তগুলি বেশ কয়েকটি পালার মধ্যে স্পষ্ট করা হয়, সেখানে মডেলটি একটি ভুল প্রাথমিক অনুমানে "আটকে" যেতে পারে এবং পরবর্তী স্পষ্টীকরণগুলি উপেক্ষা করতে পারে, যা সমস্যাটি সম্পূর্ণরূপে সমাধান করতে অক্ষমতার দিকে নিয়ে যায়[7]।
- নথি বিশ্লেষণে অবিশ্বস্ততা: দীর্ঘ প্রতিবেদন বা আইনি নথি বিশ্লেষণ করার সময় LLM কেন্দ্রীয় বিভাগে অবস্থিত মূল তথ্য মিস করতে পারে, যা এটিকে এই ধরনের কাজের জন্য একটি অবিশ্বস্ত হাতিয়ার করে তোলে।
প্রশমন ও প্রতিরোধের কৌশলসমূহ
গবেষক এবং ডেভেলপাররা প্রাসঙ্গিক বিস্মরণের সমস্যা সমাধানের জন্য বেশ কয়েকটি পদ্ধতি ব্যবহার করেন।
Context window বৃদ্ধি
সবচেয়ে সরলরৈখিক পদ্ধতি হলো context window-এর আকার বৃদ্ধি করা। Claude 3 (২ লক্ষ টোকেন) এবং Gemini 1.5 Pro (২০ লক্ষ টোকেন পর্যন্ত)-এর মতো আধুনিক মডেলগুলি এই সীমা উল্লেখযোগ্যভাবে প্রসারিত করেছে[8][9]। তবে গবেষণা দেখায় যে উইন্ডো বৃদ্ধি করলেই এর কার্যকর ব্যবহার নিশ্চিত হয় না, এবং "মাঝখানে হারিয়ে যাওয়া" সমস্যা অব্যাহত থাকে[2]।
উন্নত prompt engineering
Prompt-এর সুচিন্তিত কাঠামো কর্মক্ষমতা উল্লেখযোগ্যভাবে উন্নত করতে পারে। Anthropic নিম্নলিখিত অনুশীলনগুলি প্রস্তাব করে[10]:
- নথিগুলি শুরুতে রাখা: দীর্ঘ টেক্সটগুলি prompt-এর একদম শুরুতে, নির্দেশনা এবং প্রশ্নের আগে স্থাপন করা।
- XML ট্যাগ ব্যবহার: স্পষ্ট বিভাজনের জন্য নথিগুলিকে `<document>` ট্যাগে মোড়ানো।
- উদ্ধৃতি দিয়ে উত্তর ন্যায্যতা প্রমাণ: মডেলকে প্রথমে প্রাসঙ্গিক উদ্ধৃতি বের করতে এবং তারপর সেগুলির উপর ভিত্তি করে উত্তর তৈরি করতে নির্দেশনা দেওয়া।
স্মৃতির বাহ্যিকীকরণ: Retrieval-Augmented Generation (RAG)
মৌলিকভাবে ভিন্ন একটি পদ্ধতি হলো সমস্ত তথ্য context window-এ না রেখে একটি বাহ্যিক সিস্টেমে (ভেক্টর ডেটাবেসে) সংরক্ষণ করা এবং অনুরোধ অনুযায়ী সরবরাহ করা।
- উদ্ধার (Retrieve): যখন একটি অনুরোধ আসে, সিস্টেমটি বাহ্যিক ডেটাবেসে প্রাসঙ্গিক তথ্য অনুসন্ধান করে।
- সম্পূরক (Augment): পাওয়া অংশগুলি মূল অনুরোধের সাথে যোগ করা হয়।
- তৈরি (Generate): LLM প্রদত্ত প্রসঙ্গের উপর ভিত্তি করে উত্তর তৈরি করে।
RAG কার্যত সীমাহীন পরিমাণ ডেটার সাথে কাজ করতে সক্ষম করে এবং তাজা ও যাচাইকৃত তথ্যে অ্যাক্সেস নিশ্চিত করে, যা hallucination-এর ঝুঁকি হ্রাস করে এবং আজ পর্যন্ত সবচেয়ে নির্ভরযোগ্য সমাধান[11]।
তথ্যসূত্র
- Lost in the Middle: How Language Models Use Long Contexts — স্ট্যানফোর্ড বিশ্ববিদ্যালয়ের মূল গবেষণা।
- Anthropic কর্তৃক ১০০K টোকেন context window সহ Claude-এর ঘোষণা।
সাহিত্য
- Liu, N. F. et al. (2023). Lost in the Middle: How Language Models Use Long Contexts. arXiv:2307.03172.
- An, C. et al. (2024). Why Does the Effective Context Length of LLMs Fall Short?. arXiv:2410.18745.
- Ding, J. et al. (2023). LongNet: Scaling Transformers to 1,000,000,000 Tokens. arXiv:2307.02486.
- Yang, A. et al. (2024). Context Parallelism for Scalable Million-Token Inference. arXiv:2411.01783.
- Chen, S. et al. (2023). Extending Context Window of Large Language Models via Positional Interpolation. arXiv:2306.15595.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Li, S. et al. (2023). Functional Interpolation for Relative Positions Improves Long Context Transformers. arXiv:2310.04418.
- Dong, Z. et al. (2024). Exploring Context Window of Large Language Models via Decomposed Positional Vectors. arXiv:2405.18009.
- Laban, P. et al. (2025). LLMs Get Lost in Multi-Turn Conversation. arXiv:2505.06120.
- Li, R. et al. (2024). Extending Context Window in Large Language Models with Segmented Base Adjustment for Rotary Position Embeddings. Applied Sciences, 14(7), 3076. DOI:10.3390/app14073076.
- Yang, A. & Reizenstein, J. (2024). Exploring Context Window of LLMs via Decomposed Positional Vectors (NeurIPS Poster). NeurIPS 2024.
টীকা
- ↑ 1.0 1.1 1.2 Howard, James. «Context Degradation Syndrome: When Large Language Models Lose the Plot». jameshoward.us. [১]
- ↑ 2.0 2.1 2.2 2.3 Liu, Nelson F.; et al. «Lost in the Middle: How Language Models Use Long Contexts». arXiv. [২]
- ↑ Liu, Nelson F.; et al. «Lost in the Middle: How Language Models Use Long Contexts». ACL Anthology. [৩]
- ↑ Greyling, Cobus. «Catastrophic Forgetting In LLMs». Medium. [৪]
- ↑ «Exploring Context Window of Large Language Models via Decomposed Positional Vectors». NeurIPS Proceedings. [৫]
- ↑ An, Chenxin; et al. «Why Does the Effective Context Length of LLMs Fall Short?». arXiv. [৬]
- ↑ «LLMs Get Lost In Multi-Turn Conversation». arXiv. [৭]
- ↑ «Introducing the next generation of Claude». Anthropic. [৮]
- ↑ «Google's Gemini 1.5 Pro - Revolutionizing AI with a 1M Token Context Window». Medium. [৯]
- ↑ «Long context prompting tips». Anthropic Documentation. [১০]
- ↑ «What is Retrieval-Augmented Generation (RAG)?». Google Cloud. [১১]