LLM hallucinations — LLM-এর হ্যালুসিনেশন ও অসঠিক প্রতিক্রিয়া

From Systems analysis Wiki
Jump to navigation Jump to search

হ্যালুসিনেশন (ইং. hallucination) বৃহৎ ভাষা মডেলের (LLM) প্রেক্ষাপটে এমন একটি ঘটনা, যেখানে মডেলটি আত্মবিশ্বাসের সাথে দেখতে বিশ্বাসযোগ্য (plausible) একটি উত্তর তৈরি করে, যা আসলে বাস্তবতার সাথে সংগতিপূর্ণ নয়, প্রদত্ত প্রসঙ্গের সাথে মেলে না অথবা আভ্যন্তরীণভাবে পরস্পরবিরোধী[1][2]। মডেলটি এমন তথ্য, বিবরণ বা যৌক্তিক সিদ্ধান্ত «উদ্ভাবন» করে, যা মূল তথ্যে অনুপস্থিত।

উল্লেখ করা গুরুত্বপূর্ণ যে হ্যালুসিনেশন প্রচলিত অর্থে কোনো ত্রুটি বা বাগ নয়। মডেলটি ঠিক সেভাবেই কাজ করে, যেভাবে এটি ডিজাইন করা হয়েছে: এটি প্রশিক্ষণ ডেটা থেকে নেওয়া pattern-এর ভিত্তিতে সবচেয়ে সম্ভাবনাময় পরবর্তী অংশ পূর্বাভাস দেয়। এতে সত্যতা যাচাইয়ের কোনো অন্তর্নির্মিত প্রক্রিয়া নেই[3]। হ্যালুসিনেশন সাধারণ ভুল থেকে আলাদা কারণ এগুলো আত্মবিশ্বাসের সাথে উপস্থাপিত কিন্তু মিথ্যা তথ্য, যাতে প্রায়ই অস্তিত্বহীন তথ্য, রেফারেন্স বা ঘটনা অন্তর্ভুক্ত থাকে[4]। এই ঘটনাটি এতটাই গুরুত্বপূর্ণ হয়ে উঠেছে যে ২০২৩ সালে কেমব্রিজ অভিধান কৃত্রিম বুদ্ধিমত্তা সম্পর্কিত «hallucination» শব্দের একটি নতুন অর্থ যোগ করেছে[5]

হ্যালুসিনেশনের সংজ্ঞা ও শ্রেণিবিভাগ

যদিও বিভিন্ন পরিভাষা ব্যবহার করা হয় (যেমন «confabulation», «উদ্ভাবন»), LLM-এ হ্যালুসিনেশনকে দুটি বৃহৎ বিভাগে ভাগ করা যায়: তথ্যগত সত্যতা সম্পর্কিত এবং উৎসের প্রতি বিশ্বস্ততা (প্রাসঙ্গিক সংগতি) সম্পর্কিত[6]

তথ্যগত হ্যালুসিনেশন

এটি সেই ক্ষেত্রে ঘটে যখন মডেলটি বাস্তব জগত সম্পর্কে তথ্যগতভাবে ভুল তথ্য উপস্থাপন করে। মডেলটি একটি মিথ্যা «তথ্য»কে সত্য হিসেবে দাবি করে[1]

  • উদাহরণ: «চার্লস লিন্ডবার্গ চাঁদের পৃষ্ঠে পদার্পণকারী প্রথম মানুষ ছিলেন» — সম্পূর্ণ কাল্পনিক একটি তথ্য।
  • মিথ্যা উদ্ধৃতি ও রেফারেন্স: মডেলটি একটি অস্তিত্বহীন বৈজ্ঞানিক গবেষণাপত্র বা আইনের রেফারেন্স বানিয়ে দিতে পারে, প্রকৃত রেফারেন্সের বিন্যাস অনুকরণ করে[2]। এটি মডেলের প্রতি আস্থা ক্ষুণ্ণ করে, বিশেষত এমন অ্যাপ্লিকেশনে যেখানে নির্ভুলতা প্রয়োজন (শিক্ষা, সংবাদ, পরামর্শ)[7]

যৌক্তিক ভুল

মডেলটি যুক্তিতর্কে অসংগতি বা ভুল করে। উত্তরের আলাদা তথ্যগুলো সঠিক হতে পারে, কিন্তু সিদ্ধান্তটি অযৌক্তিক বা প্রাথমিক যুক্তির বিরোধী[2]। এটি প্রায়ই জটিল যুক্তিতর্ক বা গণিত ও কার্যকারণ সম্পর্কের সমস্যায় ঘটে, যেখানে মডেলটি আনুষ্ঠানিক যুক্তির পরিবর্তে শব্দের সম্ভাব্য সংযোগ দিয়ে কাজ করে[2][2]

  • উদাহরণ: «যেহেতু পাখিরা উড়তে পারে, তাই নভোচারীরা মাধ্যাকর্ষণ অনুভব করেন না» — পাঠ্যটি সংযুক্ত মনে হয়, কিন্তু যৌক্তিকভাবে ভুল।

প্রাসঙ্গিক হ্যালুসিনেশন

মডেলের উত্তর প্রদত্ত প্রসঙ্গ বা নির্দেশের সাথে সংগতিপূর্ণ নয়। মডেলটি প্রসঙ্গ থেকে «বেরিয়ে যায়», অতিরিক্ত তথ্য যোগ করে বা প্রয়োজনীয় তথ্য উপেক্ষা করে[1]

  • নির্দেশ লঙ্ঘন: «পাঠ্যটি স্প্যানিশে অনুবাদ করুন» অনুরোধে মডেলটি ইংরেজিতে উত্তর দেয়[1]
  • উৎস-বহির্ভূত তথ্য: সারসংক্ষেপ তৈরির কাজে মডেলটি মূল দলিলে অনুপস্থিত তথ্য «যোগ করে», অথবা সেগুলো বিকৃত করে[1]
  • প্রসঙ্গের মিশ্রণ: উত্তরের মাঝে মডেলটি হঠাৎ অন্য কোনো বিষয়ে কথা বলতে শুরু করে। উদাহরণস্বরূপ, NBA কমিশনার অ্যাডাম সিলভার সম্পর্কিত প্রশ্নের উত্তরে মডেলটি তার পূর্বসূরি ডেভিড স্টার্নে চলে যেতে পারে, দুটি ভিন্ন প্রসঙ্গ মিশিয়ে ফেলে[6]

অসংগতি

হ্যালুসিনেশনের একটি প্রকার, যেখানে মডেলটি একটি উত্তর বা উত্তরের ধারার মধ্যে নিজের সাথে নিজেই বিরোধিতা করে[6]। একটি গবেষণায় দেখা গেছে যে ChatGPT-এর উত্তরে স্ব-বিরোধিতার হার প্রায় ১৪%[6][6]

  • উদাহরণ: «X কোম্পানিটি ১৯৯০ সালে প্রতিষ্ঠিত হয়েছিল... এবং কয়েক বাক্য পরে ...২০০০ সালে গঠিত X কোম্পানি...»

কোডে হ্যালুসিনেশন

কোডের উপর প্রশিক্ষিত LLM সিনট্যাক্টিক্যালি সঠিক কিন্তু অকার্যকর অংশ তৈরি করতে পারে, অস্তিত্বহীন ফাংশন, লাইব্রেরি বা প্যারামিটার ব্যবহার করে[2]। উদাহরণস্বরূপ, মডেলটি Python-এ `import quantum` তৈরি করতে পারে, যদিও এই ধরনের কোনো স্ট্যান্ডার্ড মডিউল নেই। ২০২৪ সালে «code hallucination» পরিভাষাটি প্রস্তাব করা হয় এবং এই সমস্যাকে পদ্ধতিগতভাবে বিন্যস্ত করতে CodeMirage benchmark তৈরি করা হয়[8]

উদ্ভবের কারণ

হ্যালুসিনেশনের ঘটনাটি মডেলের আর্কিটেকচার থেকে শুরু করে ডেটার মান পর্যন্ত একাধিক কারণের সমষ্টির ফলে ঘটে।

  • আর্কিটেকচার ও প্রশিক্ষণের নীতি: বেশিরভাগ LLM (যেমন GPT) হলো autoregressive transformer, যা পরবর্তী token পূর্বাভাস দিতে প্রশিক্ষিত। তাদের লক্ষ্য হলো পাঠ্যের সম্ভাবনা সর্বাধিক করা, দাবির সত্যতা যাচাই করা নয়[2]। মডেলটি প্রশিক্ষণ ডেটায় তথ্য ও কল্পনার মধ্যে পার্থক্য করে না, সব কিছুকে পাঠ্য pattern হিসেবে গ্রহণ করে[2]
  • প্রশিক্ষণ ডেটার মান: LLM ইন্টারনেট থেকে বিশাল পাঠ্য সংগ্রহে প্রশিক্ষিত হয়, যাতে অনেক অসংগতি, মিথ ও পুরনো তথ্য রয়েছে[1]। মডেলটি এই ভুলগুলো মুখস্থ করে এবং পুনরুৎপাদন করে। এছাড়াও knowledge cutoff গুরুত্বপূর্ণ — সময়ের যে সীমা পর্যন্ত মডেলের কাছে তথ্য রয়েছে।
  • পাঠ্য তৈরির পদ্ধতি: তাপমাত্রাসহ sampling-এর স্টোকাস্টিক প্রকৃতি মডেলকে আরও «সৃজনশীল» কিন্তু কম নির্ভুল উত্তর তৈরি করতে দেয়। প্রসঙ্গের সীমিত দৈর্ঘ্য মডেলকে সংলাপের প্রথম দিকের বিবরণ «ভুলে যেতে» এবং নিজের সাথে বিরোধিতা শুরু করতে বাধ্য করতে পারে[6]

মূল্যায়ন ও পরিমাপের পদ্ধতি

হ্যালুসিনেশন সনাক্ত ও পরিমাপের জন্য স্বয়ংক্রিয় মেট্রিক, মানবিক মূল্যায়ন এবং বিশেষায়িত benchmark ব্যবহার করা হয়।

  • স্বয়ংক্রিয় মেট্রিক: এতে এমন পদ্ধতি অন্তর্ভুক্ত রয়েছে যেখানে অন্য একটি LLM উত্তরের সঠিকতা মূল্যায়নের জন্য «বিচারক» হিসেবে (LLM-as-a-judge) কাজ করে[9], অথবা তৈরির সময় মডেলের entropy (অনিশ্চয়তা) বিশ্লেষণ করা হয়[10]
  • মানবিক annotation: এটিকে «সোনার মান» হিসেবে বিবেচনা করা হয়। বিশেষজ্ঞ বা ক্রাউড-অ্যাসেসরগণ ম্যানুয়ালি উত্তর মূল্যায়ন করে ভুলগুলো চিহ্নিত করেন। এই পদ্ধতিটি RLHF দিয়ে মডেল প্রশিক্ষণে ব্যবহৃত হয়[11]
  • Benchmark ও স্ট্রেস-টেস্ট: বিশেষ dataset তৈরি করা হয়েছে, যেমন TruthfulQA, যাতে এমন প্রশ্ন রয়েছে যা মডেলকে প্রচলিত মিথ পুনরুৎপাদনে প্ররোচিত করে[12]। এছাড়াও লিডারবোর্ড রয়েছে, যেমন Hugging Face Hallucination Leaderboard, যেখানে মডেলগুলোকে হ্যালুসিনেশনের মাত্রা অনুযায়ী তুলনা করা হয়[13]

প্রশমন ও প্রতিরোধের উপায়

  • Retrieval-Augmented Generation (RAG): সবচেয়ে সফল পদ্ধতি, যা মডেলকে বাহ্যিক জ্ঞানের সাথে «বেঁধে দেয়»। উত্তর তৈরির আগে মডেলটি ডেটাবেস, সার্চ ইঞ্জিন বা API থেকে প্রাসঙ্গিক তথ্য সংগ্রহ করে। এটি মডেলকে অনুমানের পরিবর্তে যাচাইকৃত তথ্যের উপর ভিত্তি করে উত্তর দিতে সক্ষম করে[2]
  • Chain-of-Thought যুক্তিশৃঙ্খল ও স্ব-যাচাই: মডেলটি চূড়ান্ত উত্তর দেওয়ার আগে ধাপে ধাপে যুক্তি তৈরি করে, যা নির্ভুলতা বাড়ায়। আরও উন্নত পদ্ধতিতে, যেমন Self-Verification-এ, মডেলটি একটি খসড়া উত্তর তৈরি করে, তারপর সেটি যাচাই ও সংশোধন করার কাজ পায়[14]
  • অন্তর্নির্মিত নিয়ম ও ফিল্টার: মডেলগুলোকে অনিশ্চিত হলে উত্তর দিতে অস্বীকার করতে প্রশিক্ষিত করা হয়। উদাহরণস্বরূপ, Anthropic-এর Claude মডেলগুলো «সত্যবাদিতা»র নীতি অনুসরণ করে এবং প্রায়ই তথ্য বানানোর পরিবর্তে «আমি নিশ্চিতভাবে জানি না...» বলে উত্তর দেয়[11]
  • বাহ্যিক সরঞ্জামের সাথে একীভূতকরণ: Gemini-এর মতো মডেলগুলো স্বয়ংক্রিয়ভাবে চিনতে পারে কখন তাদের বাহ্যিক সরঞ্জাম দরকার (যেমন গণনার জন্য ক্যালকুলেটর বা সাম্প্রতিক সংবাদের জন্য অনুসন্ধান), এবং সেটি ব্যবহার করে, যা হ্যালুসিনেশনের সংখ্যা উল্লেখযোগ্যভাবে হ্রাস করে[11]

ঝুঁকি ও পরিণতি

  • আইনগত ও সুনামগত ঝুঁকি: আইনি ক্ষেত্রে হ্যালুসিনেশনের গুরুতর পরিণতি হতে পারে। Mata v. Avianca (2023) মামলাটি ব্যাপক পরিচিতি পেয়েছে, যেখানে একজন আইনজীবী বিচারিক নজির খোঁজার জন্য ChatGPT ব্যবহার করেছিলেন এবং এটি বেশ কয়েকটি অস্তিত্বহীন মামলা বানিয়ে দিয়েছিল। আইনজীবীদের জরিমানা করা হয় এবং এই ঘটনাটি যাচাই ছাড়া AI-কে বিশ্বাস করার অগ্রহণযোগ্যতার একটি শিক্ষা হয়ে ওঠে[1]
  • ভুল তথ্যের বিস্তার: সামাজিক স্তরে LLM ভুয়া সংবাদের সমস্যাকে আরও বাড়িয়ে তুলতে পারে। Meta-র Galactica মডেলের ঘটনাটি পরিচিত, যা বিজ্ঞানীদের সহায়তার জন্য তৈরি হয়েছিল, কিন্তু কাল্পনিক পরীক্ষা-নিরীক্ষা ও রেফারেন্সসহ ছদ্মবৈজ্ঞানিক পাঠ্য তৈরি শুরু করে। তিন দিন পরে মডেলটির পাবলিক অ্যাক্সেস বন্ধ করে দেওয়া হয়[15]
  • ভুল সিদ্ধান্ত গ্রহণ: ব্যবহারকারীরা, বিশেষত অনভিজ্ঞরা, AI-এর আত্মবিশ্বাসের সাথে প্রণীত উত্তরগুলো বিশ্বাস করতে প্রবণ, যা অর্থ, স্বাস্থ্য এবং অন্যান্য গুরুত্বপূর্ণ ক্ষেত্রে ভুল সিদ্ধান্ত গ্রহণে নিয়ে যেতে পারে[7]

ব্যবহারিক উদাহরণ

  • Air Canada মামলা (2023): বিমান সংস্থার চ্যাটবট একটি অস্তিত্বহীন টিকিট ফেরত নীতি বানিয়ে দেয়। যখন গ্রাহক তা প্রয়োগের দাবি করেন, কোম্পানি অস্বীকার করে। কানাডার পরিবহন ট্রাইব্যুনাল Air Canada-কে তার চ্যাটবটের প্রদত্ত তথ্যের দায়িত্ব নিতে এবং গ্রাহককে ক্ষতিপূরণ দিতে বাধ্য করে[9]
  • OpenAI-এর বিরুদ্ধে মানহানি মামলা (2023): রেডিও উপস্থাপক মার্ক ওয়ালটার্স OpenAI-এর বিরুদ্ধে মামলা করেন কারণ ChatGPT একজন সাংবাদিকের অনুরোধের উত্তরে তাকে মিথ্যাভাবে প্রতারণার অভিযোগে অভিযুক্ত করেছিল। এই ঘটনাটি তাদের মডেল দ্বারা তৈরি বিষয়বস্তুর জন্য কোম্পানিগুলোর আইনগত দায়িত্বকে তুলে ধরেছে[6]

তথ্যসূত্র

  • The Beginner's Guide to Hallucinations in Large Language Models — Lakera-এর বিস্তারিত গাইড
  • Survey of Hallucination in Natural Language Generation — arXiv-এ এই ঘটনার বৈজ্ঞানিক পর্যালোচনা

সাহিত্য

  • Holtzman, A. et al. (2020). The Curious Case of Neural Text Degeneration. arXiv:1904.09751.
  • Caccia, M. et al. (2018). Language GANs Falling Short. arXiv:1811.02549.
  • Fan, A. et al. (2018). Hierarchical Neural Story Generation. arXiv:1805.04833.
  • Su, Y.; Collier, N. (2022). Contrastive Search Is What You Need for Neural Text Generation. arXiv:2210.14140.
  • Meister, C. et al. (2023). Locally Typical Sampling. arXiv:2202.00666.
  • O'Brien, S.; Lewis, M. (2023). Contrastive Decoding Improves Reasoning in Large Language Models. arXiv:2309.09117.
  • Finlayson, M. et al. (2024). Basis-Aware Truncation Sampling for Neural Text Generation. arXiv:2412.14352.
  • Tan, Q. et al. (2024). A Thorough Examination of Decoding Methods in the Era of Large Language Models. arXiv:2402.06925.
  • Yu, S. et al. (2023). Conformal Nucleus Sampling. arXiv:2305.02633.
  • Chen, S. J. et al. (2024). Decoding Game: On Minimax Optimality of Heuristic Text Generation Methods. arXiv:2410.03968.

টীকা

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «The Beginner's Guide to Hallucinations in Large Language Models». Lakera. [১]
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 2.7 2.8 «What Is LLM Hallucination and How To Prevent It». Astera. [২]
  3. «Hallucination (artificial intelligence)». In Wikipedia. [৩]
  4. «OpenAI describes LLM hallucinations as 'making up facts' in moments of uncertainty'». [источник не указан в тексте].
  5. «Cambridge Dictionary adds new definition for 'hallucinate'». [источник не указан в тексте].
  6. 6.0 6.1 6.2 6.3 6.4 6.5 6.6 «LLM Hallucination—Types, Causes, and Solutions». Nexla. [৪]
  7. 7.0 7.1 «Effective Tips to Prevent AI Hallucinations in Generative AI». QuickCreator. [৫]
  8. [2408.08333] CodeMirage: Hallucinations in Code Generated by Large Language Models. arXiv. [৬]
  9. 9.0 9.1 «LLM hallucinations and failures: lessons from 4 examples». Evidently AI Blog. [৭]
  10. «How to Perform Hallucination Detection for LLMs». Kolena. [৮]
  11. 11.0 11.1 11.2 «ChatGPT vs Google Gemini vs Anthropic Claude: Comprehensive Comparison & Report». DataStudios. [৯]
  12. «Mastering LLM Accuracy: How to Test, Detect, and Fix Hallucinations in AI Models». Stephen Weber on Medium. [১০]
  13. «LLM Benchmarks and Leaderboards: Avoiding Foundation Model Mistakes». Arize Blog. [১১]
  14. «Improving the Reliability of LLMs: Combining Chain-of-Thought Reasoning and Retrieval-Augmented Generation». arXiv. [১২]
  15. «Why Meta Took Down its 'Hallucinating' AI Model Galactica?». Analytics India Magazine. [১৩]