LLM error mitigation — বৃহৎ ভাষা মডেলে ত্রুটি হ্রাস

From Systems analysis Wiki
Jump to navigation Jump to search

বৃহৎ ভাষা মডেলে ত্রুটি হ্রাস (LLM) — এটি পদ্ধতি ও প্রযুক্তির একটি সমন্বিত ব্যবস্থা, যা transformer আর্কিটেকচারভিত্তিক কৃত্রিম বুদ্ধিমত্তা সিস্টেমের নির্ভুলতা, নির্ভরযোগ্যতা ও নিরাপত্তা বৃদ্ধির লক্ষ্যে পরিচালিত হয়। ত্রুটির সমস্যা, বিশেষত hallucination, সমালোচনামূলক ক্ষেত্রে LLM-এর ব্যাপক প্রয়োগের অন্যতম প্রধান বাধা। ২০২৪–২০২৫ সালের গবেষণার তথ্য অনুযায়ী, সর্বসাধারণের জন্য উন্মুক্ত LLM-এ hallucination-এর হার ৩% থেকে ১৬% পর্যন্ত[1]

ত্রুটির শ্রেণিবিভাগ

LLM-এর ত্রুটির আধুনিক শ্রেণিবিভাগে বেশ কয়েকটি প্রধান বিভাগ রয়েছে, যার প্রতিটির জন্য প্রভাব প্রশমনে (mitigation) নির্দিষ্ট পদ্ধতি প্রয়োজন।

Hallucination

Hallucination হলো বিশ্বাসযোগ্য কিন্তু তথ্যগতভাবে ভুল বিষয়বস্তু তৈরি করা। হুয়াং এবং অন্যান্যদের (২০২৩) গবেষণা অনুযায়ী, দুটি প্রধান ধরন চিহ্নিত করা হয়েছে[2]:

  • তথ্যগত hallucination — যাচাইযোগ্য তথ্যের সাথে অসামঞ্জস্য, যার মধ্যে অস্তিত্বহীন তথ্য তৈরি করা (fabrication) অন্তর্ভুক্ত। ২০২৪ সালের একটি গবেষণায় স্ট্যানফোর্ড বিশ্ববিদ্যালয় আবিষ্কার করে যে LLM ১২০টিরও বেশি অস্তিত্বহীন বিচারিক মামলা উদ্ভাবন করেছে[3]
  • যৌক্তিক hallucination — যুক্তিতর্কে যৌক্তিক ধারাবাহিকতার লঙ্ঘন।

২০২৪ সালের পরিসংখ্যান দেখায় যে চ্যাটবটগুলো ২৭% ক্ষেত্রে hallucinate করে, এবং তৈরি করা ৪৬% টেক্সটে তথ্যগত ত্রুটি থাকে[3]

পদ্ধতিগত পক্ষপাত (Bias)

LLM-এ পক্ষপাত সামাজিক কুসংস্কারের আকারে প্রকাশ পায় (যেমন, নির্দিষ্ট লিঙ্গের সাথে পেশার সংযুক্তি) এবং কার্যক্ষমতায় জনসংখ্যাগত পার্থক্য হিসেবে দেখা যায়। ২০২৪ সালের গবেষণায় দেখা গেছে যে পরীক্ষিত ১০টি মডেলের মধ্যে বিভিন্ন জনসংখ্যাগত গোষ্ঠীর জন্য মূল্যায়নে পার্থক্য ১০-এর মধ্যে ৪ পয়েন্ট পর্যন্ত পৌঁছাতে পারে।

বিষাক্ততা (Toxicity)

বিষাক্ততা হলো আপত্তিজনক, ক্ষতিকর বা বৈষম্যমূলক বিষয়বস্তু তৈরি করার প্রবণতা। toxicity মেট্রিক মডেল ও ব্যবহারের প্রসঙ্গের উপর নির্ভর করে বিস্তৃত পরিসরে পরিবর্তিত হয়।

ত্রুটি হ্রাসের পদ্ধতি

ত্রুটির বিরুদ্ধে লড়াইয়ের কৌশলগুলোকে দুটি বড় দলে ভাগ করা যায়: মডেল ও প্রশিক্ষণ প্রক্রিয়া পরিবর্তনকারী পদ্ধতি, এবং inference পর্যায়ে প্রয়োগ করা পদ্ধতি।

মডেল ও প্রশিক্ষণ প্রক্রিয়ার পরিবর্তন

Fine-tuning এবং Instruction Tuning

Supervised Fine-Tuning (SFT) পূর্বপ্রশিক্ষিত মডেলগুলোকে নির্দিষ্ট কাজে অভিযোজিত করতে সক্ষম করে। গণনামূলক ব্যয় কমাতে Parameter-Efficient Fine-Tuning (PEFT) পদ্ধতি ব্যবহার করা হয়, যেমন LoRA এবং QLoRA, যা কার্যকারিতা বজায় রেখে fine-tuning খরচ ৯৯% পর্যন্ত কমাতে পারে।

মানুষের প্রতিক্রিয়া থেকে Reinforcement Learning (RLHF)

RLHF হলো একটি দ্বিধাপ বিশিষ্ট প্রক্রিয়া, যেখানে প্রথমে মানুষের পছন্দের ভিত্তিতে একটি reward মডেল প্রশিক্ষিত হয়, তারপর মূল LLM-কে এমন উত্তর তৈরি করতে অপ্টিমাইজ করা হয় যা সেই reward সর্বাধিক করে। পদ্ধতিটি InstructGPT এবং GPT-4 মডেলে কার্যকারিতা প্রমাণ করেছে এবং ব্যবহারকারীদের প্রত্যাশার সাথে সামঞ্জস্য উল্লেখযোগ্যভাবে বৃদ্ধি করেছে[4]

Constitutional AI

Anthropics দ্বারা উদ্ভাবিত, Constitutional AI পদ্ধতিটি RLHF-এর একটি বিকল্প। মানুষের সরাসরি প্রতিক্রিয়ার পরিবর্তে, মডেলটি একটি নীতিমালার সেট ('সংবিধান') অনুসরণ করতে শেখে। এটি মানুষের তত্ত্বাবধানের প্রয়োজনীয়তা ৮০-৯০% কমায় এবং ক্ষতিকর বিষয়বস্তু তৈরি কার্যকরভাবে প্রতিরোধ করে[5]

আর্কিটেকচারাল সমাধান

  • Mixture of Experts (MoE): বিরল সক্রিয়করণ সহ একটি আর্কিটেকচার, যা গণনামূলক ব্যয়ের আনুপাতিক বৃদ্ধি ছাড়াই মডেলের ক্ষমতা উল্লেখযোগ্যভাবে বাড়াতে সক্ষম। ধারণা করা হয় যে GPT-4 প্রতিটিতে ২২০ বিলিয়ন প্যারামিটার সহ ৮ জন বিশেষজ্ঞ ব্যবহার করে।
  • Attention মেকানিজমের পরিবর্তন: Grouped Query Attention (GQA) (Llama 3 মডেলে) এবং Sparse Attention-এর মতো কৌশলগুলো গণনামূলক জটিলতা ও মেমোরির প্রয়োজনীয়তা হ্রাস করে, যা দীর্ঘতর context প্রক্রিয়া করতে সক্ষম করে।

Inference পর্যায়ের পদ্ধতি

Retrieval-Augmented Generation (RAG)

RAG তথ্যগত ত্রুটি হ্রাসের অন্যতম কার্যকর পদ্ধতি। উত্তর তৈরির আগে সিস্টেমটি একটি বাহ্যিক জ্ঞানভাণ্ডারে (যেমন, উইকিপিডিয়া, কর্পোরেট ডকুমেন্টেশন, বৈজ্ঞানিক নিবন্ধ) প্রবেশ করে, প্রাসঙ্গিক তথ্য বের করে এবং মূল প্রশ্নের সাথে মডেলে পাঠায়। এটি উত্তরকে যাচাইকৃত তথ্যের উপর 'ভিত্তিস্থাপন' করে। RAG সিস্টেমগুলো TriviaQA benchmark-এ ৫৬.৮% exact match অর্জন করে এবং তথ্যগত ত্রুটি হ্রাসে প্রচলিত মডেলের চেয়ে ৬০–৮০% বেশি কার্যকর।

উন্নত Prompting কৌশল

  • Chain-of-Thought (CoT): এমন prompting যা মডেলকে চূড়ান্ত উত্তর দেওয়ার আগে ধাপে ধাপে যুক্তিতর্কের শৃঙ্খল তৈরি করতে উৎসাহিত করে। এটি যৌক্তিক ও গাণিতিক গণনার প্রয়োজন এমন কাজে ফলাফল উল্লেখযোগ্যভাবে উন্নত করে।
  • Chain of Draft (CoD): CoT-এর একটি বিবর্তন, যেখানে মডেল পুনরাবৃত্তিমূলকভাবে তার উত্তরের খসড়া সম্পাদনা করে, যা উল্লেখযোগ্যভাবে কম token ব্যবহার করে CoT-এর সমতুল্য নির্ভুলতা অর্জন করতে দেয়।

অভ্যন্তরীণ স্ব-সংশোধন (Intrinsic Self-Correction)

TACL ২০২৪ সালের গবেষণায় দেখা গেছে যে বাহ্যিক তথ্য ছাড়া LLM-এর স্ব-সংশোধনের ক্ষমতা সীমিত। কার্যকর স্ব-সংশোধনের জন্য সাধারণত বাহ্যিক সরঞ্জাম ব্যবহার প্রয়োজন, যেমন গণনা যাচাইয়ের জন্য কোড interpreter বা তথ্য যাচাইয়ের জন্য সার্চ ইঞ্জিন[6]

ত্রুটি মূল্যায়নের পদ্ধতি

ত্রুটি হ্রাসে অগ্রগতি পরিমাপ করতে বিশেষায়িত মেট্রিক ও benchmark ব্যবহার করা হয়।

  • প্রচলিত মেট্রিক: Perplexity, BLEU এবং ROUGE। এগুলো প্রবাহমানতা ও n-gram মিল মূল্যায়নে কার্যকর, কিন্তু তথ্যগত নির্ভুলতা মূল্যায়নে দুর্বল।
  • আধুনিক পদ্ধতি:
    • FactScore দীর্ঘ টেক্সটকে পারমাণবিক তথ্যে বিভক্ত করে এবং জ্ঞানভাণ্ডার দ্বারা নিশ্চিত তথ্যের শতাংশ মূল্যায়ন করে।
    • SAFE (Search-Augmented Factuality Evaluator) — Google-এর একটি পদ্ধতি, যা তথ্য যাচাইয়ের জন্য অনুসন্ধান ব্যবহার করে এবং মানুষের মূল্যায়নের সাথে ৭২% সামঞ্জস্য অর্জন করে, ২০ গুণ সস্তায় কাজ করে।
    • TruthfulQA — একটি benchmark যা মডেলের প্রচলিত ভুল ধারণা তৈরি এড়ানোর ক্ষমতার উপর মনোযোগ কেন্দ্রীভূত করে।

সাহিত্য

  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions. arXiv:2311.05232.
  • Min, S. et al. (2023). FActScore: Fine-Grained Atomic Evaluation of Factual Precision in Long-Form Text Generation. arXiv:2305.14251.
  • Wei, J. et al. (2024). Long-Form Factuality in Large Language Models (SAFE). arXiv:2403.18802.
  • Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. arXiv:2005.11401.
  • Hu, E. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685.
  • Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
  • Madaan, A. et al. (2023). Self-Refine: Iterative Refinement with Self-Feedback. arXiv:2303.17651.
  • Wang, X. et al. (2022). Self-Consistency Improves Chain-of-Thought Reasoning in Language Models. arXiv:2203.11171.
  • Anthropic (2024). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Maslej, N. et al. (2024). Artificial Intelligence Index Report 2024. arXiv:2405.19522.

টীকা

  1. «Hallucination Leaderboard». Vectara. (2024-2025). Проверено 4 июля 2025.
  2. Huang, L., et al. (2023). «A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions». arXiv:2311.05232.
  3. 3.0 3.1 Stanford Human-Centered AI (2024). «AI Index Report 2024».
  4. OpenAI (2024). «Learning to Reason with LLMs». Technical Blog.
  5. Anthropic (2024). «Constitutional AI: Harmlessness from AI Feedback». Research Paper.
  6. «When Can LLMs Actually Correct Their Own Mistakes?». Transactions of the Association for Computational Linguistics. (2024).