LLM error mitigation (HI)
बड़े भाषा मॉडलों (LLM) में त्रुटियों की कमी — यह कृत्रिम बुद्धिमत्ता प्रणालियों की सटीकता, विश्वसनीयता और सुरक्षा बढ़ाने के उद्देश्य से बनाए गए तरीकों और प्रौद्योगिकियों का एक समग्र समूह है, जो transformer आर्किटेक्चर पर आधारित हैं। त्रुटियों की समस्या, विशेष रूप से hallucinations, महत्वपूर्ण क्षेत्रों में LLM के व्यापक उपयोग के लिए एक प्रमुख बाधा है। 2024–2025 के अध्ययनों के अनुसार, सार्वजनिक रूप से उपलब्ध LLM में hallucinations की दर 3% से 16% के बीच है[1]।
त्रुटियों की वर्गीकरण
LLM त्रुटियों का आधुनिक वर्गीकरण कई मुख्य श्रेणियों को समाहित करता है, जिनमें से प्रत्येक के लिए शमन (mitigation) हेतु विशिष्ट दृष्टिकोण की आवश्यकता होती है।
Hallucinations
Hallucinations विश्वसनीय लेकिन तथ्यात्मक रूप से गलत सामग्री के निर्माण को संदर्भित करती हैं। Huang एवं अन्य (2023) के अध्ययन के अनुसार, दो मुख्य प्रकार पहचाने गए हैं[2]:
- तथ्यात्मक hallucinations — सत्यापन योग्य तथ्यों से विचलन, जिसमें अस्तित्वहीन तथ्यों का निर्माण (fabrication) भी शामिल है। 2024 के एक अध्ययन में Stanford University ने पाया कि LLM ने 120 से अधिक अस्तित्वहीन न्यायिक मामलों की रचना कर दी[3]।
- तार्किक hallucinations — तर्क-वितर्क में तार्किक क्रम का उल्लंघन।
2024 के आँकड़े दर्शाते हैं कि chat-bots 27% मामलों में hallucinate करते हैं, और 46% उत्पन्न पाठों में तथ्यात्मक त्रुटियाँ होती हैं[3]।
व्यवस्थित पूर्वाग्रह (Bias)
LLM में Bias सामाजिक पूर्वाग्रहों (जैसे व्यवसायों को किसी विशेष लिंग से जोड़ना) और जनसांख्यिकीय प्रदर्शन अंतर के रूप में प्रकट होता है। 2024 के अध्ययनों से पता चला कि 10 परीक्षित मॉडलों में विभिन्न जनसांख्यिकीय समूहों के लिए मूल्यांकन में अंतर 10 में से 4 अंक तक पहुँच सकता है।
विषाक्तता (Toxicity)
Toxicity को आपत्तिजनक, हानिकारक या भेदभावपूर्ण सामग्री के निर्माण के रूप में परिभाषित किया जाता है। Toxicity की मात्रा मॉडल और उपयोग के संदर्भ के अनुसार व्यापक रूप से भिन्न होती है।
त्रुटियों को कम करने के तरीके
त्रुटियों से निपटने की रणनीतियों को दो बड़े समूहों में विभाजित किया जा सकता है: मॉडल और प्रशिक्षण प्रक्रिया को संशोधित करने वाले तरीके, और inference (अनुमान) चरण में लागू किए जाने वाले तरीके।
मॉडल और प्रशिक्षण प्रक्रिया का संशोधन
Fine-tuning और Instruction Tuning
Supervised Fine-Tuning (SFT) पूर्व-प्रशिक्षित मॉडलों को विशिष्ट कार्यों के लिए अनुकूलित करने की अनुमति देता है। गणनात्मक लागत को कम करने के लिए Parameter-Efficient Fine-Tuning (PEFT) विधियाँ, जैसे LoRA और QLoRA, उपयोग की जाती हैं, जो दक्षता बनाए रखते हुए fine-tuning की लागत को 99% तक कम कर सकती हैं।
मानवीय प्रतिक्रिया पर आधारित Reinforcement Learning (RLHF)
RLHF एक द्विचरणीय प्रक्रिया है जिसमें पहले मानवीय प्राथमिकताओं के आधार पर एक reward मॉडल प्रशिक्षित किया जाता है, और फिर मुख्य LLM को उन उत्तरों के निर्माण के लिए अनुकूलित किया जाता है जो इस reward को अधिकतम करें। यह विधि InstructGPT और GPT-4 मॉडलों में प्रभावी सिद्ध हुई है, जिससे उपयोगकर्ताओं की अपेक्षाओं के साथ उनका तालमेल काफी बढ़ा[4]।
Constitutional AI
Anthropicकंपनी द्वारा विकसित, Constitutional AI पद्धति RLHF का एक विकल्प है। मानवीय प्रत्यक्ष प्रतिक्रिया के बजाय, मॉडल को सिद्धांतों के एक समूह («संविधान») का पालन करने के लिए प्रशिक्षित किया जाता है। यह मानवीय निगरानी की आवश्यकता को 80-90% कम करता है और हानिकारक सामग्री के निर्माण को प्रभावी ढंग से रोकता है[5]।
आर्किटेक्चरल समाधान
- Mixture of Experts (MoE): विरल सक्रियण (sparse activation) वाला एक आर्किटेक्चर, जो गणनात्मक लागत में आनुपातिक वृद्धि किए बिना मॉडल की क्षमता को महत्वपूर्ण रूप से बढ़ाता है। यह माना जाता है कि GPT-4 प्रत्येक 220 अरब parameters वाले 8 विशेषज्ञों (experts) का उपयोग करता है।
- Attention तंत्र में संशोधन: Grouped Query Attention (GQA) (Llama 3 मॉडलों में) और Sparse Attention जैसी तकनीकें गणनात्मक जटिलता और मेमोरी आवश्यकताओं को कम करती हैं, जिससे लंबे context को संसाधित करना संभव होता है।
Inference (अनुमान) चरण में तरीके
Retrieval-Augmented Generation (RAG)
RAG तथ्यात्मक त्रुटियों को कम करने के सबसे प्रभावी तरीकों में से एक है। उत्तर उत्पन्न करने से पहले, प्रणाली एक बाहरी ज्ञान आधार (जैसे Wikipedia, कॉर्पोरेट दस्तावेज़ीकरण, वैज्ञानिक लेख) से संपर्क करती है, प्रासंगिक जानकारी निकालती है और उसे मूल प्रश्न के साथ मॉडल को प्रदान करती है। यह उत्तर को सत्यापित तथ्यों पर «आधारित» करता है। RAG प्रणालियाँ benchmark TriviaQA पर 56.8% exact match प्राप्त करती हैं और तथ्यात्मक त्रुटियों को कम करने में पारंपरिक मॉडलों से 60–80% बेहतर प्रदर्शन करती हैं।
उन्नत Prompting तकनीकें
- Chain-of-Thought (CoT): Prompting जो मॉडल को अंतिम उत्तर देने से पहले चरण-दर-चरण तर्क की श्रृंखला उत्पन्न करने के लिए प्रोत्साहित करता है। यह तार्किक और गणितीय गणनाओं की आवश्यकता वाले कार्यों में परिणामों में काफी सुधार करता है।
- Chain of Draft (CoD): CoT का एक विकास, जिसमें मॉडल अपने उत्तर के मसौदों को पुनरावृत्त रूप से संपादित करता है, जिससे काफी कम tokens का उपयोग करते हुए CoT के समतुल्य सटीकता प्राप्त होती है।
आंतरिक स्व-सुधार (Intrinsic Self-Correction)
TACL 2024 के अध्ययनों से पता चला है कि बाहरी जानकारी के बिना LLM की स्व-सुधार क्षमता सीमित है। प्रभावी स्व-सुधार के लिए आमतौर पर बाहरी उपकरणों की आवश्यकता होती है, जैसे गणनाओं की जाँच के लिए code interpreter या तथ्यों के सत्यापन के लिए खोज इंजन[6]।
त्रुटि मूल्यांकन के तरीके
त्रुटियों को कम करने में प्रगति मापने के लिए विशेष metrics और benchmarks का उपयोग किया जाता है।
- पारंपरिक metrics: Perplexity, BLEU और ROUGE। ये प्रवाह और n-gram मिलान के मूल्यांकन के लिए उपयोगी हैं, लेकिन तथ्यात्मक सटीकता के मूल्यांकन में कमज़ोर हैं।
- आधुनिक दृष्टिकोण:
- FactScore लंबे पाठों को परमाणु तथ्यों में विभाजित करता है और ज्ञान आधार द्वारा पुष्टि किए गए तथ्यों के प्रतिशत का मूल्यांकन करता है।
- SAFE (Search-Augmented Factuality Evaluator) — Google की एक विधि जो तथ्यों की जाँच के लिए खोज का उपयोग करती है और मानव मूल्यांकन के साथ 72% सहमति प्राप्त करती है, जो 20 गुना सस्ती है।
- TruthfulQA — एक benchmark जो मॉडलों की प्रचलित भ्रांतियों को उत्पन्न करने से बचने की क्षमता पर केंद्रित है।
साहित्य
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions. arXiv:2311.05232.
- Min, S. et al. (2023). FActScore: Fine-Grained Atomic Evaluation of Factual Precision in Long-Form Text Generation. arXiv:2305.14251.
- Wei, J. et al. (2024). Long-Form Factuality in Large Language Models (SAFE). arXiv:2403.18802.
- Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. arXiv:2005.11401.
- Hu, E. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Madaan, A. et al. (2023). Self-Refine: Iterative Refinement with Self-Feedback. arXiv:2303.17651.
- Wang, X. et al. (2022). Self-Consistency Improves Chain-of-Thought Reasoning in Language Models. arXiv:2203.11171.
- Anthropic (2024). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Maslej, N. et al. (2024). Artificial Intelligence Index Report 2024. arXiv:2405.19522.
टिप्पणियाँ
- ↑ «Hallucination Leaderboard». Vectara. (2024-2025). Проверено 4 июля 2025.
- ↑ Huang, L., et al. (2023). «A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions». arXiv:2311.05232.
- ↑ 3.0 3.1 Stanford Human-Centered AI (2024). «AI Index Report 2024».
- ↑ OpenAI (2024). «Learning to Reason with LLMs». Technical Blog.
- ↑ Anthropic (2024). «Constitutional AI: Harmlessness from AI Feedback». Research Paper.
- ↑ «When Can LLMs Actually Correct Their Own Mistakes?». Transactions of the Association for Computational Linguistics. (2024).