LLM error mitigation — کاهش خطاهای LLM
کاهش خطاها در مدلهای زبانی بزرگ (LLM) — مجموعهای از روشها و فناوریهایی است که به منظور افزایش دقت، قابلیت اطمینان و ایمنی سیستمهای هوش مصنوعی مبتنی بر معماری transformer طراحی شدهاند. مسئله خطاها، بهویژه hallucination، یکی از موانع اصلی برای استقرار گسترده LLM در حوزههای حیاتی به شمار میرود. بر اساس پژوهشهای سالهای ۲۰۲۴–۲۰۲۵، نرخ hallucination در LLMهای در دسترس عموم بین ۳٪ تا ۱۶٪ است[1].
گونهشناسی خطاها
دستهبندی نوین خطاهای LLM شامل چند دسته اصلی است که هر یک رویکردهای خاصی برای کاهش پیامدها (mitigation) میطلبند.
Hallucination
Hallucination عبارت است از تولید محتوایی که باورپذیر به نظر میرسد اما از نظر واقعی نادرست است. بر اساس پژوهش هوانگ و همکاران (۲۰۲۳)، دو نوع اصلی از آن متمایز میشود[2]:
- Hallucination واقعی — انحراف از حقایق قابل تأیید، از جمله ساختن حقایق غیرواقعی (fabrication). در پژوهش ۲۰۲۴، دانشگاه استنفورد دریافت که LLMها بیش از ۱۲۰ پرونده قضایی غیرواقعی ابداع کردهاند[3].
- Hallucination منطقی — نقض توالی منطقی در استدلالها.
آمار سال ۲۰۲۴ نشان میدهد که چتباتها در ۲۷٪ موارد دچار hallucination میشوند و ۴۶٪ از متون تولیدشده حاوی خطاهای واقعی هستند[3].
انحرافهای سیستماتیک (Bias)
انحراف در LLMها به شکل تعصبات اجتماعی (مثلاً ارتباط دادن مشاغل با جنسیت خاص) و تفاوتهای جمعیتی در عملکرد نمود مییابد. پژوهشهای ۲۰۲۴ نشان داد که در میان ۱۰ مدل آزمایششده، تفاوت در نمرات برای گروههای جمعیتی مختلف میتواند به ۴ امتیاز از ۱۰ برسد.
سمیّت (Toxicity)
سمیّت به عنوان تولید محتوای توهینآمیز، مضر یا تبعیضآمیز تعریف میشود. متریک toxicity بسته به مدل و زمینه استفاده در دامنه وسیعی متغیر است.
روشهای کاهش خطاها
راهبردهای مقابله با خطاها را میتوان به دو گروه بزرگ تقسیم کرد: روشهایی که مدل و فرآیند آموزش را تغییر میدهند، و روشهایی که در مرحله استنتاج (inference) به کار میروند.
تغییر مدل و فرآیند آموزش
Fine-tuning و Instruction Tuning
Supervised Fine-Tuning (SFT) امکان تطبیق مدلهای از پیش آموزشدیده با وظایف خاص را فراهم میکند. برای کاهش هزینههای محاسباتی، از روشهای Parameter-Efficient Fine-Tuning (PEFT) مانند LoRA و QLoRA استفاده میشود که میتوانند هزینه fine-tuning را تا ۹۹٪ کاهش دهند و در عین حال کارایی را حفظ کنند.
یادگیری تقویتی بر اساس بازخورد انسانی (RLHF)
RLHF یک فرآیند دو مرحلهای است که در آن ابتدا یک مدل پاداش بر اساس ترجیحات انسانی آموزش میبیند، سپس LLM اصلی برای تولید پاسخهایی که این پاداش را بیشینه میکنند، بهینهسازی میشود. این روش در مدلهای InstructGPT و GPT-4 کارایی خود را نشان داده و انطباق آنها با انتظارات کاربران را به طور قابل توجهی افزایش داده است[4].
Constitutional AI
روش Constitutional AI، که توسط شرکت Anthropic توسعه یافته، جایگزینی برای RLHF است. به جای بازخورد مستقیم انسانی، مدل آموزش میبیند تا از مجموعهای از اصول («قانون اساسی») پیروی کند. این امر نیاز به نظارت انسانی را ۸۰ تا ۹۰٪ کاهش میدهد و به طور مؤثری از تولید محتوای مضر جلوگیری میکند[5].
راهحلهای معماری
- Mixture of Experts (MoE): معماری با فعالسازی پراکنده که امکان افزایش چشمگیر ظرفیت مدل را بدون رشد متناسب هزینههای محاسباتی فراهم میکند. تصور میشود GPT-4 از ۸ متخصص (expert) با ۲۲۰ میلیارد پارامتر هر کدام استفاده میکند.
- اصلاح مکانیزم attention: تکنیکهایی مانند Grouped Query Attention (GQA) (در مدلهای Llama 3) و Sparse Attention، پیچیدگی محاسباتی و نیاز به حافظه را کاهش میدهند و پردازش contextهای طولانیتر را ممکن میسازند.
روشهای مرحله استنتاج (Inference)
Retrieval-Augmented Generation (RAG)
RAG یکی از مؤثرترین روشها برای کاهش خطاهای واقعی است. پیش از تولید پاسخ، سیستم به یک پایگاه دانش خارجی (مثلاً ویکیپدیا، مستندات سازمانی، مقالات علمی) مراجعه میکند، اطلاعات مرتبط را استخراج کرده و همراه با پرسش اولیه به مدل منتقل میکند. این کار پاسخ را بر پایه حقایق تأییدشده «مستقر» میسازد. سیستمهای RAG به ۵۶.۸٪ exact match در benchmark TriviaQA دست مییابند و در کاهش خطاهای واقعی ۶۰ تا ۸۰٪ بر مدلهای سنتی برتری دارند.
تکنیکهای پیشرفته prompting
- Chain-of-Thought (CoT): نوعی prompting که مدل را تشویق میکند پیش از ارائه پاسخ نهایی، زنجیره استدلال گامبهگام تولید کند. این روش نتایج را در وظایف نیازمند استدلال منطقی و محاسبات ریاضی به طور قابل توجهی بهبود میبخشد.
- Chain of Draft (CoD): تکامل CoT که در آن مدل به صورت تکراری پیشنویسهای پاسخ خود را ویرایش میکند و این امکان را فراهم میآورد که دقتی قابل مقایسه با CoT با استفاده از tokenهای بسیار کمتری حاصل شود.
خودتصحیحی درونی (Intrinsic Self-Correction)
پژوهشهای TACL سال ۲۰۲۴ نشان داد که توانایی LLM برای خودتصحیحی بدون اطلاعات خارجی محدود است. خودتصحیحی مؤثر معمولاً نیازمند استفاده از ابزارهای خارجی مانند مفسرهای کد برای بررسی محاسبات یا موتورهای جستجو برای اعتبارسنجی حقایق است[6].
روشهای ارزیابی خطاها
برای سنجش پیشرفت در کاهش خطاها، از متریکها و benchmarkهای تخصصی استفاده میشود.
- متریکهای سنتی: Perplexity، BLEU و ROUGE. اینها برای ارزیابی روانی و تطابق n-gram مفیدند، اما در سنجش دقت واقعی ضعیف عمل میکنند.
- رویکردهای نوین:
- FactScore متنهای طولانی را به حقایق اتمی تجزیه میکند و درصد حقایق تأییدشده توسط پایگاه دانش را ارزیابی میکند.
- SAFE (Search-Augmented Factuality Evaluator) — روشی از Google که از جستجو برای بررسی حقایق استفاده میکند، به ۷۲٪ همخوانی با ارزیابیهای انسانی دست مییابد و ۲۰ برابر ارزانتر عمل میکند.
- TruthfulQA — benchmarkای که بر توانایی مدلها در اجتناب از تولید باورهای غلط رایج تمرکز دارد.
منابع
- Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions. arXiv:2311.05232.
- Min, S. et al. (2023). FActScore: Fine-Grained Atomic Evaluation of Factual Precision in Long-Form Text Generation. arXiv:2305.14251.
- Wei, J. et al. (2024). Long-Form Factuality in Large Language Models (SAFE). arXiv:2403.18802.
- Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. arXiv:2005.11401.
- Hu, E. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Madaan, A. et al. (2023). Self-Refine: Iterative Refinement with Self-Feedback. arXiv:2303.17651.
- Wang, X. et al. (2022). Self-Consistency Improves Chain-of-Thought Reasoning in Language Models. arXiv:2203.11171.
- Anthropic (2024). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Maslej, N. et al. (2024). Artificial Intelligence Index Report 2024. arXiv:2405.19522.
یادداشتها
- ↑ «Hallucination Leaderboard». Vectara. (2024-2025). Проверено 4 июля 2025.
- ↑ Huang, L., et al. (2023). «A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions». arXiv:2311.05232.
- ↑ 3.0 3.1 Stanford Human-Centered AI (2024). «AI Index Report 2024».
- ↑ OpenAI (2024). «Learning to Reason with LLMs». Technical Blog.
- ↑ Anthropic (2024). «Constitutional AI: Harmlessness from AI Feedback». Research Paper.
- ↑ «When Can LLMs Actually Correct Their Own Mistakes?». Transactions of the Association for Computational Linguistics. (2024).