LLM error mitigation — کاهش خطاهای LLM

From Systems analysis Wiki
Jump to navigation Jump to search

کاهش خطاها در مدل‌های زبانی بزرگ (LLM) — مجموعه‌ای از روش‌ها و فناوری‌هایی است که به منظور افزایش دقت، قابلیت اطمینان و ایمنی سیستم‌های هوش مصنوعی مبتنی بر معماری transformer طراحی شده‌اند. مسئله خطاها، به‌ویژه hallucination، یکی از موانع اصلی برای استقرار گسترده LLM در حوزه‌های حیاتی به شمار می‌رود. بر اساس پژوهش‌های سال‌های ۲۰۲۴–۲۰۲۵، نرخ hallucination در LLM‌های در دسترس عموم بین ۳٪ تا ۱۶٪ است[1].

گونه‌شناسی خطاها

دسته‌بندی نوین خطاهای LLM شامل چند دسته اصلی است که هر یک رویکردهای خاصی برای کاهش پیامدها (mitigation) می‌طلبند.

Hallucination

Hallucination عبارت است از تولید محتوایی که باورپذیر به نظر می‌رسد اما از نظر واقعی نادرست است. بر اساس پژوهش هوانگ و همکاران (۲۰۲۳)، دو نوع اصلی از آن متمایز می‌شود[2]:

  • Hallucination واقعی — انحراف از حقایق قابل تأیید، از جمله ساختن حقایق غیرواقعی (fabrication). در پژوهش ۲۰۲۴، دانشگاه استنفورد دریافت که LLM‌ها بیش از ۱۲۰ پرونده قضایی غیرواقعی ابداع کرده‌اند[3].
  • Hallucination منطقی — نقض توالی منطقی در استدلال‌ها.

آمار سال ۲۰۲۴ نشان می‌دهد که چت‌بات‌ها در ۲۷٪ موارد دچار hallucination می‌شوند و ۴۶٪ از متون تولیدشده حاوی خطاهای واقعی هستند[3].

انحراف‌های سیستماتیک (Bias)

انحراف در LLM‌ها به شکل تعصبات اجتماعی (مثلاً ارتباط دادن مشاغل با جنسیت خاص) و تفاوت‌های جمعیتی در عملکرد نمود می‌یابد. پژوهش‌های ۲۰۲۴ نشان داد که در میان ۱۰ مدل آزمایش‌شده، تفاوت در نمرات برای گروه‌های جمعیتی مختلف می‌تواند به ۴ امتیاز از ۱۰ برسد.

سمیّت (Toxicity)

سمیّت به عنوان تولید محتوای توهین‌آمیز، مضر یا تبعیض‌آمیز تعریف می‌شود. متریک toxicity بسته به مدل و زمینه استفاده در دامنه وسیعی متغیر است.

روش‌های کاهش خطاها

راهبردهای مقابله با خطاها را می‌توان به دو گروه بزرگ تقسیم کرد: روش‌هایی که مدل و فرآیند آموزش را تغییر می‌دهند، و روش‌هایی که در مرحله استنتاج (inference) به کار می‌روند.

تغییر مدل و فرآیند آموزش

Fine-tuning و Instruction Tuning

Supervised Fine-Tuning (SFT) امکان تطبیق مدل‌های از پیش آموزش‌دیده با وظایف خاص را فراهم می‌کند. برای کاهش هزینه‌های محاسباتی، از روش‌های Parameter-Efficient Fine-Tuning (PEFT) مانند LoRA و QLoRA استفاده می‌شود که می‌توانند هزینه fine-tuning را تا ۹۹٪ کاهش دهند و در عین حال کارایی را حفظ کنند.

یادگیری تقویتی بر اساس بازخورد انسانی (RLHF)

RLHF یک فرآیند دو مرحله‌ای است که در آن ابتدا یک مدل پاداش بر اساس ترجیحات انسانی آموزش می‌بیند، سپس LLM اصلی برای تولید پاسخ‌هایی که این پاداش را بیشینه می‌کنند، بهینه‌سازی می‌شود. این روش در مدل‌های InstructGPT و GPT-4 کارایی خود را نشان داده و انطباق آن‌ها با انتظارات کاربران را به طور قابل توجهی افزایش داده است[4].

Constitutional AI

روش Constitutional AI، که توسط شرکت Anthropic توسعه یافته، جایگزینی برای RLHF است. به جای بازخورد مستقیم انسانی، مدل آموزش می‌بیند تا از مجموعه‌ای از اصول («قانون اساسی») پیروی کند. این امر نیاز به نظارت انسانی را ۸۰ تا ۹۰٪ کاهش می‌دهد و به طور مؤثری از تولید محتوای مضر جلوگیری می‌کند[5].

راه‌حل‌های معماری

  • Mixture of Experts (MoE): معماری با فعال‌سازی پراکنده که امکان افزایش چشمگیر ظرفیت مدل را بدون رشد متناسب هزینه‌های محاسباتی فراهم می‌کند. تصور می‌شود GPT-4 از ۸ متخصص (expert) با ۲۲۰ میلیارد پارامتر هر کدام استفاده می‌کند.
  • اصلاح مکانیزم attention: تکنیک‌هایی مانند Grouped Query Attention (GQA) (در مدل‌های Llama 3) و Sparse Attention، پیچیدگی محاسباتی و نیاز به حافظه را کاهش می‌دهند و پردازش context‌های طولانی‌تر را ممکن می‌سازند.

روش‌های مرحله استنتاج (Inference)

Retrieval-Augmented Generation (RAG)

RAG یکی از مؤثرترین روش‌ها برای کاهش خطاهای واقعی است. پیش از تولید پاسخ، سیستم به یک پایگاه دانش خارجی (مثلاً ویکی‌پدیا، مستندات سازمانی، مقالات علمی) مراجعه می‌کند، اطلاعات مرتبط را استخراج کرده و همراه با پرسش اولیه به مدل منتقل می‌کند. این کار پاسخ را بر پایه حقایق تأیید‌شده «مستقر» می‌سازد. سیستم‌های RAG به ۵۶.۸٪ exact match در benchmark TriviaQA دست می‌یابند و در کاهش خطاهای واقعی ۶۰ تا ۸۰٪ بر مدل‌های سنتی برتری دارند.

تکنیک‌های پیشرفته prompting

  • Chain-of-Thought (CoT): نوعی prompting که مدل را تشویق می‌کند پیش از ارائه پاسخ نهایی، زنجیره استدلال گام‌به‌گام تولید کند. این روش نتایج را در وظایف نیازمند استدلال منطقی و محاسبات ریاضی به طور قابل توجهی بهبود می‌بخشد.
  • Chain of Draft (CoD): تکامل CoT که در آن مدل به صورت تکراری پیش‌نویس‌های پاسخ خود را ویرایش می‌کند و این امکان را فراهم می‌آورد که دقتی قابل مقایسه با CoT با استفاده از token‌های بسیار کمتری حاصل شود.

خودتصحیحی درونی (Intrinsic Self-Correction)

پژوهش‌های TACL سال ۲۰۲۴ نشان داد که توانایی LLM برای خودتصحیحی بدون اطلاعات خارجی محدود است. خودتصحیحی مؤثر معمولاً نیازمند استفاده از ابزارهای خارجی مانند مفسرهای کد برای بررسی محاسبات یا موتورهای جستجو برای اعتبارسنجی حقایق است[6].

روش‌های ارزیابی خطاها

برای سنجش پیشرفت در کاهش خطاها، از متریک‌ها و benchmark‌های تخصصی استفاده می‌شود.

  • متریک‌های سنتی: Perplexity، BLEU و ROUGE. این‌ها برای ارزیابی روانی و تطابق n-gram مفیدند، اما در سنجش دقت واقعی ضعیف عمل می‌کنند.
  • رویکردهای نوین:
    • FactScore متن‌های طولانی را به حقایق اتمی تجزیه می‌کند و درصد حقایق تأیید‌شده توسط پایگاه دانش را ارزیابی می‌کند.
    • SAFE (Search-Augmented Factuality Evaluator) — روشی از Google که از جستجو برای بررسی حقایق استفاده می‌کند، به ۷۲٪ همخوانی با ارزیابی‌های انسانی دست می‌یابد و ۲۰ برابر ارزان‌تر عمل می‌کند.
    • TruthfulQA — benchmark‌ای که بر توانایی مدل‌ها در اجتناب از تولید باورهای غلط رایج تمرکز دارد.

منابع

  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions. arXiv:2311.05232.
  • Min, S. et al. (2023). FActScore: Fine-Grained Atomic Evaluation of Factual Precision in Long-Form Text Generation. arXiv:2305.14251.
  • Wei, J. et al. (2024). Long-Form Factuality in Large Language Models (SAFE). arXiv:2403.18802.
  • Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. arXiv:2005.11401.
  • Hu, E. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685.
  • Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
  • Madaan, A. et al. (2023). Self-Refine: Iterative Refinement with Self-Feedback. arXiv:2303.17651.
  • Wang, X. et al. (2022). Self-Consistency Improves Chain-of-Thought Reasoning in Language Models. arXiv:2203.11171.
  • Anthropic (2024). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Maslej, N. et al. (2024). Artificial Intelligence Index Report 2024. arXiv:2405.19522.

یادداشت‌ها

  1. «Hallucination Leaderboard». Vectara. (2024-2025). Проверено 4 июля 2025.
  2. Huang, L., et al. (2023). «A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions». arXiv:2311.05232.
  3. 3.0 3.1 Stanford Human-Centered AI (2024). «AI Index Report 2024».
  4. OpenAI (2024). «Learning to Reason with LLMs». Technical Blog.
  5. Anthropic (2024). «Constitutional AI: Harmlessness from AI Feedback». Research Paper.
  6. «When Can LLMs Actually Correct Their Own Mistakes?». Transactions of the Association for Computational Linguistics. (2024).