LLM hallucinations — توهمات و پاسخ‌های نادرست LLM

From Systems analysis Wiki
Jump to navigation Jump to search

توهم (به انگلیسی: hallucination) در بافت مدل‌های زبانی بزرگ (LLM) پدیده‌ای است که طی آن مدل با اطمینان پاسخی به ظاهر معقول (plausible) تولید می‌کند که در واقع با واقعیت مطابقت ندارد، با زمینه ارائه‌شده همخوانی ندارد یا دارای تناقض درونی است[1][2]. مدل حقایق، جزئیات یا نتیجه‌گیری‌های منطقی‌ای را «می‌سازد» که در داده‌های اولیه وجود ندارند.

لازم به تأکید است که توهم، به معنای سنتی کلمه، یک خرابی یا باگ نیست. مدل دقیقاً همان‌طور که طراحی شده عمل می‌کند: محتمل‌ترین ادامه متن را بر اساس الگوهای استخراج‌شده از داده‌های آموزشی پیش‌بینی می‌کند. هیچ مکانیسم داخلی برای بررسی صحت ادعاها در آن وجود ندارد[3]. توهمات از خطاهای ساده متمایزند، چرا که اطلاعاتی کذب اما با اطمینان ارائه‌شده هستند که اغلب شامل حقایق، منابع یا رویدادهای غیرواقعی می‌شوند[4]. این پدیده آنقدر اهمیت یافت که در سال ۲۰۲۳، فرهنگ لغت کمبریج معنای جدیدی از واژه «hallucination» مربوط به هوش مصنوعی را اضافه کرد[5].

تعاریف و طبقه‌بندی توهمات

هرچند اصطلاحات گوناگونی به کار می‌روند (مثلاً «confabulation» یا «اختراع»)، توهمات در LLM را می‌توان به دو دسته بزرگ تقسیم کرد: مرتبط با صحت واقعی و مرتبط با وفاداری به منبع (انسجام زمینه‌ای)[6].

توهمات واقعی

این حالتی است که مدل اطلاعات واقعاً نادرستی درباره جهان واقعی ارائه می‌دهد. مدل یک «واقعیت» دروغ را به عنوان حقیقت بیان می‌کند[1].

  • مثال: «چارلز لیندبرگ اولین انسانی بود که روی سطح ماه قدم گذاشت» — واقعیتی کاملاً ساختگی.
  • نقل‌قول‌ها و منابع جعلی: مدل ممکن است ارجاعی به یک مقاله علمی یا قانون ناموجود بسازد و قالب یک ارجاع واقعی را تقلید کند[2]. این امر اعتماد به مدل‌ها را، به‌ویژه در کاربردهایی که دقت در آن‌ها ضروری است (آموزش، اخبار، مشاوره)، تضعیف می‌کند[7].

خطاهای منطقی

مدل دچار ناسازگاری یا خطا در استدلال می‌شود. ممکن است حقایق جداگانه در پاسخ درست باشند، اما نتیجه‌گیری غیرمنطقی یا متناقض با منطق ابتدایی باشد[2]. این امر اغلب در استدلال‌های پیچیده یا مسائل ریاضی و علّی رخ می‌دهد، جایی که مدل بر پیوندهای احتمالی کلمات تکیه می‌کند، نه منطق صوری[2][2].

  • مثال: «از آنجا که پرندگان پرواز می‌کنند، فضانوردان گرانش را احساس نمی‌کنند» — متن منسجم به نظر می‌رسد، اما از نظر منطقی نادرست است.

توهمات زمینه‌ای

پاسخ مدل با زمینه یا دستورالعمل ارائه‌شده مطابقت ندارد. مدل از زمینه «خارج می‌شود» و اطلاعات اضافی می‌افزاید یا اطلاعات لازم را نادیده می‌گیرد[1].

  • نقض دستورالعمل: در پاسخ به درخواست «متن را به اسپانیایی ترجمه کن»، مدل به زبان انگلیسی پاسخ می‌دهد[1].
  • اطلاعات خارج از منبع: در وظیفه خلاصه‌سازی، مدل حقایقی را «اضافه می‌کند» که در سند اصلی وجود ندارند یا آن‌ها را تحریف می‌کند[1].
  • درهم‌آمیختن زمینه‌ها: در میان پاسخ، مدل ناگهان درباره موضوعی از حوزه‌ای دیگر صحبت می‌کند. برای مثال، در پاسخ به سؤالی درباره کمیسیونر NBA آدام سیلور، مدل ممکن است به سلف او دیوید استرن بپردازد و دو زمینه متفاوت را درهم بیامیزد[6].

ناسازگاری

نوعی توهم که طی آن مدل در یک پاسخ یا سلسله‌ای از پاسخ‌ها با خودش تناقض پیدا می‌کند[6]. در یک پژوهش مشخص شد که نرخ خودتناقضی پاسخ‌های ChatGPT حدود ۱۴٪ است[6][6].

  • مثال: «شرکت X در سال ۱۹۹۰ تأسیس شد... و چند جمله بعد ...شرکت X که در سال ۲۰۰۰ تشکیل شد...»

توهمات در کد

مدل‌های LLM که روی کد آموزش دیده‌اند، ممکن است قطعه کدهایی از نظر نحوی درست اما غیرقابل اجرا تولید کنند که از توابع، کتابخانه‌ها یا پارامترهای ناموجود استفاده می‌کنند[2]. برای مثال، مدل ممکن است `import quantum` را در Python تولید کند، در حالی که چنین ماژول استانداردی وجود ندارد. در سال ۲۰۲۴، اصطلاح «code hallucination» پیشنهاد شد و benchmark CodeMirage برای نظام‌مند کردن این مشکل ایجاد گردید[8].

دلایل بروز

پدیده توهمات ناشی از ترکیبی از عوامل است، از معماری مدل تا کیفیت داده‌ها.

  • معماری و اصل آموزش: اکثر LLMها (مثلاً GPT) transformer های خودبازگشتی هستند که برای پیش‌بینی token بعدی آموزش دیده‌اند. هدف آن‌ها به حداکثر رساندن احتمال متن است، نه بررسی صحت ادعاها[2]. مدل در داده‌های آموزشی میان واقعیت و داستان تمایز قائل نمی‌شود و همه چیز را به صورت الگوهای متنی درک می‌کند[2].
  • کیفیت داده‌های آموزشی: LLMها روی حجم عظیمی از متون اینترنتی آموزش می‌بینند که حاوی اشتباهات فراوان، اسطوره‌ها و اطلاعات منسوخ هستند[1]. مدل این خطاها را حفظ و بازتولید می‌کند. همچنین knowledge cutoff اهمیت دارد — محدوده زمانی‌ای که مدل تا آن تاریخ اطلاعات دارد.
  • شیوه تولید متن: ماهیت تصادفی تولید (نمونه‌گیری با temperature) به مدل اجازه می‌دهد پاسخ‌های «خلاقانه‌تر» اما کم‌دقت‌تری بسازد. طول محدود زمینه ممکن است باعث شود مدل جزئیات اولیه گفتگو را «فراموش» کرده و با خودش تناقض پیدا کند[6].

روش‌های ارزیابی و اندازه‌گیری

برای شناسایی و اندازه‌گیری توهمات از معیارهای خودکار، ارزیابی انسانی و benchmark های تخصصی استفاده می‌شود.

  • معیارهای خودکار: شامل رویکردهایی است که در آن‌ها یک LLM دیگر به عنوان «داور» (LLM-as-a-judge) برای ارزیابی درستی پاسخ به کار می‌رود[9]، یا تحلیل آنتروپی (عدم اطمینان) مدل هنگام تولید[10].
  • حاشیه‌نویسی انسانی: «استاندارد طلایی» محسوب می‌شود. متخصصان یا ارزیابان جمعی پاسخ‌ها را به صورت دستی بررسی و خطاها را علامت‌گذاری می‌کنند. این روش در آموزش مدل‌ها با RLHF به کار می‌رود[11].
  • Benchmark ها و آزمون‌های فشار: مجموعه داده‌های تخصصی ایجاد شده‌اند، مثل TruthfulQA که شامل سؤالاتی است که مدل را به بازتولید اسطوره‌های رایج تحریک می‌کند[12]. همچنین leaderboard هایی مثل Hugging Face Hallucination Leaderboard وجود دارند که مدل‌ها را از نظر سطح توهمات مقایسه می‌کنند[13].

روش‌های کاهش و پیشگیری

  • Retrieval-Augmented Generation (RAG): موفق‌ترین رویکردی که مدل را به دانش خارجی «مقید» می‌کند. پیش از تولید پاسخ، مدل اطلاعات مرتبط را از پایگاه داده، موتور جستجو یا API دریافت می‌کند. این به مدل اجازه می‌دهد پاسخ را بر داده‌های تأییدشده استوار کند، نه بر حدس[2].
  • زنجیره‌های استدلال (Chain-of-Thought) و خودبررسی: مدل ابتدا استدلال گام‌به‌گامی تولید می‌کند و سپس پاسخ نهایی می‌دهد که دقت را افزایش می‌دهد. در روش‌های پیشرفته‌تری مثل Self-Verification، مدل یک پاسخ پیش‌نویس تولید می‌کند، سپس وظیفه دارد آن را بررسی و اصلاح کند[14].
  • قوانین و فیلترهای داخلی: مدل‌ها آموزش می‌بینند که در صورت عدم اطمینان از پاسخ دادن خودداری کنند. برای مثال، مدل‌های Claude از Anthropic از اصل «صداقت» پیروی می‌کنند و اغلب به جای اختراع حقایق، پاسخ می‌دهند «دقیقاً مطمئن نیستم...»[11].
  • ادغام با ابزارهای خارجی: مدل‌هایی مثل Gemini می‌توانند به صورت خودکار تشخیص دهند که چه زمانی به ابزار خارجی نیاز دارند (مثلاً ماشین‌حساب برای محاسبات یا جستجو برای اخبار تازه) و از آن استفاده کنند، که این امر تعداد توهمات را به شکل قابل توجهی کاهش می‌دهد[11].

خطرات و پیامدها

  • خطرات حقوقی و اعتباری: در حوزه حقوقی، توهمات می‌توانند پیامدهای جدی داشته باشند. پرونده معروف Mata v. Avianca (2023) شهرت گسترده‌ای یافت؛ وکیلی از ChatGPT برای یافتن رویه‌های قضایی استفاده کرد و آن چندین پرونده ناموجود را اختراع کرد. وکلا جریمه شدند و این حادثه درسی شد درباره غیرقابل قبول بودن اعتماد به هوش مصنوعی بدون بررسی[1].
  • گسترش اطلاعات غلط: در سطح جامعه، LLMها می‌توانند مشکل اخبار جعلی را تشدید کنند. مورد معروف مدل Galactica از Meta شناخته‌شده است که برای کمک به دانشمندان طراحی شده بود، اما شروع به تولید متون شبه‌علمی با آزمایش‌ها و منابع ساختگی کرد. سه روز پس از عرضه عمومی، دسترسی به مدل بسته شد[15].
  • اتخاذ تصمیمات اشتباه: کاربران، به‌ویژه کم‌تجربه‌ها، تمایل دارند به پاسخ‌های با اطمینان بیان‌شده هوش مصنوعی اعتماد کنند، که می‌تواند به تصمیم‌گیری‌های نادرست در حوزه‌های مالی، پزشکی و سایر حوزه‌های حیاتی منجر شود[7].

نمونه‌های عملی

  • ماجرای Air Canada (2023): چت‌بات شرکت هواپیمایی سیاستی غیرواقعی برای بازگشت بلیط اختراع کرد. وقتی مشتری خواست آن را اعمال کنند، شرکت امتناع کرد. دادگاه حمل‌ونقل کانادا Air Canada را ملزم کرد مسئولیت اطلاعاتی را که چت‌بات آن ارائه داده بپذیرد و به مشتری غرامت بپردازد[9].
  • شکایت افترا علیه OpenAI (2023): مجری رادیویی مارک والترز علیه OpenAI شکایت کرد، چرا که ChatGPT در پاسخ به درخواست یک خبرنگار، به دروغ او را به کلاهبرداری متهم کرد. این ماجرا مسئولیت حقوقی شرکت‌ها در قبال محتوای تولیدشده توسط مدل‌هایشان را برجسته کرد[6].

پیوندها

  • The Beginner's Guide to Hallucinations in Large Language Models — راهنمای جامع از Lakera
  • Survey of Hallucination in Natural Language Generation — مروری علمی بر پدیده در arXiv

منابع

  • Holtzman, A. et al. (2020). The Curious Case of Neural Text Degeneration. arXiv:1904.09751.
  • Caccia, M. et al. (2018). Language GANs Falling Short. arXiv:1811.02549.
  • Fan, A. et al. (2018). Hierarchical Neural Story Generation. arXiv:1805.04833.
  • Su, Y.; Collier, N. (2022). Contrastive Search Is What You Need for Neural Text Generation. arXiv:2210.14140.
  • Meister, C. et al. (2023). Locally Typical Sampling. arXiv:2202.00666.
  • O'Brien, S.; Lewis, M. (2023). Contrastive Decoding Improves Reasoning in Large Language Models. arXiv:2309.09117.
  • Finlayson, M. et al. (2024). Basis-Aware Truncation Sampling for Neural Text Generation. arXiv:2412.14352.
  • Tan, Q. et al. (2024). A Thorough Examination of Decoding Methods in the Era of Large Language Models. arXiv:2402.06925.
  • Yu, S. et al. (2023). Conformal Nucleus Sampling. arXiv:2305.02633.
  • Chen, S. J. et al. (2024). Decoding Game: On Minimax Optimality of Heuristic Text Generation Methods. arXiv:2410.03968.

یادداشت‌ها

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «The Beginner's Guide to Hallucinations in Large Language Models». Lakera. [۱]
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 2.7 2.8 «What Is LLM Hallucination and How To Prevent It». Astera. [۲]
  3. «Hallucination (artificial intelligence)». In Wikipedia. [۳]
  4. «OpenAI describes LLM hallucinations as 'making up facts' in moments of uncertainty'». [источник не указан в тексте].
  5. «Cambridge Dictionary adds new definition for 'hallucinate'». [источник не указан в тексте].
  6. 6.0 6.1 6.2 6.3 6.4 6.5 6.6 «LLM Hallucination—Types, Causes, and Solutions». Nexla. [۴]
  7. 7.0 7.1 «Effective Tips to Prevent AI Hallucinations in Generative AI». QuickCreator. [۵]
  8. [2408.08333] CodeMirage: Hallucinations in Code Generated by Large Language Models. arXiv. [۶]
  9. 9.0 9.1 «LLM hallucinations and failures: lessons from 4 examples». Evidently AI Blog. [۷]
  10. «How to Perform Hallucination Detection for LLMs». Kolena. [۸]
  11. 11.0 11.1 11.2 «ChatGPT vs Google Gemini vs Anthropic Claude: Comprehensive Comparison & Report». DataStudios. [۹]
  12. «Mastering LLM Accuracy: How to Test, Detect, and Fix Hallucinations in AI Models». Stephen Weber on Medium. [۱۰]
  13. «LLM Benchmarks and Leaderboards: Avoiding Foundation Model Mistakes». Arize Blog. [۱۱]
  14. «Improving the Reliability of LLMs: Combining Chain-of-Thought Reasoning and Retrieval-Augmented Generation». arXiv. [۱۲]
  15. «Why Meta Took Down its 'Hallucinating' AI Model Galactica?». Analytics India Magazine. [۱۳]