LLM hallucinations — توهمات و پاسخهای نادرست LLM
توهم (به انگلیسی: hallucination) در بافت مدلهای زبانی بزرگ (LLM) پدیدهای است که طی آن مدل با اطمینان پاسخی به ظاهر معقول (plausible) تولید میکند که در واقع با واقعیت مطابقت ندارد، با زمینه ارائهشده همخوانی ندارد یا دارای تناقض درونی است[1][2]. مدل حقایق، جزئیات یا نتیجهگیریهای منطقیای را «میسازد» که در دادههای اولیه وجود ندارند.
لازم به تأکید است که توهم، به معنای سنتی کلمه، یک خرابی یا باگ نیست. مدل دقیقاً همانطور که طراحی شده عمل میکند: محتملترین ادامه متن را بر اساس الگوهای استخراجشده از دادههای آموزشی پیشبینی میکند. هیچ مکانیسم داخلی برای بررسی صحت ادعاها در آن وجود ندارد[3]. توهمات از خطاهای ساده متمایزند، چرا که اطلاعاتی کذب اما با اطمینان ارائهشده هستند که اغلب شامل حقایق، منابع یا رویدادهای غیرواقعی میشوند[4]. این پدیده آنقدر اهمیت یافت که در سال ۲۰۲۳، فرهنگ لغت کمبریج معنای جدیدی از واژه «hallucination» مربوط به هوش مصنوعی را اضافه کرد[5].
تعاریف و طبقهبندی توهمات
هرچند اصطلاحات گوناگونی به کار میروند (مثلاً «confabulation» یا «اختراع»)، توهمات در LLM را میتوان به دو دسته بزرگ تقسیم کرد: مرتبط با صحت واقعی و مرتبط با وفاداری به منبع (انسجام زمینهای)[6].
توهمات واقعی
این حالتی است که مدل اطلاعات واقعاً نادرستی درباره جهان واقعی ارائه میدهد. مدل یک «واقعیت» دروغ را به عنوان حقیقت بیان میکند[1].
- مثال: «چارلز لیندبرگ اولین انسانی بود که روی سطح ماه قدم گذاشت» — واقعیتی کاملاً ساختگی.
- نقلقولها و منابع جعلی: مدل ممکن است ارجاعی به یک مقاله علمی یا قانون ناموجود بسازد و قالب یک ارجاع واقعی را تقلید کند[2]. این امر اعتماد به مدلها را، بهویژه در کاربردهایی که دقت در آنها ضروری است (آموزش، اخبار، مشاوره)، تضعیف میکند[7].
خطاهای منطقی
مدل دچار ناسازگاری یا خطا در استدلال میشود. ممکن است حقایق جداگانه در پاسخ درست باشند، اما نتیجهگیری غیرمنطقی یا متناقض با منطق ابتدایی باشد[2]. این امر اغلب در استدلالهای پیچیده یا مسائل ریاضی و علّی رخ میدهد، جایی که مدل بر پیوندهای احتمالی کلمات تکیه میکند، نه منطق صوری[2][2].
- مثال: «از آنجا که پرندگان پرواز میکنند، فضانوردان گرانش را احساس نمیکنند» — متن منسجم به نظر میرسد، اما از نظر منطقی نادرست است.
توهمات زمینهای
پاسخ مدل با زمینه یا دستورالعمل ارائهشده مطابقت ندارد. مدل از زمینه «خارج میشود» و اطلاعات اضافی میافزاید یا اطلاعات لازم را نادیده میگیرد[1].
- نقض دستورالعمل: در پاسخ به درخواست «متن را به اسپانیایی ترجمه کن»، مدل به زبان انگلیسی پاسخ میدهد[1].
- اطلاعات خارج از منبع: در وظیفه خلاصهسازی، مدل حقایقی را «اضافه میکند» که در سند اصلی وجود ندارند یا آنها را تحریف میکند[1].
- درهمآمیختن زمینهها: در میان پاسخ، مدل ناگهان درباره موضوعی از حوزهای دیگر صحبت میکند. برای مثال، در پاسخ به سؤالی درباره کمیسیونر NBA آدام سیلور، مدل ممکن است به سلف او دیوید استرن بپردازد و دو زمینه متفاوت را درهم بیامیزد[6].
ناسازگاری
نوعی توهم که طی آن مدل در یک پاسخ یا سلسلهای از پاسخها با خودش تناقض پیدا میکند[6]. در یک پژوهش مشخص شد که نرخ خودتناقضی پاسخهای ChatGPT حدود ۱۴٪ است[6][6].
- مثال: «شرکت X در سال ۱۹۹۰ تأسیس شد... و چند جمله بعد ...شرکت X که در سال ۲۰۰۰ تشکیل شد...»
توهمات در کد
مدلهای LLM که روی کد آموزش دیدهاند، ممکن است قطعه کدهایی از نظر نحوی درست اما غیرقابل اجرا تولید کنند که از توابع، کتابخانهها یا پارامترهای ناموجود استفاده میکنند[2]. برای مثال، مدل ممکن است `import quantum` را در Python تولید کند، در حالی که چنین ماژول استانداردی وجود ندارد. در سال ۲۰۲۴، اصطلاح «code hallucination» پیشنهاد شد و benchmark CodeMirage برای نظاممند کردن این مشکل ایجاد گردید[8].
دلایل بروز
پدیده توهمات ناشی از ترکیبی از عوامل است، از معماری مدل تا کیفیت دادهها.
- معماری و اصل آموزش: اکثر LLMها (مثلاً GPT) transformer های خودبازگشتی هستند که برای پیشبینی token بعدی آموزش دیدهاند. هدف آنها به حداکثر رساندن احتمال متن است، نه بررسی صحت ادعاها[2]. مدل در دادههای آموزشی میان واقعیت و داستان تمایز قائل نمیشود و همه چیز را به صورت الگوهای متنی درک میکند[2].
- کیفیت دادههای آموزشی: LLMها روی حجم عظیمی از متون اینترنتی آموزش میبینند که حاوی اشتباهات فراوان، اسطورهها و اطلاعات منسوخ هستند[1]. مدل این خطاها را حفظ و بازتولید میکند. همچنین knowledge cutoff اهمیت دارد — محدوده زمانیای که مدل تا آن تاریخ اطلاعات دارد.
- شیوه تولید متن: ماهیت تصادفی تولید (نمونهگیری با temperature) به مدل اجازه میدهد پاسخهای «خلاقانهتر» اما کمدقتتری بسازد. طول محدود زمینه ممکن است باعث شود مدل جزئیات اولیه گفتگو را «فراموش» کرده و با خودش تناقض پیدا کند[6].
روشهای ارزیابی و اندازهگیری
برای شناسایی و اندازهگیری توهمات از معیارهای خودکار، ارزیابی انسانی و benchmark های تخصصی استفاده میشود.
- معیارهای خودکار: شامل رویکردهایی است که در آنها یک LLM دیگر به عنوان «داور» (LLM-as-a-judge) برای ارزیابی درستی پاسخ به کار میرود[9]، یا تحلیل آنتروپی (عدم اطمینان) مدل هنگام تولید[10].
- حاشیهنویسی انسانی: «استاندارد طلایی» محسوب میشود. متخصصان یا ارزیابان جمعی پاسخها را به صورت دستی بررسی و خطاها را علامتگذاری میکنند. این روش در آموزش مدلها با RLHF به کار میرود[11].
- Benchmark ها و آزمونهای فشار: مجموعه دادههای تخصصی ایجاد شدهاند، مثل TruthfulQA که شامل سؤالاتی است که مدل را به بازتولید اسطورههای رایج تحریک میکند[12]. همچنین leaderboard هایی مثل Hugging Face Hallucination Leaderboard وجود دارند که مدلها را از نظر سطح توهمات مقایسه میکنند[13].
روشهای کاهش و پیشگیری
- Retrieval-Augmented Generation (RAG): موفقترین رویکردی که مدل را به دانش خارجی «مقید» میکند. پیش از تولید پاسخ، مدل اطلاعات مرتبط را از پایگاه داده، موتور جستجو یا API دریافت میکند. این به مدل اجازه میدهد پاسخ را بر دادههای تأییدشده استوار کند، نه بر حدس[2].
- زنجیرههای استدلال (Chain-of-Thought) و خودبررسی: مدل ابتدا استدلال گامبهگامی تولید میکند و سپس پاسخ نهایی میدهد که دقت را افزایش میدهد. در روشهای پیشرفتهتری مثل Self-Verification، مدل یک پاسخ پیشنویس تولید میکند، سپس وظیفه دارد آن را بررسی و اصلاح کند[14].
- قوانین و فیلترهای داخلی: مدلها آموزش میبینند که در صورت عدم اطمینان از پاسخ دادن خودداری کنند. برای مثال، مدلهای Claude از Anthropic از اصل «صداقت» پیروی میکنند و اغلب به جای اختراع حقایق، پاسخ میدهند «دقیقاً مطمئن نیستم...»[11].
- ادغام با ابزارهای خارجی: مدلهایی مثل Gemini میتوانند به صورت خودکار تشخیص دهند که چه زمانی به ابزار خارجی نیاز دارند (مثلاً ماشینحساب برای محاسبات یا جستجو برای اخبار تازه) و از آن استفاده کنند، که این امر تعداد توهمات را به شکل قابل توجهی کاهش میدهد[11].
خطرات و پیامدها
- خطرات حقوقی و اعتباری: در حوزه حقوقی، توهمات میتوانند پیامدهای جدی داشته باشند. پرونده معروف Mata v. Avianca (2023) شهرت گستردهای یافت؛ وکیلی از ChatGPT برای یافتن رویههای قضایی استفاده کرد و آن چندین پرونده ناموجود را اختراع کرد. وکلا جریمه شدند و این حادثه درسی شد درباره غیرقابل قبول بودن اعتماد به هوش مصنوعی بدون بررسی[1].
- گسترش اطلاعات غلط: در سطح جامعه، LLMها میتوانند مشکل اخبار جعلی را تشدید کنند. مورد معروف مدل Galactica از Meta شناختهشده است که برای کمک به دانشمندان طراحی شده بود، اما شروع به تولید متون شبهعلمی با آزمایشها و منابع ساختگی کرد. سه روز پس از عرضه عمومی، دسترسی به مدل بسته شد[15].
- اتخاذ تصمیمات اشتباه: کاربران، بهویژه کمتجربهها، تمایل دارند به پاسخهای با اطمینان بیانشده هوش مصنوعی اعتماد کنند، که میتواند به تصمیمگیریهای نادرست در حوزههای مالی، پزشکی و سایر حوزههای حیاتی منجر شود[7].
نمونههای عملی
- ماجرای Air Canada (2023): چتبات شرکت هواپیمایی سیاستی غیرواقعی برای بازگشت بلیط اختراع کرد. وقتی مشتری خواست آن را اعمال کنند، شرکت امتناع کرد. دادگاه حملونقل کانادا Air Canada را ملزم کرد مسئولیت اطلاعاتی را که چتبات آن ارائه داده بپذیرد و به مشتری غرامت بپردازد[9].
- شکایت افترا علیه OpenAI (2023): مجری رادیویی مارک والترز علیه OpenAI شکایت کرد، چرا که ChatGPT در پاسخ به درخواست یک خبرنگار، به دروغ او را به کلاهبرداری متهم کرد. این ماجرا مسئولیت حقوقی شرکتها در قبال محتوای تولیدشده توسط مدلهایشان را برجسته کرد[6].
پیوندها
- The Beginner's Guide to Hallucinations in Large Language Models — راهنمای جامع از Lakera
- Survey of Hallucination in Natural Language Generation — مروری علمی بر پدیده در arXiv
منابع
- Holtzman, A. et al. (2020). The Curious Case of Neural Text Degeneration. arXiv:1904.09751.
- Caccia, M. et al. (2018). Language GANs Falling Short. arXiv:1811.02549.
- Fan, A. et al. (2018). Hierarchical Neural Story Generation. arXiv:1805.04833.
- Su, Y.; Collier, N. (2022). Contrastive Search Is What You Need for Neural Text Generation. arXiv:2210.14140.
- Meister, C. et al. (2023). Locally Typical Sampling. arXiv:2202.00666.
- O'Brien, S.; Lewis, M. (2023). Contrastive Decoding Improves Reasoning in Large Language Models. arXiv:2309.09117.
- Finlayson, M. et al. (2024). Basis-Aware Truncation Sampling for Neural Text Generation. arXiv:2412.14352.
- Tan, Q. et al. (2024). A Thorough Examination of Decoding Methods in the Era of Large Language Models. arXiv:2402.06925.
- Yu, S. et al. (2023). Conformal Nucleus Sampling. arXiv:2305.02633.
- Chen, S. J. et al. (2024). Decoding Game: On Minimax Optimality of Heuristic Text Generation Methods. arXiv:2410.03968.
یادداشتها
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «The Beginner's Guide to Hallucinations in Large Language Models». Lakera. [۱]
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 2.7 2.8 «What Is LLM Hallucination and How To Prevent It». Astera. [۲]
- ↑ «Hallucination (artificial intelligence)». In Wikipedia. [۳]
- ↑ «OpenAI describes LLM hallucinations as 'making up facts' in moments of uncertainty'». [источник не указан в тексте].
- ↑ «Cambridge Dictionary adds new definition for 'hallucinate'». [источник не указан в тексте].
- ↑ 6.0 6.1 6.2 6.3 6.4 6.5 6.6 «LLM Hallucination—Types, Causes, and Solutions». Nexla. [۴]
- ↑ 7.0 7.1 «Effective Tips to Prevent AI Hallucinations in Generative AI». QuickCreator. [۵]
- ↑ [2408.08333] CodeMirage: Hallucinations in Code Generated by Large Language Models. arXiv. [۶]
- ↑ 9.0 9.1 «LLM hallucinations and failures: lessons from 4 examples». Evidently AI Blog. [۷]
- ↑ «How to Perform Hallucination Detection for LLMs». Kolena. [۸]
- ↑ 11.0 11.1 11.2 «ChatGPT vs Google Gemini vs Anthropic Claude: Comprehensive Comparison & Report». DataStudios. [۹]
- ↑ «Mastering LLM Accuracy: How to Test, Detect, and Fix Hallucinations in AI Models». Stephen Weber on Medium. [۱۰]
- ↑ «LLM Benchmarks and Leaderboards: Avoiding Foundation Model Mistakes». Arize Blog. [۱۱]
- ↑ «Improving the Reliability of LLMs: Combining Chain-of-Thought Reasoning and Retrieval-Augmented Generation». arXiv. [۱۲]
- ↑ «Why Meta Took Down its 'Hallucinating' AI Model Galactica?». Analytics India Magazine. [۱۳]