Explainable AI — هوش مصنوعی قابل توضیح

From Systems analysis Wiki
Jump to navigation Jump to search

هوش مصنوعی قابل توضیح (Explainable AI، XAI) — حوزه‌ای از پژوهش و مجموعه‌ای از روش‌ها در زمینه هوش مصنوعی است که تصمیمات و رفتار مدل‌های Machine Learning را برای انسان قابل درک می‌سازد[1]. هدف اصلی XAI — تبدیل مدل‌های پیچیده و غیرشفاف، که اغلب «جعبه سیاه» نامیده می‌شوند، به «جعبه‌های شفاف» یا «جعبه‌های شیشه‌ای» است که می‌توانند توضیح دهند چگونه تصمیم‌گیری می‌کنند.

نیاز به قابلیت توضیح‌پذیری با توسعه مدل‌های پیچیده، به‌ویژه مدل‌های زبانی بزرگ (LLM)، به‌شدت افزایش یافته است؛ این مدل‌ها علی‌رغم دقت بالا، دارای مکانیسم‌های درونی هستند که برای توسعه‌دهندگان و کاربران آشکار نیست. فقدان شفافیت خطراتی را در پی دارد، چرا که مدل ممکن است خطاهای پنهانی داشته باشد، تعصب نشان دهد یا اطلاعات نادرست تولید کند و دلایل این امر بدون توضیحات مناسب قابل فهم نخواهد بود[2].

اهمیت و ضرورت XAI

ضرورت هوش مصنوعی قابل توضیح هم از سوی جامعه علمی و هم از سوی نهادهای نظارتی به رسمیت شناخته شده است. توسعه XAI برای درک رفتار، محدودیت‌ها و پیامدهای اجتماعی سیستم‌های پیچیده AI از اهمیت حیاتی برخوردار است.

  • اعتماد و پذیرش فناوری. کاربران، به‌ویژه در حوزه‌های حساسی مانند پزشکی و مالی، تمایل دارند به سیستم‌هایی اعتماد کنند که قادر به توجیه نتایج خود باشند. توضیحات شفافیت را افزایش داده و اطمینان از صحت و اخلاقی بودن عملکرد مدل را تقویت می‌کنند[3].
  • شناسایی و کاهش تعصب. قابلیت توضیح‌پذیری کمک می‌کند تا مشخص شود آیا مدل بر همبستگی‌های ناخواسته یا غیراخلاقی در داده‌ها (مثلاً مرتبط با نژاد، جنسیت یا سن) متکی است یا خیر. این امر به توسعه‌دهندگان امکان می‌دهد تعصب الگوریتمی را شناسایی و اصلاح کنند[1].
  • قابلیت اطمینان و استحکام. تفسیرپذیری به شناسایی آسیب‌پذیری‌های مدل، از جمله در برابر adversarial attacks، و افزایش مقاومت آن در برابر اختلالات کوچک در داده‌های ورودی کمک می‌کند.
  • انطباق با الزامات قانونی. قوانینی نظیر GDPR در اتحادیه اروپا، حق دریافت توضیح برای تصمیمات اتخاذشده توسط سیستم‌های خودکار را برای افراد تضمین می‌کند. برنامه XAI از سوی DARPA (آژانس پروژه‌های تحقیقاتی پیشرفته وزارت دفاع ایالات متحده)، که در سال ۲۰۱۷ راه‌اندازی شد، نیز با هدف ایجاد سیستم‌های AI‌ای که بتوانند توضیحات قابل تفسیر به کاربران ارائه دهند، طراحی شده بود[4].

رویکردهای توضیح‌پذیری مدل‌ها

روش‌های XAI را می‌توان به‌طور کلی به دو دسته بزرگ تقسیم کرد: مدل‌های تفسیرپذیر که ذاتاً شفاف هستند، و روش‌های پس‌از‌آموزش که مدل‌های «جعبه سیاه» را پس از آموزش توضیح می‌دهند.

مدل‌های تفسیرپذیر («جعبه‌های شفاف»)

اینها الگوریتم‌هایی هستند که ساختار درونی‌شان ذاتاً ساده و برای انسان قابل درک است. از جمله آن‌ها:

  • رگرسیون خطی
  • رگرسیون لجستیک
  • درخت‌های تصمیم با عمق کم
  • مدل‌های مبتنی بر قانون (Rule-based systems)

چنین مدل‌هایی به‌راحتی قابل تفسیر هستند، اما اغلب از نظر دقت در برابر مدل‌های پیچیده‌تر (مثلاً شبکه‌های عصبی عمیق) در داده‌های پیچیده عقب می‌مانند. میان دقت و تفسیرپذیری یک مصالحه وجود دارد[1].

روش‌های پس‌از‌آموزش («جعبه‌های سیاه»)

این روش‌ها بر مدل‌های پیچیده از پیش آموزش‌دیده اعمال می‌شوند، بدون اینکه ساختار درونی آن‌ها را تغییر دهند. آن‌ها اطلاعات اضافی‌ای ایجاد می‌کنند که به درک منطق پیش‌بینی‌ها کمک می‌کند. توضیحات پس‌از‌آموزش به دو نوع محلی و سراسری تقسیم می‌شوند.

توضیحات محلی

روش‌های محلی یک پیش‌بینی خاص مدل را برای یک نمونه ورودی مشخص توضیح می‌دهند.

  • LIME (Local Interpretable Model-agnostic Explanations): یکی از محبوب‌ترین روش‌ها. LIME یک مدل جایگزین ساده و تفسیرپذیر (مثلاً رگرسیون خطی) را در محیط محلی یک پیش‌بینی خاص می‌سازد و رفتار مدل پیچیده «جعبه سیاه» را تقریب می‌زند[1].
  • SHAP (SHapley Additive exPlanations): بر اساس مقادیر Shapley از نظریه بازی‌های مشارکتی. SHAP سهم هر ویژگی را در پیش‌بینی نهایی محاسبه می‌کند و «سود» (تفاوت بین پیش‌بینی و مقدار میانگین) را به‌صورت منصفانه میان ویژگی‌ها توزیع می‌کند. این روش توضیحاتی از نظر تئوری مستدل و سازگار ارائه می‌دهد[5].
  • توضیحات خلاف واقع: سناریوهای «اگر چه می‌شد؟» تولید می‌کنند. آن‌ها نشان می‌دهند که کدام تغییرات حداقلی در داده‌های ورودی منجر به نتیجه‌ای متفاوت می‌شد (مثلاً «وام شما در صورتی تأیید می‌شد که درآمد سالانه شما ۵۰۰۰ دلار بیشتر بود»)[1].

توضیحات سراسری

روش‌های سراسری با هدف توضیح منطق کلی مدل یا دانش آن به‌طور کامل طراحی شده‌اند. از جمله این روش‌ها می‌توان به تحلیل اهمیت ویژگی‌ها در کل مجموعه داده و همچنین تجسم بازنمایی‌های درونی مدل اشاره کرد.

توضیح‌پذیری برای مدل‌های زبانی بزرگ (LLM)

مدل‌های زبانی بزرگ چالش ویژه‌ای را برای XAI ایجاد می‌کنند و در عین حال فرصت‌های جدیدی نیز ارائه می‌دهند. اندازه عظیم و پیچیدگی آن‌ها کاربرد روش‌های سنتی را دشوار می‌سازد، اما توانایی‌شان در کار با زبان طبیعی راه‌های جدیدی برای توضیح می‌گشاید.

Attention Visualization - تحلیل مکانیسم توجه

مکانیسم self-attention در معماری Transformer امکان تجسم این را فراهم می‌کند که مدل هنگام تولید پاسخ به کدام بخش‌های متن ورودی (token‌ها) «توجه می‌کند». هرچند این دیدگاه شهودی از عملکرد مدل به دست می‌دهد، در جامعه علمی بحث‌هایی درباره اینکه آیا توجه توضیح کاملی است یا نه جریان دارد، چرا که اهمیت بالا بر اساس وزن‌های attention همیشه به معنای رابطه علّی نیست[6].

تفسیرپذیری مکانیستیک

عمیق‌ترین سطح توضیح‌پذیری که هدفش مهندسی معکوس کامل عملکرد شبکه عصبی است. پژوهشگران تلاش می‌کنند «زنجیره‌های» (circuits) خاصی را شناسایی و درک کنند — گروه‌هایی از نورون‌ها و ارتباطات آن‌ها که وظایف الگوریتمی مشخصی را اجرا می‌کنند (مثلاً تشخیص ساختار نحوی یا جستجوی یک واقعیت)[7].

توضیح از طریق زبان طبیعی

توانایی منحصربه‌فرد LLM‌ها — توضیح دادن خودشان است. با استفاده از تکنیک‌های prompting مانند Chain-of-Thought، می‌توان مدل را وادار کرد استدلال‌های گام‌به‌گامی تولید کند که به نتیجه‌گیری آن منجر شده‌اند. این فرایند تصمیم‌گیری را برای کاربر شفاف می‌کند. با این حال، چنین توضیحاتی ممکن است ناصادقانه (unfaithful) باشند — مدل ممکن است توجیهی قانع‌کننده اما نادرست تولید کند که فرایند درونی واقعی آن را بازتاب نمی‌دهد[8].

پیوندها

  • صفحه رسمی برنامه DARPA XAI
  • مروری بر Explainable AI از IBM

یادداشت‌ها

  1. 1.0 1.1 1.2 1.3 1.4 Arrieta, A. B. et al. «Explainable Artificial Intelligence (XAI): Concepts, Taxonomies, Opportunities and Challenges toward Responsible AI». Information Fusion, 2020. [۱]
  2. Zhao, H. et al. «Explainability for Large Language Models: A Survey». arXiv:2309.01512, 2023. [۲]
  3. «What is Explainable AI (XAI)?». IBM. [۳]
  4. «Explainable Artificial Intelligence». DARPA. [۴]
  5. Linardatos, P. et al. «Explainable AI: A Review of Machine Learning Interpretability Methods». Entropy, 2021. [۵]
  6. Jain, S. & Wallace, B. C. «Attention is not Explanation». arXiv:1902.10186, 2019. [۶]
  7. Lan, Q. et al. «Towards Interpretable Sequence Continuation: Analyzing Shared Circuits in Large Language Models». arXiv:2311.04131, 2023. [۷]
  8. Singh, C. et al. «Rethinking Interpretability in the Era of Large Language Models». arXiv:2402.01761, 2024. [۸]