Explainable AI — هوش مصنوعی قابل توضیح
هوش مصنوعی قابل توضیح (Explainable AI، XAI) — حوزهای از پژوهش و مجموعهای از روشها در زمینه هوش مصنوعی است که تصمیمات و رفتار مدلهای Machine Learning را برای انسان قابل درک میسازد[1]. هدف اصلی XAI — تبدیل مدلهای پیچیده و غیرشفاف، که اغلب «جعبه سیاه» نامیده میشوند، به «جعبههای شفاف» یا «جعبههای شیشهای» است که میتوانند توضیح دهند چگونه تصمیمگیری میکنند.
نیاز به قابلیت توضیحپذیری با توسعه مدلهای پیچیده، بهویژه مدلهای زبانی بزرگ (LLM)، بهشدت افزایش یافته است؛ این مدلها علیرغم دقت بالا، دارای مکانیسمهای درونی هستند که برای توسعهدهندگان و کاربران آشکار نیست. فقدان شفافیت خطراتی را در پی دارد، چرا که مدل ممکن است خطاهای پنهانی داشته باشد، تعصب نشان دهد یا اطلاعات نادرست تولید کند و دلایل این امر بدون توضیحات مناسب قابل فهم نخواهد بود[2].
اهمیت و ضرورت XAI
ضرورت هوش مصنوعی قابل توضیح هم از سوی جامعه علمی و هم از سوی نهادهای نظارتی به رسمیت شناخته شده است. توسعه XAI برای درک رفتار، محدودیتها و پیامدهای اجتماعی سیستمهای پیچیده AI از اهمیت حیاتی برخوردار است.
- اعتماد و پذیرش فناوری. کاربران، بهویژه در حوزههای حساسی مانند پزشکی و مالی، تمایل دارند به سیستمهایی اعتماد کنند که قادر به توجیه نتایج خود باشند. توضیحات شفافیت را افزایش داده و اطمینان از صحت و اخلاقی بودن عملکرد مدل را تقویت میکنند[3].
- شناسایی و کاهش تعصب. قابلیت توضیحپذیری کمک میکند تا مشخص شود آیا مدل بر همبستگیهای ناخواسته یا غیراخلاقی در دادهها (مثلاً مرتبط با نژاد، جنسیت یا سن) متکی است یا خیر. این امر به توسعهدهندگان امکان میدهد تعصب الگوریتمی را شناسایی و اصلاح کنند[1].
- قابلیت اطمینان و استحکام. تفسیرپذیری به شناسایی آسیبپذیریهای مدل، از جمله در برابر adversarial attacks، و افزایش مقاومت آن در برابر اختلالات کوچک در دادههای ورودی کمک میکند.
- انطباق با الزامات قانونی. قوانینی نظیر GDPR در اتحادیه اروپا، حق دریافت توضیح برای تصمیمات اتخاذشده توسط سیستمهای خودکار را برای افراد تضمین میکند. برنامه XAI از سوی DARPA (آژانس پروژههای تحقیقاتی پیشرفته وزارت دفاع ایالات متحده)، که در سال ۲۰۱۷ راهاندازی شد، نیز با هدف ایجاد سیستمهای AIای که بتوانند توضیحات قابل تفسیر به کاربران ارائه دهند، طراحی شده بود[4].
رویکردهای توضیحپذیری مدلها
روشهای XAI را میتوان بهطور کلی به دو دسته بزرگ تقسیم کرد: مدلهای تفسیرپذیر که ذاتاً شفاف هستند، و روشهای پسازآموزش که مدلهای «جعبه سیاه» را پس از آموزش توضیح میدهند.
مدلهای تفسیرپذیر («جعبههای شفاف»)
اینها الگوریتمهایی هستند که ساختار درونیشان ذاتاً ساده و برای انسان قابل درک است. از جمله آنها:
- رگرسیون خطی
- رگرسیون لجستیک
- درختهای تصمیم با عمق کم
- مدلهای مبتنی بر قانون (Rule-based systems)
چنین مدلهایی بهراحتی قابل تفسیر هستند، اما اغلب از نظر دقت در برابر مدلهای پیچیدهتر (مثلاً شبکههای عصبی عمیق) در دادههای پیچیده عقب میمانند. میان دقت و تفسیرپذیری یک مصالحه وجود دارد[1].
روشهای پسازآموزش («جعبههای سیاه»)
این روشها بر مدلهای پیچیده از پیش آموزشدیده اعمال میشوند، بدون اینکه ساختار درونی آنها را تغییر دهند. آنها اطلاعات اضافیای ایجاد میکنند که به درک منطق پیشبینیها کمک میکند. توضیحات پسازآموزش به دو نوع محلی و سراسری تقسیم میشوند.
توضیحات محلی
روشهای محلی یک پیشبینی خاص مدل را برای یک نمونه ورودی مشخص توضیح میدهند.
- LIME (Local Interpretable Model-agnostic Explanations): یکی از محبوبترین روشها. LIME یک مدل جایگزین ساده و تفسیرپذیر (مثلاً رگرسیون خطی) را در محیط محلی یک پیشبینی خاص میسازد و رفتار مدل پیچیده «جعبه سیاه» را تقریب میزند[1].
- SHAP (SHapley Additive exPlanations): بر اساس مقادیر Shapley از نظریه بازیهای مشارکتی. SHAP سهم هر ویژگی را در پیشبینی نهایی محاسبه میکند و «سود» (تفاوت بین پیشبینی و مقدار میانگین) را بهصورت منصفانه میان ویژگیها توزیع میکند. این روش توضیحاتی از نظر تئوری مستدل و سازگار ارائه میدهد[5].
- توضیحات خلاف واقع: سناریوهای «اگر چه میشد؟» تولید میکنند. آنها نشان میدهند که کدام تغییرات حداقلی در دادههای ورودی منجر به نتیجهای متفاوت میشد (مثلاً «وام شما در صورتی تأیید میشد که درآمد سالانه شما ۵۰۰۰ دلار بیشتر بود»)[1].
توضیحات سراسری
روشهای سراسری با هدف توضیح منطق کلی مدل یا دانش آن بهطور کامل طراحی شدهاند. از جمله این روشها میتوان به تحلیل اهمیت ویژگیها در کل مجموعه داده و همچنین تجسم بازنماییهای درونی مدل اشاره کرد.
توضیحپذیری برای مدلهای زبانی بزرگ (LLM)
مدلهای زبانی بزرگ چالش ویژهای را برای XAI ایجاد میکنند و در عین حال فرصتهای جدیدی نیز ارائه میدهند. اندازه عظیم و پیچیدگی آنها کاربرد روشهای سنتی را دشوار میسازد، اما تواناییشان در کار با زبان طبیعی راههای جدیدی برای توضیح میگشاید.
Attention Visualization - تحلیل مکانیسم توجه
مکانیسم self-attention در معماری Transformer امکان تجسم این را فراهم میکند که مدل هنگام تولید پاسخ به کدام بخشهای متن ورودی (tokenها) «توجه میکند». هرچند این دیدگاه شهودی از عملکرد مدل به دست میدهد، در جامعه علمی بحثهایی درباره اینکه آیا توجه توضیح کاملی است یا نه جریان دارد، چرا که اهمیت بالا بر اساس وزنهای attention همیشه به معنای رابطه علّی نیست[6].
تفسیرپذیری مکانیستیک
عمیقترین سطح توضیحپذیری که هدفش مهندسی معکوس کامل عملکرد شبکه عصبی است. پژوهشگران تلاش میکنند «زنجیرههای» (circuits) خاصی را شناسایی و درک کنند — گروههایی از نورونها و ارتباطات آنها که وظایف الگوریتمی مشخصی را اجرا میکنند (مثلاً تشخیص ساختار نحوی یا جستجوی یک واقعیت)[7].
توضیح از طریق زبان طبیعی
توانایی منحصربهفرد LLMها — توضیح دادن خودشان است. با استفاده از تکنیکهای prompting مانند Chain-of-Thought، میتوان مدل را وادار کرد استدلالهای گامبهگامی تولید کند که به نتیجهگیری آن منجر شدهاند. این فرایند تصمیمگیری را برای کاربر شفاف میکند. با این حال، چنین توضیحاتی ممکن است ناصادقانه (unfaithful) باشند — مدل ممکن است توجیهی قانعکننده اما نادرست تولید کند که فرایند درونی واقعی آن را بازتاب نمیدهد[8].
پیوندها
- صفحه رسمی برنامه DARPA XAI
- مروری بر Explainable AI از IBM
یادداشتها
- ↑ 1.0 1.1 1.2 1.3 1.4 Arrieta, A. B. et al. «Explainable Artificial Intelligence (XAI): Concepts, Taxonomies, Opportunities and Challenges toward Responsible AI». Information Fusion, 2020. [۱]
- ↑ Zhao, H. et al. «Explainability for Large Language Models: A Survey». arXiv:2309.01512, 2023. [۲]
- ↑ «What is Explainable AI (XAI)?». IBM. [۳]
- ↑ «Explainable Artificial Intelligence». DARPA. [۴]
- ↑ Linardatos, P. et al. «Explainable AI: A Review of Machine Learning Interpretability Methods». Entropy, 2021. [۵]
- ↑ Jain, S. & Wallace, B. C. «Attention is not Explanation». arXiv:1902.10186, 2019. [۶]
- ↑ Lan, Q. et al. «Towards Interpretable Sequence Continuation: Analyzing Shared Circuits in Large Language Models». arXiv:2311.04131, 2023. [۷]
- ↑ Singh, C. et al. «Rethinking Interpretability in the Era of Large Language Models». arXiv:2402.01761, 2024. [۸]