Explainable AI — الذكاء الاصطناعي القابل للتفسير
الذكاء الاصطناعي القابل للتفسير (Explainable AI، XAI) هو مجال بحثي ومجموعة من الأساليب في مجال الذكاء الاصطناعي تهدف إلى جعل قرارات وسلوكيات نماذج التعلم الآلي مفهومة للبشر[1]. الهدف الرئيسي لـ XAI هو تحويل النماذج المعقدة وغير الشفافة، التي غالبًا ما يُطلق عليها اسم "الصناديق السوداء"، إلى "صناديق شفافة" أو "صناديق زجاجية" يمكنها شرح كيفية اتخاذها للقرارات.
ازدادت الحاجة إلى القابلية للتفسير بشكل حاد مع تطور النماذج المعقدة، وخاصة نماذج اللغة الكبيرة (LLM)، التي على الرغم من دقتها العالية، إلا أن آلياتها الداخلية غير واضحة للمطورين والمستخدمين. غياب الشفافية يحمل في طياته مخاطر، حيث يمكن للنموذج أن يرتكب أخطاء خفية، أو يظهر تحيزًا، أو يولد معلومات غير موثوقة، ولا يمكن فهم أسباب ذلك دون تفسيرات مناسبة[2].
أهمية وضرورة XAI
أقر كل من المجتمع العلمي والجهات التنظيمية بضرورة الذكاء الاصطناعي القابل للتفسير. يعد تطوير XAI أمرًا بالغ الأهمية لفهم سلوك أنظمة الذكاء الاصطناعي المعقدة وقيودها وتأثيراتها الاجتماعية.
- الثقة وتبني التقنيات. يميل المستخدمون، خاصة في المجالات الحساسة مثل الطب والتمويل، إلى الثقة في الأنظمة التي يمكنها تبرير استنتاجاتها. تزيد التفسيرات من الشفافية والثقة في أن النموذج يعمل بشكل صحيح وأخلاقي[3].
- الكشف عن التحيز وتخفيفه. تساعد القابلية للتفسير في اكتشاف ما إذا كان النموذج يعتمد على ارتباطات غير مرغوب فيها أو غير أخلاقية في البيانات (على سبيل المثال، تلك المتعلقة بالعرق أو الجنس أو العمر). وهذا يسمح للمطورين بتحديد التحيز الخوارزمي وتصحيحه[1].
- الموثوقية والمتانة. تساعد القابلية للتفسير في تحديد نقاط ضعف النموذج، بما في ذلك الهجمات التنافسية (adversarial attacks)، وزيادة صموده أمام الاضطرابات الصغيرة في بيانات الإدخال.
- الامتثال للمتطلبات التنظيمية. ترسخ التشريعات، مثل لائحة GDPR في الاتحاد الأوروبي، حق الفرد في الحصول على تفسير للقرارات التي تتخذها الأنظمة الآلية. كما يهدف برنامج XAI التابع لوكالة DARPA (وكالة مشاريع البحوث المتقدمة الدفاعية الأمريكية)، الذي أُطلق في عام 2017، إلى إنشاء أنظمة ذكاء اصطناعي قادرة على تقديم تفسيرات قابلة للفهم للمستخدمين[4].
مناهج تفسير النماذج
يمكن تقسيم أساليب XAI بشكل عام إلى فئتين رئيسيتين: النماذج القابلة للتفسير، وهي شفافة "بطبيعتها"، وأساليب ما بعد الحدث (post-hoc) التي تشرح نماذج "الصندوق الأسود" بعد تدريبها.
النماذج القابلة للتفسير ("الصناديق الشفافة")
هي خوارزميات تكون بنيتها الداخلية بسيطة ومفهومة للبشر بطبيعتها. تشمل هذه النماذج:
- الانحدار الخطي
- الانحدار اللوجستي
- أشجار القرار ذات العمق الصغير
- النماذج القائمة على القواعد (Rule-based systems)
من السهل تفسير هذه النماذج، لكنها غالبًا ما تكون أقل دقة من النماذج الأكثر تعقيدًا (مثل الشبكات العصبونية العميقة) عند التعامل مع البيانات المعقدة. توجد مقايضة بين الدقة والقابلية للتفسير[1].
أساليب التفسير ما بعد الحدث ("الصناديق السوداء")
تُطبق هذه الأساليب على النماذج المعقدة التي تم تدريبها بالفعل، دون تغيير بنيتها الداخلية. تقوم بإنشاء معلومات إضافية تساعد على فهم منطق التنبؤات. تنقسم تفسيرات ما بعد الحدث إلى تفسيرات محلية وعالمية.
التفسيرات المحلية
تشرح الأساليب المحلية تنبؤًا فرديًا للنموذج لمثال إدخال محدد.
- LIME (Local Interpretable Model-agnostic Explanations): واحدة من أشهر الأساليب. تقوم LIME ببناء نموذج بديل بسيط وقابل للتفسير (مثل الانحدار الخطي) في الجوار المحلي لتنبؤ معين، مما يقارب سلوك نموذج "الصندوق الأسود" المعقد[1].
- SHAP (SHapley Additive exPlanations): تعتمد على قيم شابلي من نظرية الألعاب التعاونية. تحسب SHAP مساهمة كل سمة في التنبؤ النهائي، وتوزع "المكسب" (الفرق بين التنبؤ والقيمة المتوسطة) بشكل عادل بين السمات. توفر هذه الطريقة تفسيرات متسقة ومبنية على أساس نظري متين[5].
- التفسيرات المضادة للواقع: تولد سيناريوهات من نوع "ماذا لو؟". توضح هذه التفسيرات ما هي أقل التغييرات في بيانات الإدخال التي كانت ستؤدي إلى نتيجة مختلفة (على سبيل المثال، "كان سيتم الموافقة على قرضك لو كان دخلك السنوي أعلى بمقدار 5000 دولار")[1].
التفسيرات العالمية
تهدف الأساليب العالمية إلى شرح المنطق العام للنموذج أو معرفته ككل. وتشمل تحليل أهمية السمات عبر مجموعة البيانات بأكملها، بالإضافة إلى تصور التمثيلات الداخلية للنموذج.
القابلية للتفسير لنماذج اللغة الكبيرة (LLM)
تمثل نماذج اللغة الكبيرة تحديًا خاصًا وفرصًا جديدة لـ XAI في نفس الوقت. حجمها الهائل وتعقيدها يجعلان تطبيق الأساليب التقليدية صعبًا، لكن قدرتها على التعامل مع اللغة الطبيعية تفتح آفاقًا جديدة للتفسيرات.
تحليل آليات الانتباه (Attention Visualization)
تسمح آلية self-attention في بنية Transformer بتصور الأجزاء من النص المدخل (التوكنات) التي "ينتبه" إليها النموذج عند توليد الإجابة. على الرغم من أن هذا يوفر فهمًا حدسيًا لعمل النموذج، إلا أن هناك نقاشًا في المجتمع العلمي حول ما إذا كان الانتباه يعتبر تفسيرًا كاملاً، حيث إن الأهمية العالية لأوزان الانتباه لا تعني دائمًا وجود علاقة سببية[6].
القابلية للتفسير الميكانيكي
هو أعمق مستوى من القابلية للتفسير، ويهدف إلى إجراء هندسة عكسية كاملة لعمل الشبكة العصبونية. يحاول الباحثون تحديد وفهم "دوائر" (circuits) محددة — وهي مجموعات من العصبونات واتصالاتها التي تنفذ وظائف خوارزمية معينة (مثل التعرف على بنية نحوية أو البحث عن حقيقة ما)[7].
التفسير عبر اللغة الطبيعية
القدرة الفريدة لنماذج اللغة الكبيرة هي أن تشرح نفسها. باستخدام تقنيات التوجيه (prompting)، مثل سلسلة الأفكار (Chain-of-Thought)، يمكن إجبار النموذج على توليد استدلالات خطوة بخطوة أدت إلى استنتاجه. هذا يجعل عملية اتخاذ القرار شفافة للمستخدم. ومع ذلك، يمكن أن تكون هذه التفسيرات غير صادقة (unfaithful) — فقد يولد النموذج تبريرًا مقنعًا ولكنه خاطئ، ولا يعكس عمليته الداخلية الحقيقية[8].
روابط خارجية
- الصفحة الرسمية لبرنامج DARPA XAI
- نظرة عامة على الذكاء الاصطناعي القابل للتفسير (Explainable AI) من IBM
المراجع
- ↑ 1.0 1.1 1.2 1.3 1.4 Arrieta, A. B. et al. «Explainable Artificial Intelligence (XAI): Concepts, Taxonomies, Opportunities and Challenges toward Responsible AI». Information Fusion, 2020. [١]
- ↑ Zhao, H. et al. «Explainability for Large Language Models: A Survey». arXiv:2309.01512, 2023. [٢]
- ↑ «What is Explainable AI (XAI)?». IBM. [٣]
- ↑ «Explainable Artificial Intelligence». DARPA. [٤]
- ↑ Linardatos, P. et al. «Explainable AI: A Review of Machine Learning Interpretability Methods». Entropy, 2021. [٥]
- ↑ Jain, S. & Wallace, B. C. «Attention is not Explanation». arXiv:1902.10186, 2019. [٦]
- ↑ Lan, Q. et al. «Towards Interpretable Sequence Continuation: Analyzing Shared Circuits in Large Language Models». arXiv:2311.04131, 2023. [٧]
- ↑ Singh, C. et al. «Rethinking Interpretability in the Era of Large Language Models». arXiv:2402.01761, 2024. [٨]