Multimodal CoT Prompting (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

פרומפטינג מולטימודאלי עם שרשרת היסק (Multimodal Chain-of-Thought Prompting, MCoT) — הוא הרחבה של שיטת שרשרת ההיסק (CoT) למשימות הכוללות מספר סוגי נתונים (מודאליות). במודלי MCoT, שפה ומודאליות אחרות, כגון ראייה ממוחשבת או ניתוח נתוני טבלאות, משתתפות בתהליך אחיד של הסקה צעד-אחר-צעד לפתרון משימות מורכבות[1].

גישה זו צמחה עם התפתחות מודלי השפה הגדולים המולטימודאליים (MLLM), המסוגלים לעבד בו-זמנית טקסט, תמונות, שמע ווידאו. MCoT מאפשר למודלים לייצר הסברים שקופים צעד-אחר-צעד, המשלבים מידע ממקורות שונים, וכך מגביר את הדיוק ואת השקיפות של עבודתם.

רקע: ממודאליות טקסטואלית ל-MCoT

Chain-of-Thought בטקסט

בתחילה, שיטת Chain-of-Thought (CoT) הוצעה על ידי חוקרי Google בשנת 2022 עבור מודלי שפה גדולים (LLM) טקסטואליים[2]. הרעיון הוא לאמן את המודל לייצר רצף של צעדי היסק ביניים לפני מתן התשובה הסופית. הוספת דוגמאות לפתרון צעד-אחר-צעד ל-prompt (few-shot prompting) שיפרה באופן ניכר את יכולת ה-LLM לפתור משימות הדורשות חשיבה חשבונאית, לוגית ושכלית, והעלתה את הדיוק והאמינות הכוללים של המודלים[2].

המעבר למולטימודאליות

הצלחת CoT הטקסטואלי עודדה ניסיונות להרחיבו לתרחישים מולטימודאליים. עם הופעת MLLM כגון Kosmos-1 מבית Microsoft, אשר מאומנים בו-זמנית על טקסט ותמונות, נוצרה האפשרות לשלב לוגיקת CoT עם תפיסה מולטימודאלית[3]. ניסויים הראו שמודלים כאלה יכולים להשתמש בהיסק צעד-אחר-צעד תוך התחשבות בגם קלטים טקסטואליים וגם ויזואליים, מה שהוכיח את ההיתכנות העקרונית של שילוב לוגיקה ותפיסה[3].

גישות ומתודולוגיות מרכזיות

החל משנת 2023 הוצעו מספר שיטות למימוש CoT מולטימודאלי.

Multimodal-CoT דו-שלבי (Zhang et al.)

אחת השיטות הראשונות, שהוצעה בשנת 2023, משתמשת בסכמה דו-שלבית[4]:

  1. יצירת נימוק: בשלב הראשון המודל מייצר שרשרת היסק טקסטואלית (rationale) המבוססת על מידע מולטימודאלי (לדוגמה, טקסט ותמונה).
  2. גיבוש תשובה: בשלב השני המודל מספק את התשובה הסופית בהסתמך על הנימוק שנוצר.

גישה מופרדת זו אפשרה למודל עם פחות ממיליארד פרמטרים להגיע לאיכות גבוהה במיוחד על dataset המדעי ScienceQA, ואף לעלות על המודל הגדול GPT-3.5. כמו כן, נצפתה ירידה בהזיות[4].

Compositional CoT

הוצג בכנס CVPR 2024, שיטה זו מתמקדת במשימות ויזואליות-טקסטואליות ומציעה לייצר ייצוג מובנה של התמונה כצעד ביניים[5]. תחילה, ה-MLLM מפיק תיאור של הסצנה בצורת גרף סצנה, תוך ציון אובייקטים והיחסים ביניהם. לאחר מכן, תיאור מובנה זה נכלל ב-prompt לקבלת התשובה הסופית. גישה זו מאפשרת ל-LLM להתחשב לעומק בקשרים הקומפוזיציוניים בין האובייקטים ומשפרת תוצאות במשימות תיאור סצנות מורכבות וניתוח שאלות-ותשובות ויזואלי[5].

Duty-Distinct CoT

שיטה זו, שהוצגה ב-NeurIPS 2023, מציעה לחלק את האחריות בין רכיבים שונים של המערכת[6]:

  • מודל השפה אחראי על ההיסק הלוגי ועל שילוב המידע.
  • תת-מערכת הראייה (מודל ראייה ממוחשבת) אחראית על זיהוי תוכן התמונה.

"פרומפטינג בינארי" זה מבטיח "חשיבה ביקורתית": ה-LLM מעריך ומשתמש במידע הויזואלי שהתקבל ממודול הראייה המתמחה. גישת DDCoT אפשרה לייצר היסקים כלליים יותר וניתנים להסבר יותר, ושיפרה באופן משמעותי את הדיוק במשימות QA מדעי מולטימודאלי[6].

גרסאות נוספות של MCoT

פותחות באופן פעיל גישות נוספות המותאמות למודאליות ספציפיות:

  • Dual CoT: סכמה של היסק דו-כיווני מקבילי.
  • Audio-CoT: התאמת שרשרת המחשבות למשימות הקשורות לשמע ודיבור.
  • Video-of-Thought: טכניקה לניתוח צעד-אחר-צעד של נתוני וידאו[1].

יישומים ותוצאות

פרומפטינג CoT מולטימודאלי הוכיח יעילות בתחומים רבים בהם נדרש שילוב מידע הטרוגני.

  • חינוך ו-QA מדעי: מאפשר למערכות לענות על שאלות עם דיאגרמות ואיורים תוך מתן הסבר מפורט לפתרון (לדוגמה, על dataset ScienceQA)[4].
  • נהיגה אוטונומית ורובוטיקה: מסייע בפרשנות רציפה של נתוני LiDAR, חיישנים ומצלמות, ומשפר את הבנת הסצנה וקבלת ההחלטות של הסוכנים.
  • Embodied AI: מבטיח תכנון פעולות אמין יותר עבור מערכות המתקשרות עם העולם הפיזי, בהסתמך על רמזים ויזואליים וטקסטואליים.
  • רפואה ובריאות: שילוב תמונות רפואיות (לדוגמה, צילומי רנטגן) עם תיאורים טקסטואליים מגביר את דיוק האבחון ואת יכולת ההסבר של ממצאי ה-AI[1].

אתגרים ופרספקטיבות

למרות ההתקדמות המשמעותית, שימוש מולטימודאלי ב-CoT נותר בעיית מחקר מורכבת.

  • מחסור בנתונים מתויגים: אימון מודלים לייצר היסקים מולטימודאליים נכונים דורש מאגרי נתונים גדולים עם הסברים מפורטים, שהפקתם טורדנית.
  • גמישות והכללה: שיטות המכוונות לסוג משימות אחד (לדוגמה, טקסט + תמונה) עשויות להעביר בצורה גרועה לשילובים אחרים של מודאליות.
  • שילוב אופטימלי: נותרת פתוחה השאלה כיצד לשלב בצורה מיטבית מודאליות שונות בתהליך היסק אחיד, כך שיחזק אמיתית את הבנת המודל ולא רק יאריך את התשובה.
  • סטנדרטיזציה והערכה: קיים צורך בפיתוח benchmark מסטנדרטים להערכה אובייקטיבית והשוואה של גישות MCoT שונות[6].

להשגת AI מולטימודאלי הקרוב לאינטליגנציה כללית נדרשות חדשנות נוספת בשיטות MCoT, הלוקחות בחשבון את ייחוד התפיסה של העולם באמצעות חיישנים שונים[1].

קישורים

  • סקירת Multimodal CoT ב-Prompting Guide
  • «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey» — סקירה מדעית מפורטת

ספרות

  • Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
  • Mitra, C. et al. (2024). Compositional Chain-of-Thought Prompting for Large Multimodal Models. CVPR 2024. PDF.
  • Zheng, G. et al. (2023). DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models. arXiv:2310.16436.
  • Huang, S. et al. (2023). Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1). arXiv:2302.14045.
  • Wang, Y. et al. (2025). Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey. arXiv:2503.12605.
  • Ma, Z. et al. (2025). Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models. arXiv:2501.07246.
  • Li, J. et al. (2024). DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models. OpenReview:0saecDOdh2.
  • Ma, Z. et al. (2025). ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models. arXiv:2506.21448.
  • Zhang, M. et al. (2023). Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition. PDF.
  • Mitra, S. et al. (2024). ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts. arXiv:2505.18561.
  • Wu, Y. et al. (2024). MINT: Multi-modal Chain of Thought in Unified Generative Models. arXiv:2503.01298.

הערות

  1. 1.0 1.1 1.2 1.3 Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». arXiv:2503.12605, 2025. [1]
  2. 2.0 2.1 Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». arXiv:2201.11903, 2022. [2]
  3. 3.0 3.1 Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». arXiv:2302.14045, 2023. [3]
  4. 4.0 4.1 4.2 Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». arXiv:2302.00923, 2023. [4]
  5. 5.0 5.1 Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». CVPR, 2024. [5]
  6. 6.0 6.1 6.2 Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». OpenReview, 2023. [6]