Multimodal CoT Prompting (TH)

From Systems analysis Wiki
Jump to navigation Jump to search

การให้คำสั่งแบบลูกโซ่การอนุมานหลายรูปแบบ (Multimodal Chain-of-Thought Prompting, MCoT) — คือการขยายวิธีการ Chain-of-Thought (CoT) ไปสู่งานที่เกี่ยวข้องกับข้อมูลหลายประเภท (หลาย modality) ในโมเดล MCoT นั้น ภาษาและ modality อื่น ๆ เช่น การมองเห็นหรือการวิเคราะห์ข้อมูลตาราง จะมีส่วนร่วมในกระบวนการอนุมานทีละขั้นตอนแบบรวมศูนย์เพื่อแก้ปัญหาที่ซับซ้อน[1]

แนวทางนี้เกิดขึ้นพร้อมกับการพัฒนาของ Multimodal Large Language Model (MLLM) ที่สามารถประมวลผลข้อความ รูปภาพ เสียง และวิดีโอพร้อมกันได้ MCoT ช่วยให้โมเดลสร้างคำอธิบายที่ตีความได้และเป็นขั้นตอน โดยรวมข้อมูลจากแหล่งต่าง ๆ เข้าด้วยกัน ซึ่งเพิ่มทั้งความแม่นยำและความโปร่งใสในการทำงาน

พื้นฐาน: จาก CoT เชิงข้อความสู่ MCoT

Chain-of-Thought ในข้อความ

เดิมทีวิธีการ Chain-of-Thought (CoT) ได้รับการเสนอโดยนักวิจัยของ Google ในปี 2022 สำหรับ Large Language Model (LLM) เชิงข้อความ[2] แนวคิดคือการฝึกโมเดลให้สร้างลำดับขั้นตอนการอนุมานระดับกลางก่อนที่จะให้คำตอบสุดท้าย การเพิ่มตัวอย่างการแก้ปัญหาทีละขั้นตอนลงใน prompt (few-shot prompting) ช่วยปรับปรุงความสามารถของ LLM ในการแก้ปัญหาที่ต้องใช้การอนุมานเชิงคณิตศาสตร์ ตรรกะ และสามัญสำนึกได้อย่างมีนัยสำคัญ และเพิ่มความแม่นยำและความน่าเชื่อถือโดยรวมของโมเดล[2]

การเปลี่ยนผ่านสู่หลาย Modality

ความสำเร็จของ CoT เชิงข้อความกระตุ้นให้มีความพยายามขยายไปสู่สถานการณ์แบบ multimodal ด้วยการปรากฏตัวของ MLLM เช่น Kosmos-1 จาก Microsoft ซึ่งได้รับการฝึกกับทั้งข้อความและรูปภาพพร้อมกัน จึงเกิดความเป็นไปได้ในการผสานตรรกะ CoT เข้ากับการรับรู้แบบ multimodal[3] การทดลองแสดงให้เห็นว่าโมเดลเหล่านี้สามารถใช้การอนุมานทีละขั้นตอนโดยคำนึงถึงทั้งข้อมูลเชิงข้อความและเชิงภาพ ซึ่งแสดงให้เห็นถึงความเป็นไปได้ในการรวมตรรกะและการรับรู้เข้าด้วยกัน[3]

แนวทางหลักและวิธีการ

นับตั้งแต่ปี 2023 เป็นต้นมา มีการเสนอวิธีการต่าง ๆ มากมายสำหรับการนำ multimodal CoT ไปใช้งาน

Multimodal-CoT แบบสองขั้นตอน (Zhang et al.)

หนึ่งในวิธีการแรกที่เสนอในปี 2023 ใช้แผนผังแบบสองขั้นตอน[4]:

  1. การสร้างเหตุผล: ในขั้นตอนแรก โมเดลจะสร้างลูกโซ่การอนุมานเชิงข้อความ (rationale) จากข้อมูล multimodal (เช่น ข้อความและรูปภาพ)
  2. การสร้างคำตอบ: ในขั้นตอนที่สอง โมเดลจะให้คำตอบสุดท้ายโดยอ้างอิงจากเหตุผลที่สร้างขึ้น

แนวทางแบบแยกส่วนนี้ช่วยให้โมเดลที่มีพารามิเตอร์น้อยกว่า 1 พันล้านตัวบรรลุคุณภาพสูงสุดเป็นประวัติการณ์บน dataset ทางวิทยาศาสตร์ชื่อ ScienceQA แม้กระทั่งเหนือกว่าโมเดลขนาดใหญ่อย่าง GPT-3.5 นอกจากนี้ยังพบการลดลงของ hallucination[4]

Compositional CoT

วิธีการนี้ถูกนำเสนอในการประชุม CVPR 2024 โดยมุ่งเน้นที่งานเชิงภาพ-ข้อความ และเสนอให้สร้างการแสดงโครงสร้างของรูปภาพเป็นขั้นตอนกลาง[5] ขั้นแรก MLLM จะสร้างคำอธิบายฉากในรูปแบบ scene graph โดยระบุวัตถุและความสัมพันธ์ระหว่างกัน จากนั้นคำอธิบายที่มีโครงสร้างนี้จะถูกรวมไว้ใน prompt สำหรับคำตอบสุดท้าย แนวทางนี้ช่วยให้ LLM คำนึงถึงความสัมพันธ์เชิงองค์ประกอบระหว่างวัตถุได้ลึกซึ้งยิ่งขึ้น และปรับปรุงผลลัพธ์ในงานการอธิบายฉากที่ซับซ้อนและการวิเคราะห์คำถาม-คำตอบเชิงภาพ[5]

Duty-Distinct CoT

วิธีการนี้ถูกนำเสนอใน NeurIPS 2023 โดยเสนอให้แยกความรับผิดชอบระหว่างส่วนประกอบต่าง ๆ ของระบบ[6]:

  • โมเดลภาษา รับผิดชอบการอนุมานเชิงตรรกะและการรวมข้อมูล
  • ระบบย่อยด้านภาพ (โมเดล computer vision) รับผิดชอบการจดจำเนื้อหาของรูปภาพ

"การให้คำสั่งแบบสองส่วน" นี้ทำให้เกิด "การคิดเชิงวิพากษ์": LLM ประเมินและใช้ข้อมูลเชิงภาพที่ได้รับจากโมดูลการมองเห็นเฉพาะทาง แนวทาง DDCoT ช่วยให้สร้างการอนุมานที่ทั่วไปและอธิบายได้มากขึ้น และเพิ่มความแม่นยำอย่างมีนัยสำคัญในงาน multimodal scientific QA[6]

รูปแบบอื่น ๆ ของ MCoT

มีการพัฒนาแนวทางอื่น ๆ ที่ปรับให้เหมาะกับ modality เฉพาะอย่างแข็งขัน:

  • Dual CoT: แผนผังการอนุมานแบบสองทิศทางขนาน
  • Audio-CoT: การปรับใช้ลูกโซ่การอนุมานสำหรับงานที่เกี่ยวข้องกับเสียงและการพูด
  • Video-of-Thought: เทคนิคการวิเคราะห์ข้อมูลวิดีโอทีละขั้นตอน[1]

การประยุกต์ใช้และผลลัพธ์

การให้คำสั่งแบบ Multimodal CoT แสดงให้เห็นถึงประสิทธิภาพในหลายด้านที่ต้องการการรวมข้อมูลที่หลากหลาย

  • การศึกษาและ scientific QA: ช่วยให้ระบบตอบคำถามที่มีแผนภาพและภาพประกอบได้ โดยให้คำอธิบายวิธีแก้ปัญหาที่ละเอียด (เช่น บน dataset ScienceQA)[4]
  • การขับขี่อัตโนมัติและหุ่นยนต์: ช่วยตีความข้อมูลจาก LiDAR เซ็นเซอร์ และกล้องตามลำดับ ปรับปรุงการทำความเข้าใจฉากและการตัดสินใจของ agent
  • Embodied AI: ให้การวางแผนการกระทำที่น่าเชื่อถือมากขึ้นสำหรับระบบที่โต้ตอบกับโลกทางกายภาพ โดยอาศัยการ์ดเชิงภาพและข้อความ
  • การแพทย์และสาธารณสุข: การผสมผสานภาพทางการแพทย์ (เช่น ภาพเอกซเรย์) กับคำอธิบายเชิงข้อความช่วยเพิ่มความแม่นยำในการวินิจฉัยและความสามารถในการอธิบายผลสรุปของ AI[1]

ปัญหาและแนวโน้ม

แม้จะมีความก้าวหน้าอย่างมีนัยสำคัญ การใช้ CoT แบบ multimodal ยังคงเป็นปัญหาการวิจัยที่ซับซ้อน

  • การขาดแคลนข้อมูลที่มีป้ายกำกับ: การฝึกโมเดลให้สร้างการอนุมานแบบ multimodal ที่ถูกต้องต้องการชุดข้อมูลขนาดใหญ่พร้อมคำอธิบายโดยละเอียด ซึ่งยากต่อการรวบรวม
  • ความยืดหยุ่นและความสามารถในการทั่วไป: วิธีการที่ปรับแต่งสำหรับงานประเภทหนึ่ง (เช่น ข้อความ + รูปภาพ) อาจโอนย้ายไปยังการผสม modality อื่น ๆ ได้ไม่ดี
  • การรวมที่เหมาะสมที่สุด: ยังคงเป็นคำถามเปิดว่าจะรวม modality ต่าง ๆ เข้าในกระบวนการอนุมานแบบเดียวกันได้อย่างไร เพื่อให้ช่วยเสริมความเข้าใจของโมเดลได้อย่างแท้จริง ไม่ใช่แค่ยืดคำตอบให้ยาวขึ้น
  • การกำหนดมาตรฐานและการประเมินผล: มีความจำเป็นในการพัฒนา benchmark ที่ได้มาตรฐานสำหรับการประเมินและเปรียบเทียบแนวทาง MCoT ต่าง ๆ อย่างเป็นกลาง[6]

สำหรับการบรรลุ AI แบบ multimodal ที่ใกล้เคียงกับความสามารถทางปัญญาทั่วไป จำเป็นต้องมีนวัตกรรมเพิ่มเติมในวิธีการ MCoT ที่คำนึงถึงลักษณะเฉพาะของการรับรู้โลกผ่านเซ็นเซอร์ต่าง ๆ[1]

อ้างอิง

  • ภาพรวม Multimodal CoT ใน Prompting Guide
  • «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey» — ภาพรวมทางวิทยาศาสตร์โดยละเอียด

บรรณานุกรม

  • Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
  • Mitra, C. et al. (2024). Compositional Chain-of-Thought Prompting for Large Multimodal Models. CVPR 2024. PDF.
  • Zheng, G. et al. (2023). DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models. arXiv:2310.16436.
  • Huang, S. et al. (2023). Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1). arXiv:2302.14045.
  • Wang, Y. et al. (2025). Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey. arXiv:2503.12605.
  • Ma, Z. et al. (2025). Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models. arXiv:2501.07246.
  • Li, J. et al. (2024). DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models. OpenReview:0saecDOdh2.
  • Ma, Z. et al. (2025). ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models. arXiv:2506.21448.
  • Zhang, M. et al. (2023). Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition. PDF.
  • Mitra, S. et al. (2024). ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts. arXiv:2505.18561.
  • Wu, Y. et al. (2024). MINT: Multi-modal Chain of Thought in Unified Generative Models. arXiv:2503.01298.

หมายเหตุ

  1. 1.0 1.1 1.2 1.3 Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». arXiv:2503.12605, 2025. [1]
  2. 2.0 2.1 Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». arXiv:2201.11903, 2022. [2]
  3. 3.0 3.1 Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». arXiv:2302.14045, 2023. [3]
  4. 4.0 4.1 4.2 Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». arXiv:2302.00923, 2023. [4]
  5. 5.0 5.1 Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». CVPR, 2024. [5]
  6. 6.0 6.1 6.2 Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». OpenReview, 2023. [6]