---
title: "Multimodal CoT Prompting (VI)"
source: "https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)"
wiki: "systems-analysis.info/int"
article: "Multimodal_CoT_Prompting_(VI)"
language: "vi"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Prompt engineering"
  - "Category:Vietnamese"
revision_id: 4744
wiki_created_at: 2026-09-06T23:39:19Z
wiki_modified_at: 2026-09-06T23:39:19Z
downloaded_at: 2026-09-07T23:04:21Z
---

# Multimodal CoT Prompting (VI)

**Prompting chuỗi suy luận đa phương thức** (**Multimodal Chain-of-Thought Prompting**, **MCoT**) — là sự mở rộng của phương pháp chuỗi suy luận (CoT) sang các bài toán liên quan đến nhiều loại dữ liệu (phương thức). Trong các mô hình MCoT, ngôn ngữ và các phương thức khác như thị giác hoặc phân tích dữ liệu dạng bảng cùng tham gia vào một quá trình suy luận từng bước thống nhất để giải quyết các bài toán phức tạp<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_note-survey_wang_2025-1)</sup>.

Phương pháp này xuất hiện cùng với sự phát triển của các mô hình ngôn ngữ lớn đa phương thức (MLLM), có khả năng xử lý đồng thời văn bản, hình ảnh, âm thanh và video. MCoT cho phép các mô hình tạo ra các giải thích có thể diễn giải được, theo từng bước, kết hợp thông tin từ nhiều nguồn khác nhau, qua đó nâng cao độ chính xác và tính minh bạch trong hoạt động của chúng.

## Tiền đề: từ CoT văn bản đến CoT đa phương thức

### Chain-of-Thought trong văn bản

Ban đầu, phương pháp **Chain-of-Thought (CoT)** được các nhà nghiên cứu tại Google đề xuất vào năm 2022 dành cho các mô hình ngôn ngữ lớn (LLM) xử lý văn bản<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_note-cot_wei_2022-2)</sup>. Ý tưởng là huấn luyện mô hình tạo ra một chuỗi các bước suy luận trung gian trước khi đưa ra câu trả lời cuối cùng. Việc bổ sung vào prompt các ví dụ giải bài theo từng bước (*few-shot prompting*) đã cải thiện đáng kể khả năng của LLM trong việc giải các bài toán đòi hỏi suy luận số học, logic và suy luận thông thường, đồng thời nâng cao độ chính xác và độ tin cậy tổng thể của các mô hình<sup>[\[2\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_note-cot_wei_2022-2)</sup>.

### Chuyển sang đa phương thức

Thành công của CoT văn bản đã thúc đẩy các nỗ lực mở rộng nó sang các kịch bản đa phương thức. Với sự xuất hiện của các MLLM như **Kosmos-1** từ Microsoft — được huấn luyện đồng thời trên văn bản và hình ảnh — đã mở ra khả năng tích hợp logic CoT với nhận thức đa phương thức<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_note-kosmos1_huang_2023-3)</sup>. Các thí nghiệm cho thấy các mô hình như vậy có thể sử dụng suy luận từng bước, tính đến cả đầu vào văn bản lẫn hình ảnh, điều này đã chứng minh về mặt nguyên tắc khả năng kết hợp logic và nhận thức<sup>[\[3\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_note-kosmos1_huang_2023-3)</sup>.

## Các phương pháp và phương pháp luận chính

Bắt đầu từ năm 2023, một số phương pháp đã được đề xuất để hiện thực hóa CoT đa phương thức.

### Multimodal-CoT hai giai đoạn (Zhang et al.)

Một trong những phương pháp đầu tiên, được đề xuất vào năm 2023, sử dụng sơ đồ hai giai đoạn<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_note-mcot_zhang_2023-4)</sup>:

1.  **Tạo cơ sở lý luận**: Ở bước đầu tiên, mô hình tạo ra chuỗi suy luận văn bản (*rationale*) dựa trên thông tin đa phương thức (ví dụ: văn bản và hình ảnh).
2.  **Hình thành câu trả lời**: Ở bước thứ hai, mô hình đưa ra câu trả lời cuối cùng dựa trên cơ sở lý luận đã được tạo ra.

Cách tiếp cận tách biệt này cho phép mô hình với ít hơn 1 tỷ tham số đạt chất lượng cao kỷ lục trên dataset khoa học **ScienceQA**, vượt trội cả mô hình lớn GPT-3.5. Ngoài ra, hiện tượng ảo giác cũng giảm đáng kể<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_note-mcot_zhang_2023-4)</sup>.

### Compositional CoT (CoT cấu thành)

Được trình bày tại hội nghị CVPR 2024, phương pháp này tập trung vào các bài toán thị giác-ngôn ngữ và đề xuất tạo ra biểu diễn có cấu trúc của hình ảnh như một bước trung gian<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_note-compositional_cot_mitra_2024-5)</sup>. Đầu tiên, MLLM tạo ra mô tả cảnh dưới dạng scene graph, chỉ ra các đối tượng và mối quan hệ giữa chúng. Sau đó, mô tả có cấu trúc này được đưa vào prompt cho câu trả lời cuối cùng. Cách tiếp cận này cho phép LLM xem xét sâu hơn các mối liên hệ cấu thành giữa các đối tượng và cải thiện kết quả trên các bài toán mô tả cảnh phức tạp và phân tích hỏi-đáp trực quan<sup>[\[5\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_note-compositional_cot_mitra_2024-5)</sup>.

### CoT phân chia trách nhiệm (Duty-Distinct CoT)

Phương pháp này, được trình bày tại NeurIPS 2023, đề xuất phân chia trách nhiệm giữa các thành phần khác nhau của hệ thống<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_note-ddcot_zheng_2023-6)</sup>:

- **Mô hình ngôn ngữ** chịu trách nhiệm về suy luận logic và tích hợp thông tin.
- **Hệ thống con thị giác** (mô hình thị giác máy tính) chịu trách nhiệm nhận dạng nội dung hình ảnh.

Kiểu "prompting nhị phân" này đảm bảo "tư duy phản biện": LLM đánh giá và sử dụng thông tin hình ảnh nhận được từ mô-đun thị giác chuyên biệt. Phương pháp DDCoT cho phép tạo ra các suy luận tổng quát hơn và có thể giải thích hơn, đồng thời nâng cao đáng kể độ chính xác trên các bài toán QA khoa học đa phương thức<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_note-ddcot_zheng_2023-6)</sup>.

### Các biến thể MCoT khác

Các phương pháp khác được điều chỉnh cho các phương thức cụ thể cũng đang được phát triển tích cực:

- **Dual CoT**: Sơ đồ suy luận song song hai chiều.
- **Audio-CoT**: Thích ứng chuỗi suy nghĩ cho các bài toán liên quan đến âm thanh và giọng nói.
- **Video-of-Thought**: Kỹ thuật phân tích từng bước dữ liệu video<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_note-survey_wang_2025-1)</sup>.

## Ứng dụng và kết quả

Prompting CoT đa phương thức đã thể hiện hiệu quả trong nhiều lĩnh vực đòi hỏi kết hợp thông tin đa dạng.

- **Giáo dục và QA khoa học**: Cho phép các hệ thống trả lời câu hỏi có biểu đồ và hình minh họa, cung cấp giải thích chi tiết về lời giải (ví dụ: trên dataset ScienceQA)<sup>[\[4\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_note-mcot_zhang_2023-4)</sup>.
- **Lái xe tự hành và robot**: Giúp diễn giải dữ liệu từ lidar, cảm biến và camera theo tuần tự, cải thiện khả năng hiểu cảnh và ra quyết định của các tác nhân.
- **Embodied AI**: Đảm bảo lập kế hoạch hành động đáng tin cậy hơn cho các hệ thống tương tác với thế giới vật lý, dựa trên các gợi ý hình ảnh và văn bản.
- **Y tế và chăm sóc sức khỏe**: Kết hợp hình ảnh y tế (ví dụ: ảnh chụp X-quang) với các mô tả văn bản giúp nâng cao độ chính xác chẩn đoán và khả năng giải thích các kết luận của AI<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_note-survey_wang_2025-1)</sup>.

## Thách thức và triển vọng

Mặc dù có tiến bộ đáng kể, việc sử dụng CoT đa phương thức vẫn là một vấn đề nghiên cứu phức tạp.

- **Thiếu dữ liệu được gán nhãn**: Để huấn luyện các mô hình tạo ra suy luận đa phương thức chính xác, cần có các tập dữ liệu lớn với giải thích chi tiết, việc thu thập chúng rất tốn công sức.
- **Tính linh hoạt và khả năng tổng quát hóa**: Các phương pháp được tinh chỉnh cho một loại bài toán (ví dụ: văn bản + hình ảnh) có thể chuyển sang các kết hợp phương thức khác kém hiệu quả.
- **Tích hợp tối ưu**: Câu hỏi về cách tốt nhất để tích hợp các phương thức khác nhau vào một quá trình suy luận thống nhất vẫn còn bỏ ngỏ, sao cho nó thực sự tăng cường hiểu biết của mô hình chứ không chỉ kéo dài câu trả lời.
- **Chuẩn hóa và đánh giá**: Có nhu cầu phát triển các benchmark chuẩn hóa để đánh giá và so sánh khách quan các phương pháp MCoT khác nhau<sup>[\[6\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_note-ddcot_zheng_2023-6)</sup>.

Để đạt được AI đa phương thức gần với khả năng trí tuệ tổng quát, cần có những đổi mới tiếp theo trong các phương pháp MCoT, tính đến đặc thù nhận thức thế giới qua các cảm biến khác nhau<sup>[\[1\]](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_note-survey_wang_2025-1)</sup>.

## Liên kết

- Tổng quan về Multimodal CoT trong Prompting Guide
- «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey» — tổng quan khoa học chi tiết

## Tài liệu tham khảo

- Zhang, Z. et al. (2023). *Multimodal Chain-of-Thought Reasoning in Language Models*. arXiv:2302.00923.
- Mitra, C. et al. (2024). *Compositional Chain-of-Thought Prompting for Large Multimodal Models*. *CVPR 2024*. PDF.
- Zheng, G. et al. (2023). *DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models*. arXiv:2310.16436.
- Huang, S. et al. (2023). *Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1)*. arXiv:2302.14045.
- Wang, Y. et al. (2025). *Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey*. arXiv:2503.12605.
- Ma, Z. et al. (2025). *Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models*. arXiv:2501.07246.
- Li, J. et al. (2024). *DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models*. OpenReview:0saecDOdh2.
- Ma, Z. et al. (2025). *ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models*. arXiv:2506.21448.
- Zhang, M. et al. (2023). *Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition*. PDF.
- Mitra, S. et al. (2024). *ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts*. arXiv:2505.18561.
- Wu, Y. et al. (2024). *MINT: Multi-modal Chain of Thought in Unified Generative Models*. arXiv:2503.01298.

## Chú thích

1.  <span id="cite_note-survey_wang_2025-1">↑ <sup>[1.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_ref-survey_wang_2025_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_ref-survey_wang_2025_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_ref-survey_wang_2025_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_ref-survey_wang_2025_1-3)</sup> Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». *arXiv:2503.12605*, 2025. <a href="https://arxiv.org/abs/2503.12605" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-cot_wei_2022-2">↑ <sup>[2.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_ref-cot_wei_2022_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_ref-cot_wei_2022_2-1)</sup> Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». *arXiv:2201.11903*, 2022. <a href="https://arxiv.org/abs/2201.11903" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-kosmos1_huang_2023-3">↑ <sup>[3.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_ref-kosmos1_huang_2023_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_ref-kosmos1_huang_2023_3-1)</sup> Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». *arXiv:2302.14045*, 2023. <a href="https://arxiv.org/abs/2302.14045" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-mcot_zhang_2023-4">↑ <sup>[4.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_ref-mcot_zhang_2023_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_ref-mcot_zhang_2023_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_ref-mcot_zhang_2023_4-2)</sup> Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». *arXiv:2302.00923*, 2023. <a href="https://arxiv.org/abs/2302.00923" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-compositional_cot_mitra_2024-5">↑ <sup>[5.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_ref-compositional_cot_mitra_2024_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_ref-compositional_cot_mitra_2024_5-1)</sup> Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». *CVPR*, 2024. <a href="https://openaccess.thecvf.com/content/CVPR2024/papers/Mitra_Compositional_Chain-of-Thought_Prompting_for_Large_Multimodal_Models_CVPR_2024_paper.pdf" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-ddcot_zheng_2023-6">↑ <sup>[6.0](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_ref-ddcot_zheng_2023_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_ref-ddcot_zheng_2023_6-1)</sup> <sup>[6.2](https://systems-analysis.info/int/Multimodal_CoT_Prompting_(VI)#cite_ref-ddcot_zheng_2023_6-2)</sup> Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». *OpenReview*, 2023. <a href="https://openreview.net/forum?id=ktYjrgOENR" class="external autonumber" rel="nofollow">[6]</a></span>
