Multimodal CoT Prompting (TR)
Çok modlu düşünce zinciri prompting (Multimodal Chain-of-Thought Prompting, MCoT) — birden fazla veri türü (modalite) içeren görevlere yönelik düşünce zinciri (CoT) yönteminin bir genişlemesidir. MCoT modellerinde dil ve görme ya da tablo verisi analizi gibi diğer modaliteler, karmaşık görevleri çözmek amacıyla tek bir adım adım çıkarım sürecine katılır[1].
Bu yaklaşım, metin, görüntü, ses ve videoyu aynı anda işleyebilen çok modlu büyük dil modellerinin (MLLM) gelişimiyle ortaya çıkmıştır. MCoT, modellerin farklı kaynaklardan gelen bilgileri birleştiren yorumlanabilir, adım adım açıklamalar üretmesine olanak tanıyarak doğruluklarını ve şeffaflıklarını artırır.
Ön Koşullar: Metinden Çok Modluya CoT
Metinde Chain-of-Thought
Başlangıçta Chain-of-Thought (CoT) yöntemi, Google araştırmacıları tarafından 2022 yılında metinsel büyük dil modelleri (LLM) için önerilmiştir[2]. Temel fikir, modeli nihai yanıtı vermeden önce bir dizi ara çıkarım adımı üretecek şekilde eğitmektir. Prompta adım adım çözüm örnekleri eklenmesi (few-shot prompting), LLM'lerin aritmetik, mantıksal ve sağduyu gerektiren görevleri çözme becerisini belirgin biçimde geliştirmiş ve modellerin genel doğruluğunu ve güvenilirliğini artırmıştır[2].
Çok Modluluğa Geçiş
Metinsel CoT'un başarısı, bu yöntemi çok modlu senaryolara genişletme çabalarını teşvik etmiştir. Microsoft'un Kosmos-1 gibi metin ve görüntü üzerinde aynı anda eğitilen MLLM'lerin ortaya çıkmasıyla CoT mantığını çok modlu algıyla bütünleştirme imkânı doğmuştur[3]. Deneyler, bu tür modellerin hem metinsel hem de görsel girdileri dikkate alarak adım adım çıkarım yapabildiğini göstermiş; bu durum mantık ve algının birleştirilmesinin ilkesel olarak mümkün olduğunu ortaya koymuştur[3].
Temel Yaklaşımlar ve Metodolojiler
2023 yılından itibaren çok modlu CoT'un hayata geçirilmesi için bir dizi yöntem önerilmiştir.
İki Aşamalı Multimodal-CoT (Zhang et al.)
2023 yılında önerilen ilk yöntemlerden biri iki aşamalı bir şema kullanmaktadır[4]:
- Gerekçe Üretimi: İlk adımda model, çok modlu bilgiye (örneğin metin ve görüntü) dayanarak bir metinsel düşünce zinciri (rationale) üretir.
- Yanıt Oluşturma: İkinci adımda model, üretilen gerekçeye dayanarak nihai yanıtı verir.
Bu ayrıştırılmış yaklaşım, 1 milyardan az parametreye sahip bir modelin bilimsel ScienceQA dataset'inde rekor düzeyde yüksek bir kaliteye ulaşmasını sağlamış; büyük model GPT-3.5'i bile geride bırakmıştır. Ayrıca halüsinasyonlarda azalma gözlemlenmiştir[4].
Compositional CoT - Kompozisyonel CoT
CVPR 2024 konferansında sunulan bu yöntem, görsel-metinsel görevlere odaklanmakta ve ara adım olarak görüntünün yapılandırılmış bir temsilini üretmeyi önermektedir[5]. Önce MLLM, nesneleri ve aralarındaki ilişkileri belirterek sahneyi bir sahne grafiği biçiminde tanımlar. Ardından bu yapılandırılmış tanım, nihai yanıt için prompta dahil edilir. Bu yaklaşım, LLM'nin nesneler arasındaki kompozisyonel bağlantıları daha derinlemesine dikkate almasına olanak tanır ve karmaşık sahne tanımlama ile görsel soru-cevap analizi görevlerindeki sonuçları iyileştirir[5].
Duty-Distinct CoT - Görev Ayrımlı CoT
NeurIPS 2023'te sunulan bu yöntem, sorumluluğun sistem bileşenleri arasında paylaştırılmasını önermektedir[6]:
- Dil modeli mantıksal çıkarım ve bilgi entegrasyonundan sorumludur.
- Görsel alt sistem (bilgisayarlı görme modeli) görüntü içeriğinin tanınmasından sorumludur.
Bu "ikili prompting" yaklaşımı "eleştirel düşünme" sağlar: LLM, özelleşmiş görsel modülden elde edilen görsel bilgiyi değerlendirir ve kullanır. DDCoT yaklaşımı daha genel ve açıklanabilir çıkarımlar üretilmesini sağlamış ve çok modlu bilimsel QA görevlerinde doğruluğu önemli ölçüde artırmıştır[6].
Diğer MCoT Varyantları
Belirli modalitelere uyarlanmış başka yaklaşımlar da aktif biçimde geliştirilmektedir:
- Dual CoT: Paralel çift yönlü çıkarım şeması.
- Audio-CoT: Düşünce zincirinin ses ve konuşmaya ilişkin görevlere uyarlanması.
- Video-of-Thought: Video verilerinin adım adım analizi tekniği[1].
Uygulama Alanları ve Sonuçlar
Çok modlu CoT prompting, heterojen bilgilerin birleştirilmesini gerektiren pek çok alanda etkinliğini kanıtlamıştır.
- Eğitim ve Bilimsel QA: Sistemlerin diyagram ve illüstrasyonlar içeren sorulara ayrıntılı çözüm açıklamaları sunarak yanıt vermesine olanak tanır (örneğin ScienceQA dataset'inde)[4].
- Otonom Sürüş ve Robotik: Lidar, sensör ve kamera verilerinin sıralı biçimde yorumlanmasına yardımcı olur; ajan sistemlerin sahne anlama ve karar verme becerilerini geliştirir.
- Embodied AI: Fiziksel dünyayla etkileşen sistemler için görsel ve metinsel ipuçlarına dayalı eylem planlamasını daha güvenilir kılar.
- Tıp ve Sağlık: Tıbbi görüntülerin (örneğin röntgen filmlerinin) metinsel açıklamalarla birleştirilmesi, tanı doğruluğunu ve AI çıkarımlarının açıklanabilirliğini artırır[1].
Sorunlar ve Beklentiler
Önemli ilerlemelere karşın, CoT'un çok modlu kullanımı zorlu bir araştırma problemi olmaya devam etmektedir.
- Etiketli Veri Yetersizliği: Modelleri doğru çok modlu çıkarımlar üretecek şekilde eğitmek için ayrıntılı açıklamalar içeren büyük veri setleri gerekmekte; bunların elde edilmesi ise zaman alıcıdır.
- Esneklik ve Genellenebilirlik: Belirli bir görev türüne (örneğin metin + görüntü) ayarlanan yöntemler, farklı modalite kombinasyonlarına iyi aktarılamayabilir.
- Optimum Entegrasyon: Farklı modalitelerin tek bir çıkarım sürecine modelin gerçek anlamda anlayışını güçlendirecek biçimde nasıl en iyi şekilde entegre edileceği sorusu henüz yanıt beklemektedir.
- Standardizasyon ve Değerlendirme: Çeşitli MCoT yaklaşımlarının nesnel değerlendirmesi ve karşılaştırılması için standartlaştırılmış benchmark'ların geliştirilmesine ihtiyaç duyulmaktadır[6].
Genel zeka yeteneklerine yakın çok modlu bir AI'ye ulaşmak için, dünyayı farklı sensörlerle algılamanın özelliklerini göz önünde bulunduran MCoT yöntemlerinde daha fazla yeniliğe ihtiyaç vardır[1].
Dış bağlantılar
- Prompting Guide'da Multimodal CoT İncelemesi
- «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey» — ayrıntılı bilimsel inceleme
Kaynakça
- Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
- Mitra, C. et al. (2024). Compositional Chain-of-Thought Prompting for Large Multimodal Models. CVPR 2024. PDF.
- Zheng, G. et al. (2023). DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models. arXiv:2310.16436.
- Huang, S. et al. (2023). Language Is Not All You Need: Aligning Perception with Language Models (Kosmos-1). arXiv:2302.14045.
- Wang, Y. et al. (2025). Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey. arXiv:2503.12605.
- Ma, Z. et al. (2025). Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Models. arXiv:2501.07246.
- Li, J. et al. (2024). DCoT: Dual Chain-of-Thought Prompting for Large Multimodal Models. OpenReview:0saecDOdh2.
- Ma, Z. et al. (2025). ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models. arXiv:2506.21448.
- Zhang, M. et al. (2023). Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition. PDF.
- Mitra, S. et al. (2024). ThinkVideo: High-Quality Video Reasoning with Chain of Thoughts. arXiv:2505.18561.
- Wu, Y. et al. (2024). MINT: Multi-modal Chain of Thought in Unified Generative Models. arXiv:2503.01298.
Notlar
- ↑ 1.0 1.1 1.2 1.3 Wang, Y. et al. «Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey». arXiv:2503.12605, 2025. [1]
- ↑ 2.0 2.1 Wei, J. et al. «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». arXiv:2201.11903, 2022. [2]
- ↑ 3.0 3.1 Huang, S. et al. «Language Is Not All You Need: Aligning Perception with Language Models». arXiv:2302.14045, 2023. [3]
- ↑ 4.0 4.1 4.2 Zhang, Z. et al. «Multimodal Chain-of-Thought Reasoning in Language Models». arXiv:2302.00923, 2023. [4]
- ↑ 5.0 5.1 Mitra, A. et al. «Compositional Chain-of-Thought Prompting for Large Multimodal Models». CVPR, 2024. [5]
- ↑ 6.0 6.1 6.2 Zheng, G. et al. «DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models». OpenReview, 2023. [6]