Explaining Chain-of-Thought Reasoning in Vision-Language Models via Interactions
Published in ACM MM, 2026
Recommended citation: Chen, Y., Shen, W., Yao, K., Xue, J., Lv, C., Wang, J., & Li, C. Explaining Chain-of-Thought Reasoning in Vision-Language Models via Interactions. In ACM MM 2026.
Abstract. This paper uses game-theoretic interactions to quantify inference patterns learned by vision-language models from chain-of-thought prompts, analyzing their complexity, adjacency, and cross-modal behavior.
Authors: Yaying Chen*, Wen Shen*, Kelu Yao, Junxiao Xue, Chenghui Lv, Jin Wang, Chao Li.
* Equal contribution.
