@misc{indiciae9c8cca1558bc, title = {Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought}, author = {Xuanchen Li and Yuheng Lu and Chenrui Cui and Tianrui Wang and Zikang Huang and Yu Jiang and Long Zhou and Longbiao Wang and Jianwu Dang}, year = {2026}, url = {https://arxiv.org/abs/2605.09906}, note = {Source identifier: 2605.09906} }