@misc{indiciae29dfc8d82fd1, title = {MAViD: A Multimodal Framework for Audio-Visual Dialogue Understanding and Generation}, author = {Youxin Pang and Jiajun Liu and Lingfeng Tan and Yong Zhang and Feng Gao and Xiang Deng and Zhuoliang Kang and Xiaoming Wei and Yebin Liu}, year = {2026}, url = {https://arxiv.org/abs/2512.03034}, note = {Source identifier: 2512.03034} }