@misc{indiciae061324a06f67, title = {Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning}, author = {Chen Zhao and Jiajun Ma and Qilong Huang and Tiehan Fan and Hongyu Li and Zhuoliang Kang and Xiaoming Wei and Jian Yang and Ying Tai}, year = {2026}, url = {https://arxiv.org/abs/2607.01667}, note = {Source identifier: 2607.01667} }