@misc{indiciaed391ca0a6303, title = {AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward}, author = {Mingyang Wu and Kaituo Feng and Bohao Li and Kaixiong Gong and Zihao Yin and Xiangyu Yue}, year = {2026}, url = {https://arxiv.org/abs/2608.06930}, note = {Source identifier: 2608.06930} }