@misc{indiciae47de65823df1, title = {Watch Before You Answer: Learning from Visually Grounded Post-Training}, author = {Yuxuan Zhang and EunJeong Hwang and Huaisong Zhang and Penghui Du and Yiming Jia and Dongfu Jiang and Xuan He and Shenhui Zhang and Ping Nie and Peter West and Kelsey R. Allen}, year = {2026}, url = {https://arxiv.org/abs/2604.05117}, note = {Source identifier: 2604.05117} }