TY - RPRT TI - Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning AU - Liangyu Fu AU - Junbo Wang AU - Yuke Li AU - Ya Jing AU - Xuecheng Wu AU - Zhiyong Wang PY - 2026 UR - https://arxiv.org/abs/2608.11013 ID - 2608.11013 ER -