@misc{indiciae0e2e94feb771, title = {CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation}, author = {Haoyu Zhao and Zihao Zhang and Jiaxi Gu and Haoran Chen and Qingping Zheng and Pin Tang and Yeyin Jin and Yuang Zhang and Junqi Cheng and Zenghui Lu and Peng Shu and Zuxuan Wu and Yu-Gang Jiang}, year = {2026}, url = {https://arxiv.org/abs/2604.09201}, note = {Source identifier: 2604.09201} }