@misc{indiciaee723b6ac799c, title = {STIV: Scalable Text and Image Conditioned Video Generation}, author = {Zongyu Lin and Wei Liu and Chen Chen and Jiasen Lu and Wenze Hu and Tsu-Jui Fu and Jesse Allardice and Zhengfeng Lai and Liangchen Song and Bowen Zhang and Cha Chen and Yiran Fei and Lezhi Li and Yizhou Sun and Kai-Wei Chang and Yinfei Yang}, year = {2025}, url = {https://arxiv.org/abs/2412.07730}, note = {Source identifier: 2412.07730} }