TY - RPRT TI - STIV: Scalable Text and Image Conditioned Video Generation AU - Zongyu Lin AU - Wei Liu AU - Chen Chen AU - Jiasen Lu AU - Wenze Hu AU - Tsu-Jui Fu AU - Jesse Allardice AU - Zhengfeng Lai AU - Liangchen Song AU - Bowen Zhang AU - Cha Chen AU - Yiran Fei AU - Lezhi Li AU - Yizhou Sun AU - Kai-Wei Chang AU - Yinfei Yang PY - 2025 UR - https://arxiv.org/abs/2412.07730 ID - 2412.07730 ER -