@misc{indiciaefc9aa94e68dd, title = {VIMI: Grounding Video Generation through Multi-modal Instruction}, author = {Yuwei Fang and Willi Menapace and Aliaksandr Siarohin and Tsai-Shien Chen and Kuan-Chien Wang and Ivan Skorokhodov and Graham Neubig and Sergey Tulyakov}, year = {2024}, url = {https://arxiv.org/abs/2407.06304}, note = {Source identifier: 2407.06304} }