@misc{indiciae2a162a3488bd, title = {M3L: Language-based Video Editing via Multi-Modal Multi-Level Transformers}, author = {Tsu-Jui Fu and Xin Eric Wang and Scott T. Grafton and Miguel P. Eckstein and William Yang Wang}, year = {2022}, url = {https://arxiv.org/abs/2104.01122}, note = {Source identifier: 2104.01122} }