TY - RPRT TI - E-ViLM: Efficient Video-Language Model via Masked Video Modeling with Semantic Vector-Quantized Tokenizer AU - Jacob Zhiyuan Fang AU - Skyler Zheng AU - Vasu Sharma AU - Robinson Piramuthu PY - 2023 UR - https://arxiv.org/abs/2311.17267 ID - 2311.17267 ER -