TY - RPRT TI - LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token AU - Shaolei Zhang AU - Qingkai Fang AU - Zhe Yang AU - Yang Feng PY - 2025 UR - https://arxiv.org/abs/2501.03895 ID - 2501.03895 ER -