TY - RPRT TI - V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding AU - Junqi Ge AU - Ziyi Chen AU - Jintao Lin AU - Jinguo Zhu AU - Xihui Liu AU - Jifeng Dai AU - Xizhou Zhu PY - 2024 UR - https://arxiv.org/abs/2412.09616 ID - 2412.09616 ER -