TY - RPRT TI - Advancing General Multimodal Capability of Vision-language Models with Pyramid-descent Visual Position Encoding AU - Zhanpeng Chen AU - Mingxiao Li AU - Ziyang Chen AU - Nan Du AU - Xiaolong Li AU - Yuexian Zou PY - 2025 UR - https://arxiv.org/abs/2501.10967 ID - 2501.10967 ER -