@misc{indiciaeb178c54b6459, title = {Advancing General Multimodal Capability of Vision-language Models with Pyramid-descent Visual Position Encoding}, author = {Zhanpeng Chen and Mingxiao Li and Ziyang Chen and Nan Du and Xiaolong Li and Yuexian Zou}, year = {2025}, url = {https://arxiv.org/abs/2501.10967}, note = {Source identifier: 2501.10967} }