@misc{indiciaedcb5c09ef4dc, title = {Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context}, author = {Zhaowei Wang and Lishu Luo and Haodong Duan and Weiwei Liu and Sijin Wu and Ji Luo and Shen Yan and Shuai Peng and Sihang Yuan and Chaoyi Huang and Yi Lin and Yangqiu Song}, year = {2026}, url = {https://arxiv.org/abs/2605.13831}, note = {Source identifier: 2605.13831} }