@misc{indiciae8977dc006e64, title = {Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning}, author = {Yihong Tang and Ao Qu and Zhaokai Wang and Dingyi Zhuang and Zhaofeng Wu and Wei Ma and Shenhao Wang and Yunhan Zheng and Zhan Zhao and Jinhua Zhao}, year = {2025}, url = {https://arxiv.org/abs/2410.16162}, note = {Source identifier: 2410.16162} }