@misc{indiciae80897a5ac36c, title = {SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes}, author = {Chuhan Wang and Xintong Li and Jennifer Yuntong Zhang and Junda Wu and Chengkai Huang and Lina Yao and Julian McAuley and Jingbo Shang}, year = {2026}, url = {https://arxiv.org/abs/2601.05600}, note = {Source identifier: 2601.05600} }