@misc{indiciae063c92f183db, title = {Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations}, author = {Zhihao Yuan and Shuyi Jiang and Chun-Mei Feng and Yaolun Zhang and Shuguang Cui and Zhen Li and Na Zhao}, year = {2025}, url = {https://arxiv.org/abs/2506.17545}, note = {Source identifier: 2506.17545} }