@misc{indiciaeff196c9126ba, title = {STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training}, author = {Haiyi Qiu and Minghe Gao and Long Qian and Kaihang Pan and Qifan Yu and Juncheng Li and Wenjie Wang and Siliang Tang and Yueting Zhuang and Tat-Seng Chua}, year = {2025}, url = {https://arxiv.org/abs/2412.00161}, note = {Source identifier: 2412.00161} }