@misc{indiciaedbfeaa3199a5, title = {Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos}, author = {Haoxuan Xu and Tianfu Li and Wenbo Chen and Yi Liu and Xingxing Zuo and Yaoxian Song and Haoang Li}, year = {2026}, url = {https://arxiv.org/abs/2602.23937}, note = {Source identifier: 2602.23937} }