@misc{indiciae1b1433d24e3b, title = {Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation}, author = {Junrong Yue and Yifan Zhang and Chuan Qin and Bo Li and Xiaomin Lie and Xinlei Yu and Wenxin Zhang and Zhendong Zhao}, year = {2025}, url = {https://arxiv.org/abs/2504.16516}, note = {Source identifier: 2504.16516} }