@misc{indiciae9e0111a99d0c, title = {How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace}, author = {Baining Zhao and Ziyou Wang and Jianjie Fang and Zile Zhou and Yanggang Xu and Yatai Ji and Jiacheng Xu and Qian Zhang and Weichen Zhang and Chen Gao and Xinlei Chen}, year = {2026}, url = {https://arxiv.org/abs/2604.07973}, note = {Source identifier: 2604.07973} }