@misc{indiciaed25393455d22, title = {Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks}, author = {Jiazhao Zhang and Kunyu Wang and Shaoan Wang and Minghan Li and Haoran Liu and Songlin Wei and Zhongyuan Wang and Zhizheng Zhang and He Wang}, year = {2025}, url = {https://arxiv.org/abs/2412.06224}, note = {Source identifier: 2412.06224} }