@misc{indiciaea78ca5862a7e, title = {4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration}, author = {Jiahui Zhang and Yurui Chen and Yueming Xu and Ze Huang and Yanpeng Zhou and Yu-Jie Yuan and Xinyue Cai and Guowei Huang and Xingyue Quan and Hang Xu and Li Zhang}, year = {2025}, url = {https://arxiv.org/abs/2506.22242}, note = {Source identifier: 2506.22242} }