@misc{indiciaed70b030b2e88, title = {Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency}, author = {Xiangyu Guo and Zhanqian Wu and Kaixin Xiong and Ziyang Xu and Lijun Zhou and Gangwei Xu and Shaoqing Xu and Haiyang Sun and Bing Wang and Guang Chen and Hangjun Ye and Wenyu Liu and Xinggang Wang}, year = {2025}, url = {https://arxiv.org/abs/2506.07497}, note = {Source identifier: 2506.07497} }