@misc{indiciae766a1579efb6, title = {Diffusion Transformer World-Action Model for AV Scene Prediction}, author = {Ruslan Sharifullin and Benjamin Jiang and Kai Xi Chew}, year = {2026}, url = {https://arxiv.org/abs/2606.12987}, note = {Source identifier: 2606.12987} }