@misc{indiciae974fdae77ba4, title = {Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding}, author = {Tencent Hunyuan Team}, year = {2026}, url = {https://arxiv.org/abs/2604.11244}, note = {Source identifier: 2604.11244} }