@misc{indiciaed02d4bf3a605, title = {Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation}, author = {Haojie Zhang and Zhihao Liang and Ruibo Fu and Bingyan Liu and Zhengqi Wen and Xuefei Liu and Jianhua Tao and Yaling Liang}, year = {2026}, url = {https://arxiv.org/abs/2411.16748}, note = {Source identifier: 2411.16748} }