@misc{indiciaeb789636531e3, title = {Towards Visually Grounded Multimodal Summarization via Cross-Modal Transformer and Gated Attention}, author = {Abid Ali and Diego Molla-Aliod and Usman Naseem}, year = {2026}, url = {https://arxiv.org/abs/2605.11753}, note = {Source identifier: 2605.11753} }