@misc{indiciae31b73bda421f, title = {DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering}, author = {Yue Zhang and Xiangyu Li and Wanshu Fan and Xin Yang and Dongsheng Zhou}, year = {2026}, url = {https://arxiv.org/abs/2607.23921}, note = {Source identifier: 2607.23921} }