@misc{indiciaeccc73b6dfc5d, title = {Marten: Visual Question Answering with Mask Generation for Multi-modal Document Understanding}, author = {Zining Wang and Tongkun Guan and Pei Fu and Chen Duan and Qianyi Jiang and Zhentao Guo and Shan Guo and Junfeng Luo and Wei Shen and Xiaokang Yang}, year = {2025}, url = {https://arxiv.org/abs/2503.14140}, note = {Source identifier: 2503.14140} }