@misc{indiciaed4ea436936ec, title = {MIMO: A medical vision language model with visual referring multimodal input and pixel grounding multimodal output}, author = {Yanyuan Chen and Dexuan Xu and Yu Huang and Songkun Zhan and Hanpin Wang and Dongxue Chen and Xueping Wang and Meikang Qiu and Hang Li}, year = {2025}, url = {https://arxiv.org/abs/2510.10011}, note = {Source identifier: 2510.10011} }