@misc{indiciae44faf03a5d00, title = {More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models}, author = {Hoang Anh Just and Yifei Fan and Handong Zhao and Jiuxiang Gu and Ruiyi Zhang and Simon Jenni and Kushal Kafle and Ruoxi Jia and Jing Shi}, year = {2025}, url = {https://arxiv.org/abs/2512.12487}, note = {Source identifier: 2512.12487} }