@misc{indiciae249b6ff9d638, title = {Rewarding Reasoning, Not Answers: Fixing and Bounding Test-Time Reinforcement Learning on Medical QA}, author = {Kailong Fan and Anqi Pu and Yichen Wu and Wanhua Li and Yicong Li and Hanspeter Pfister and Huafeng Liu and Xiang Li and Quanzheng Li and Ning Guo}, year = {2026}, url = {https://arxiv.org/abs/2609.16660}, note = {Source identifier: 2609.16660} }