TY - RPRT TI - Rewarding Reasoning, Not Answers: Fixing and Bounding Test-Time Reinforcement Learning on Medical QA AU - Kailong Fan AU - Anqi Pu AU - Yichen Wu AU - Wanhua Li AU - Yicong Li AU - Hanspeter Pfister AU - Huafeng Liu AU - Xiang Li AU - Quanzheng Li AU - Ning Guo PY - 2026 UR - https://arxiv.org/abs/2609.16660 ID - 2609.16660 ER -