TY - RPRT TI - Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation AU - Yizhou Liu AU - Dingkang Yang AU - Zizhi Chen AU - Minghao Han AU - Xukun Zhang AU - Keliang Liu AU - Jingwei Wei AU - Lihua Zhang PY - 2026 UR - https://arxiv.org/abs/2508.12957 ID - 2508.12957 ER -