TY - RPRT TI - Reinforcement Learning for Out-of-Distribution Reasoning in LLMs: An Empirical Study on Diagnosis-Related Group Coding AU - Hanyin Wang AU - Zhenbang Wu AU - Gururaj Kolar AU - Hariprasad Korsapati AU - Brian Bartlett AU - Bryan Hull AU - Jimeng Sun PY - 2025 UR - https://arxiv.org/abs/2505.21908 ID - 2505.21908 ER -