TY - RPRT TI - Rethinking Training-Inference Mismatch in LLM Reinforcement Learning: Where It Arises and How to Correct It AU - Tianrun Yu AU - Kaixiang Zhao AU - Shangzhe Li AU - Yuxiao Yang AU - Porter Jenkins AU - Weitong Zhang AU - Taylor W. Killian PY - 2026 UR - https://arxiv.org/abs/2609.32444 ID - 2609.32444 ER -