TY - RPRT TI - ACRL: Adaptive Control of Training-Inference Discrepancy for Stable Reinforcement Learning AU - Wenwu Fan AU - Qihong Lin AU - Zhijie Xia AU - Zhuo Zheng AU - Sihao Wang AU - Qiang Chen AU - Liangsheng Zhu PY - 2026 UR - https://arxiv.org/abs/2607.24062 ID - 2607.24062 ER -