TY - RPRT TI - KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning AU - Hongling Xu AU - Qi Zhu AU - Heyuan Deng AU - Jinpeng Li AU - Lu Hou AU - Yasheng Wang AU - Lifeng Shang AU - Ruifeng Xu AU - Fei Mi PY - 2025 UR - https://arxiv.org/abs/2506.02208 ID - 2506.02208 ER -