TY - RPRT TI - Rethinking the Trust Region in LLM Reinforcement Learning AU - Penghui Qi AU - Xiangxin Zhou AU - Zichen Liu AU - Tianyu Pang AU - Chao Du AU - Min Lin AU - Wee Sun Lee PY - 2026 UR - https://arxiv.org/abs/2602.04879 ID - 2602.04879 ER -