TY - RPRT TI - Reformulate LLM Reinforcement Learning for Efficient Training under Black-box Discrepancy AU - Jiashun Liu AU - Runze Liu AU - Xu Wan AU - Jing Liang AU - Hongyao Tang AU - Ling Pan PY - 2026 UR - https://arxiv.org/abs/2606.08779 ID - 2606.08779 ER -