TY - RPRT TI - Efficient Reinforcement Learning with Semantic and Token Entropy for LLM Reasoning AU - Hongye Cao AU - Zhixin Bai AU - Ziyue Peng AU - Boyan Wang AU - Tianpei Yang AU - Jing Huo AU - Yuyao Zhang AU - Yang Gao PY - 2026 UR - https://arxiv.org/abs/2512.04359 ID - 2512.04359 ER -