TY - RPRT TI - LEPO: Latent Reasoning Policy Optimization for Large Language Models AU - Yuyan Zhou AU - Jiarui Yu AU - Hande Dong AU - Zhezheng Hao AU - Hong Wang AU - Jianqing Zhang AU - Qiang Lin PY - 2026 UR - https://arxiv.org/abs/2604.17892 ID - 2604.17892 ER -