TY - RPRT TI - Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense AU - Leitian Tao AU - Ilia Kulikov AU - Swarnadeep Saha AU - Tianlu Wang AU - Jing Xu AU - Sharon Li AU - Jason E Weston AU - Ping Yu PY - 2025 UR - https://arxiv.org/abs/2510.07242 ID - 2510.07242 ER -