TY - RPRT TI - Omni-Thinker: Scaling Multi-Task RL in LLMs with Hybrid Reward and Task Scheduling AU - Derek Li AU - Jiaming Zhou AU - Leo Maxime Brunswic AU - Abbas Ghaddar AU - Qianyi Sun AU - Liheng Ma AU - Yu Luo AU - Dong Li AU - Mark Coates AU - Jianye Hao AU - Yingxue Zhang PY - 2025 UR - https://arxiv.org/abs/2507.14783 ID - 2507.14783 ER -