TY - RPRT TI - Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model AU - Jing Liang AU - Hongyao Tang AU - Yi Ma AU - Jinyi Liu AU - Yan Zheng AU - Shuyue Hu AU - Lei Bai AU - Jianye Hao PY - 2025 UR - https://arxiv.org/abs/2507.06892 ID - 2507.06892 ER -