TY - RPRT TI - PipelineRL: Faster On-policy Reinforcement Learning for Long Sequence Generation AU - Alexandre Piché AU - Ehsan Kamalloo AU - Rafael Pardinas AU - Xiaoyin Chen AU - Dzmitry Bahdanau PY - 2025 UR - https://arxiv.org/abs/2509.19128 ID - 2509.19128 ER -