TY - RPRT TI - Optimizing RLHF Training for Large Language Models with Stage Fusion AU - Yinmin Zhong AU - Zili Zhang AU - Bingyang Wu AU - Shengyu Liu AU - Yukun Chen AU - Changyi Wan AU - Hanpeng Hu AU - Lei Xia AU - Ranchen Ming AU - Yibo Zhu AU - Xin Jin PY - 2025 UR - https://arxiv.org/abs/2409.13221 ID - 2409.13221 ER -