TY - RPRT TI - Aligning Frozen LLMs by Reinforcement Learning: An Iterative Reweight-then-Optimize Approach AU - Xinnan Zhang AU - Chenliang Li AU - Siliang Zeng AU - Jiaxiang Li AU - Zhongruo Wang AU - Kaixiang Lin AU - Songtao Lu AU - Alfredo Garcia AU - Mingyi Hong PY - 2025 UR - https://arxiv.org/abs/2506.17828 ID - 2506.17828 ER -