TY - RPRT TI - Why Self-Rewarding Works: Theoretical Guarantees for Iterative Alignment of Language Models AU - Shi Fu AU - Yingjie Wang AU - Shengchao Hu AU - Peng Wang AU - Dacheng Tao PY - 2026 UR - https://arxiv.org/abs/2601.22513 ID - 2601.22513 ER -