TY - RPRT TI - RLSR: Reinforcement Learning from Self Reward AU - Toby Simonds AU - Kevin Lopez AU - Akira Yoshiyama AU - Dominique Garmier PY - 2025 UR - https://arxiv.org/abs/2505.08827 ID - 2505.08827 ER -