TY - RPRT TI - Post-Training Large Language Models via Reinforcement Learning from Self-Feedback AU - Carel van Niekerk AU - Renato Vukovic AU - Benjamin Ruppik AU - Hsien-chin Lin AU - Shutong Feng AU - Milica Gašić PY - 2026 UR - https://arxiv.org/abs/2507.21931 ID - 2507.21931 ER -