TY - RPRT TI - SeRA: Self-Reviewing and Alignment of Large Language Models using Implicit Reward Margins AU - Jongwoo Ko AU - Saket Dingliwal AU - Bhavana Ganesh AU - Sailik Sengupta AU - Sravan Bodapati AU - Aram Galstyan PY - 2024 UR - https://arxiv.org/abs/2410.09362 ID - 2410.09362 ER -