TY - RPRT TI - Aligning Language Models Using Follow-up Likelihood as Reward Signal AU - Chen Zhang AU - Dading Chong AU - Feng Jiang AU - Chengguang Tang AU - Anningzhe Gao AU - Guohua Tang AU - Haizhou Li PY - 2025 UR - https://arxiv.org/abs/2409.13948 ID - 2409.13948 ER -