TY - RPRT TI - From RLHF to Direct Alignment: A Theoretical Unification of Preference Learning for Large Language Models AU - Tarun Raheja AU - Nilay Pochhi PY - 2026 UR - https://arxiv.org/abs/2601.06108 ID - 2601.06108 ER -