TY - RPRT TI - Explainable reinforcement learning from human feedback to improve alignment AU - Shicheng Liu AU - Siyuan Xu AU - Wenjie Qiu AU - Hangfan Zhang AU - Minghui Zhu PY - 2025 UR - https://arxiv.org/abs/2512.13837 ID - 2512.13837 ER -