@misc{indiciae1c5b7ed222ae, title = {Explainable reinforcement learning from human feedback to improve alignment}, author = {Shicheng Liu and Siyuan Xu and Wenjie Qiu and Hangfan Zhang and Minghui Zhu}, year = {2025}, url = {https://arxiv.org/abs/2512.13837}, note = {Source identifier: 2512.13837} }