@misc{indiciae8c916ece4bb0, title = {Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment}, author = {Ruoxi Cheng and Haoxuan Ma and Weixin Wang and Ranjie Duan and Jiexi Liu and Xiaoshuang Jia and Simeng Qin and Xiaochun Cao and Yang Liu and Xiaojun Jia}, year = {2026}, url = {https://arxiv.org/abs/2503.18991}, note = {Source identifier: 2503.18991} }