TY - RPRT TI - Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment AU - Ruoxi Cheng AU - Haoxuan Ma AU - Weixin Wang AU - Ranjie Duan AU - Jiexi Liu AU - Xiaoshuang Jia AU - Simeng Qin AU - Xiaochun Cao AU - Yang Liu AU - Xiaojun Jia PY - 2026 UR - https://arxiv.org/abs/2503.18991 ID - 2503.18991 ER -