TY - RPRT TI - RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment AU - Yuhao Du AU - Zhuo Li AU - Pengyu Cheng AU - Zhihong Chen AU - Yuejiao Xie AU - Xiang Wan AU - Anningzhe Gao PY - 2026 UR - https://arxiv.org/abs/2502.11026 ID - 2502.11026 ER -