TY - RPRT TI - Reinforcement Learning from Human Feedback without Reward Inference: Model-Free Algorithm and Instance-Dependent Analysis AU - Qining Zhang AU - Honghao Wei AU - Lei Ying PY - 2025 UR - https://arxiv.org/abs/2406.07455 ID - 2406.07455 ER -