TY - RPRT TI - Zeroth-Order Policy Gradient for Reinforcement Learning from Human Feedback without Reward Inference AU - Qining Zhang AU - Lei Ying PY - 2025 UR - https://arxiv.org/abs/2409.17401 ID - 2409.17401 ER -