TY - RPRT TI - Zeroth-Order Optimization Meets Human Feedback: Provable Learning via Ranking Oracles AU - Zhiwei Tang AU - Dmitry Rybin AU - Tsung-Hui Chang PY - 2024 UR - https://arxiv.org/abs/2303.03751 ID - 2303.03751 ER -