TY - RPRT TI - Gradient-Guided Reward Optimization for Inference-time Alignment AU - Hankun Lin AU - Ruqi Zhang PY - 2026 UR - https://arxiv.org/abs/2606.09635 ID - 2606.09635 ER -