TY - RPRT TI - From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models AU - Christian Gumbsch AU - Leonardo Barcellona AU - Lennard Schünemann AU - Platon Karageorgis AU - Andrii Zadaianchuk AU - Zehao Wang AU - Sergey Zakharov AU - Fabien Despinoy AU - Rahaf Aljundi AU - Efstratios Gavves PY - 2026 UR - https://arxiv.org/abs/2606.00083 ID - 2606.00083 ER -