TY - RPRT TI - VARP: Reinforcement Learning from Vision-Language Model Feedback with Agent Regularized Preferences AU - Anukriti Singh AU - Amisha Bhaskar AU - Peihong Yu AU - Souradip Chakraborty AU - Ruthwik Dasyam AU - Amrit Bedi AU - Pratap Tokekar PY - 2025 UR - https://arxiv.org/abs/2503.13817 ID - 2503.13817 ER -