TY - RPRT TI - Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization AU - Thanh Thi Nguyen AU - Campbell Wilson AU - Janis Dalins PY - 2025 UR - https://arxiv.org/abs/2509.06759 ID - 2509.06759 ER -