@misc{indiciae5143c4c93528, title = {Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization}, author = {Thanh Thi Nguyen and Campbell Wilson and Janis Dalins}, year = {2025}, url = {https://arxiv.org/abs/2509.06759}, note = {Source identifier: 2509.06759} }