@misc{indiciae8c5da6869207, title = {Can a Unimodal Language Agent Provide Preferences to Tune a Multimodal Vision-Language Model?}, author = {Sazia Tabasum Mim and Jack Morris and Manish Dhakal and Yanming Xiu and Maria Gorlatova and Yi Ding}, year = {2026}, url = {https://arxiv.org/abs/2601.06424}, note = {Source identifier: 2601.06424} }