TY - RPRT TI - Learning Domain Knowledge in Multimodal Large Language Models through Reinforcement Fine-Tuning AU - Qinglong Cao AU - Yuntian Chen AU - Chao Ma AU - Xiaokang Yang PY - 2026 UR - https://arxiv.org/abs/2601.16419 ID - 2601.16419 ER -