TY - RPRT TI - SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models AU - Hardy Chen AU - Haoqin Tu AU - Fali Wang AU - Hui Liu AU - Xianfeng Tang AU - Xinya Du AU - Yuyin Zhou AU - Cihang Xie PY - 2025 UR - https://arxiv.org/abs/2504.11468 ID - 2504.11468 ER -