TY - RPRT TI - Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering AU - Gang Li AU - Jizhong Liu AU - Heinrich Dinkel AU - Yadong Niu AU - Junbo Zhang AU - Jian Luan PY - 2025 UR - https://arxiv.org/abs/2503.11197 ID - 2503.11197 ER -