TY - RPRT TI - X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment AU - Dongjie Fu AU - Di Cao AU - Xize Cheng AU - Zihan Zhang AU - Wenxu Jia AU - Yifu Chen AU - Shengpeng Ji AU - Yu Zhang AU - Tao Jin PY - 2026 UR - https://arxiv.org/abs/2607.21550 ID - 2607.21550 ER -