TY - RPRT TI - OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning AU - Wenxuan Jiang AU - Zining Fan AU - Zijian Zhang AU - Xuecheng Wu AU - Hongming Tan AU - Haoyang Dai AU - Xiaoyu Li AU - Xuezhi Cao AU - Ninghao Liu PY - 2026 UR - https://arxiv.org/abs/2606.25757 ID - 2606.25757 ER -