TY - RPRT TI - REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning AU - Hexuan Deng AU - Wenxiang Jiao AU - Xuebo Liu AU - Jun Rao AU - Min Zhang PY - 2026 UR - https://arxiv.org/abs/2505.19862 ID - 2505.19862 ER -