TY - RPRT TI - SERL: Self-Examining Reinforcement Learning on Open-Domain AU - Weixuan Ou AU - Yanzhao Zheng AU - Shuoshuo Sun AU - Wei Zhang AU - Baohua Dong AU - Hangcheng Zhu AU - Ruohui Huang AU - Gang Yu AU - Pengwei Yan AU - Yifan Qiao PY - 2026 UR - https://arxiv.org/abs/2511.07922 ID - 2511.07922 ER -