TY - RPRT TI - Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning AU - Xin Guan AU - Zijian Li AU - Shen Huang AU - Pengjun Xie AU - Jingren Zhou AU - Jiuxin Cao PY - 2026 UR - https://arxiv.org/abs/2601.10306 ID - 2601.10306 ER -