TY - RPRT TI - EFRame: Deeper Reasoning via Exploration-Filter-Replay Reinforcement Learning Framework AU - Chen Wang AU - Lai Wei AU - Yanzhi Zhang AU - Chenyang Shao AU - Zedong Dan AU - Weiran Huang AU - Yuzhi Zhang AU - Yue Wang PY - 2025 UR - https://arxiv.org/abs/2506.22200 ID - 2506.22200 ER -