TY - RPRT TI - EAPO: Entropy-Driven Adaptive Positive-Negative Sample Weighting for Policy Optimization in Open-Ended QA AU - Yunsheng Zeng AU - Gen Li AU - Yuwei Miao AU - Xiandong Li AU - Yujin Wang AU - Siyu Chen AU - Luning Wang AU - Yunhao Qiao AU - Junfeng Wang AU - Jianwei Lv AU - Bo Yuan PY - 2026 UR - https://arxiv.org/abs/2605.27846 ID - 2605.27846 ER -