TY - RPRT TI - On the Impossibility of Unbiased and Length-Invariant Policy Optimization with Outcome Rewards AU - Fei Ding AU - Yongkang Zhang AU - Yuhao Liao AU - Zijian Zeng AU - Huiming Yang PY - 2026 UR - https://arxiv.org/abs/2607.23364 ID - 2607.23364 ER -