TY - RPRT TI - Reinforcement Learning with Conditional Expectation Reward AU - Changyi Xiao AU - Caijun Xu AU - Yixin Cao PY - 2026 UR - https://arxiv.org/abs/2603.10624 ID - 2603.10624 ER -