TY - RPRT TI - Sparse Additive Off-Policy Evaluation for Reinforcement Learning with Potentially Limited Number of Trajectories AU - Tuoyi Zhao AU - Chengchun Shi AU - Zhengling Qi AU - Lan Wang PY - 2026 UR - https://arxiv.org/abs/2608.22595 ID - 2608.22595 ER -