TY - RPRT TI - On the Convergence of Experience Replay in Policy Optimization: Characterizing Bias, Variance, and Finite-Time Convergence AU - Hua Zheng AU - Wei Xie AU - M. Ben Feng PY - 2026 UR - https://arxiv.org/abs/2110.08902 ID - 2110.08902 ER -