TY - RPRT TI - Behavior-Induced Mirror-Prox Temporal-Difference Learning for Faster Off-Policy Prediction AU - Xingguo Chen AU - Yuchen Shen AU - Shangdong Yang AU - Chao Li AU - Guang Yang AU - Wenhao Wang PY - 2026 UR - https://arxiv.org/abs/2605.28849 ID - 2605.28849 ER -