TY - RPRT TI - Deconstructing Off-Policy Ratios: Entropy-Normalized Trust Regions for Asynchronous Reinforcement Learning AU - Guanqun Zhao AU - Zijun Xie AU - Binbin Zheng AU - Jiafeng Lu AU - Enlei Gong AU - Zeyu Chen PY - 2026 UR - https://arxiv.org/abs/2607.22186 ID - 2607.22186 ER -