TY - RPRT TI - Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning AU - Gong Gao AU - Xiao Lai AU - Ziqi Xie AU - Guojie Chen AU - Xianhui Liu AU - Weidong Zhao PY - 2026 UR - https://arxiv.org/abs/2607.26509 ID - 2607.26509 ER -