TY - RPRT TI - QSIM: Mitigating Overestimation in Multi-Agent Reinforcement Learning via Action Similarity Weighted Q-Learning AU - Yuanjun Li AU - Bin Zhang AU - Hao Chen AU - Zhouyang Jiang AU - Dapeng Li AU - Zhiwei Xu PY - 2026 UR - https://arxiv.org/abs/2602.22786 ID - 2602.22786 ER -