TY - RPRT TI - Hybrid Differential Reward: Combining Temporal Difference and Action Gradients for Efficient Multi-Agent Reinforcement Learning in Cooperative Driving AU - Ye Han AU - Lijun Zhang AU - Dejian Meng AU - Zhuang Zhang PY - 2025 UR - https://arxiv.org/abs/2511.16916 ID - 2511.16916 ER -