TY - RPRT TI - Q-Distribution guided Q-learning for offline reinforcement learning: Uncertainty penalized Q-value via consistency model AU - Jing Zhang AU - Linjiajie Fang AU - Kexin Shi AU - Wenjia Wang AU - Bing-Yi Jing PY - 2025 UR - https://arxiv.org/abs/2410.20312 ID - 2410.20312 ER -