TY - RPRT TI - Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization AU - Xing Lei AU - Zifeng Zhuang AU - Shentao Yang AU - Sheng Xu AU - Yunhao Luo AU - Fei Shen AU - Wenyan Yang AU - Xuetao Zhang AU - Donglin Wang PY - 2025 UR - https://arxiv.org/abs/2506.00795 ID - 2506.00795 ER -