TY - RPRT TI - Sampling Efficient Deep Reinforcement Learning through Preference-Guided Stochastic Exploration AU - Wenhui Huang AU - Cong Zhang AU - Jingda Wu AU - Xiangkun He AU - Jie Zhang AU - Chen Lv PY - 2022 UR - https://arxiv.org/abs/2206.09627 ID - 2206.09627 ER -