TY - RPRT TI - The In-Sample Softmax for Offline Reinforcement Learning AU - Chenjun Xiao AU - Han Wang AU - Yangchen Pan AU - Adam White AU - Martha White PY - 2023 UR - https://arxiv.org/abs/2302.14372 ID - 2302.14372 ER -