TY - RPRT TI - From Reward Shaping to Q-Shaping: Achieving Unbiased Learning with LLM-Guided Knowledge AU - Xiefeng Wu PY - 2024 UR - https://arxiv.org/abs/2410.01458 ID - 2410.01458 ER -