TY - RPRT TI - Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data AU - Han Xia AU - Songyang Gao AU - Qiming Ge AU - Zhiheng Xi AU - Qi Zhang AU - Xuanjing Huang PY - 2024 UR - https://arxiv.org/abs/2408.14874 ID - 2408.14874 ER -