@misc{indiciaeef08e7fa6073, title = {Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data}, author = {Han Xia and Songyang Gao and Qiming Ge and Zhiheng Xi and Qi Zhang and Xuanjing Huang}, year = {2024}, url = {https://arxiv.org/abs/2408.14874}, note = {Source identifier: 2408.14874} }