@misc{indiciae72c9c8c14437, title = {Why is Your Language Model a Poor Implicit Reward Model?}, author = {Noam Razin and Yong Lin and Jiarui Yao and Sanjeev Arora}, year = {2026}, url = {https://arxiv.org/abs/2507.07981}, note = {Source identifier: 2507.07981} }