TY - RPRT TI - Q-Probe: A Lightweight Approach to Reward Maximization for Language Models AU - Kenneth Li AU - Samy Jelassi AU - Hugh Zhang AU - Sham Kakade AU - Martin Wattenberg AU - David Brandfonbrener PY - 2024 UR - https://arxiv.org/abs/2402.14688 ID - 2402.14688 ER -