TY - RPRT TI - Measuring Reward Hacking and Reasoning-Answer Decoupling Under Position-Confounded Optimization AU - Suyash Maniyar AU - Armaan Sandhu AU - Abhishek Mishra PY - 2026 UR - https://arxiv.org/abs/2608.15445 ID - 2608.15445 ER -