TY - RPRT TI - Agentic Reinforcement Learning for Search Misaligns Instruction-Tuning AU - Yushi Yang AU - Shreyansh Padarha AU - Sarah Ball AU - Andrew Lee AU - Adam Mahdi PY - 2026 UR - https://arxiv.org/abs/2510.17431 ID - 2510.17431 ER -