TY - RPRT TI - Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward AU - Mustafa Anis Hussain AU - Xinle Wu AU - Yao Lu PY - 2026 UR - https://arxiv.org/abs/2605.30824 ID - 2605.30824 ER -