TY - RPRT TI - Policy Split: Incentivizing Dual-Mode Exploration in LLM Reinforcement with Dual-Mode Entropy Regularization AU - Jiashu Yao AU - Heyan Huang AU - Daiqing Wu AU - Zeming Liu AU - Yuhang Guo PY - 2026 UR - https://arxiv.org/abs/2604.11510 ID - 2604.11510 ER -