TY - RPRT TI - An Efficient Task-Oriented Dialogue Policy: Evolutionary Reinforcement Learning Injected by Elite Individuals AU - Yangyang Zhao AU - Ben Niu AU - Libo Qin AU - Shihan Wang PY - 2025 UR - https://arxiv.org/abs/2506.03519 ID - 2506.03519 ER -