TY - RPRT TI - Two-Stage Reinforcement Learning for Sound and Adversarial Test Generation in Code LLMs AU - Jiacheng Xu AU - Wentao Zhang AU - Zhiyi Lyu AU - Fuxiang Zhang AU - Chaojie Wang AU - Yang Liu AU - Bo An PY - 2026 UR - https://arxiv.org/abs/2609.03955 ID - 2609.03955 ER -