TY - RPRT TI - Reinforcement Learning for LLM Post-Training: A Survey AU - Zhichao Wang AU - Kiran Ramnath AU - Bin Bi AU - Shiva Kumar Pentyala AU - Sougata Chaudhuri AU - Shubham Mehrotra AU - Zixu AU - Zhu AU - Xiang-Bo Mao AU - Sitaram Asur AU - Na AU - Cheng PY - 2026 UR - https://arxiv.org/abs/2407.16216 ID - 2407.16216 ER -