TY - RPRT TI - LANPO: Bootstrapping Language and Numerical Feedback for Reinforcement Learning in LLMs AU - Ang Li AU - Yifei Wang AU - Zhihang Yuan AU - Stefanie Jegelka AU - Yisen Wang PY - 2025 UR - https://arxiv.org/abs/2510.16552 ID - 2510.16552 ER -