TY - RPRT TI - From Supervision to Exploration: What Does Protein Language Model Learn During Reinforcement Learning? AU - Hanqun Cao AU - Hongrui Zhang AU - Junde Xu AU - Zhou Zhang AU - Lingdong Shen AU - Minghao Sun AU - Ge Liu AU - Jinbo Xu AU - Wu-Jun Li AU - Jinren Ni AU - Cesar de la Fuente-Nunez AU - Tianfan Fu AU - Yejin Choi AU - Pheng-Ann Heng AU - Fang Wu PY - 2025 UR - https://arxiv.org/abs/2510.01571 ID - 2510.01571 ER -