TY - RPRT TI - Reinforcement Learning Towards Broadly and Persistently Beneficial Models AU - Akshay V. Jagadeesh AU - Rahul K. Arora AU - Khaled Saab AU - Ali Malik AU - Mikhail Trofimov AU - Foivos Tsimpourlas AU - Johannes Heidecke AU - Karan Singhal PY - 2026 UR - https://arxiv.org/abs/2606.24014 ID - 2606.24014 ER -