TY - RPRT TI - Long-term User Engagement Optimization through Model-agnostic Downstream Rewards Learning AU - Dingsu Wang AU - Filip Ryzner AU - Kelly He AU - Armando Ordorica AU - David Woo AU - Aditya Mantha AU - Liyao Lu AU - Usha Amrutha Nookala AU - Haoran Guo AU - Jiacong He AU - Olafur Gudmundsson AU - Matt Chun AU - Krystal Benitez AU - Haibin Xie AU - Alekhya Pyla AU - Sameer Jain AU - Zhongjian Jiang AU - Shruthi Hariharan AU - Dhruvil Deven Badani AU - Yijie Dylan Wang PY - 2026 DO - 10.1145/3773078.3831912 UR - https://arxiv.org/abs/2607.14192 ID - 2607.14192 ER -