TY - RPRT TI - Reasoning over mathematical objects: on-policy reward modeling and test time aggregation AU - Pranjal Aggarwal AU - Marjan Ghazvininejad AU - Seungone Kim AU - Ilia Kulikov AU - Jack Lanchantin AU - Xian Li AU - Tianjian Li AU - Bo Liu AU - Graham Neubig AU - Anaelia Ovalle AU - Swarnadeep Saha AU - Sainbayar Sukhbaatar AU - Sean Welleck AU - Jason Weston AU - Chenxi Whitehouse AU - Adina Williams AU - Jing Xu AU - Ping Yu AU - Weizhe Yuan AU - Jingyu Zhang AU - Wenting Zhao PY - 2026 UR - https://arxiv.org/abs/2603.18886 ID - 2603.18886 ER -