TY - RPRT TI - Self-Explore: Enhancing Mathematical Reasoning in Language Models with Fine-grained Rewards AU - Hyeonbin Hwang AU - Doyoung Kim AU - Seungone Kim AU - Seonghyeon Ye AU - Minjoon Seo PY - 2024 UR - https://arxiv.org/abs/2404.10346 ID - 2404.10346 ER -