TY - RPRT TI - Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning AU - Pan Lu AU - Liang Qiu AU - Kai-Wei Chang AU - Ying Nian Wu AU - Song-Chun Zhu AU - Tanmay Rajpurohit AU - Peter Clark AU - Ashwin Kalyan PY - 2023 UR - https://arxiv.org/abs/2209.14610 ID - 2209.14610 ER -