TY - RPRT TI - Reinforcement Learning in hyperbolic space for multi-step reasoning AU - Tao Xu AU - Dung-Yang Lee AU - Momiao Xiong PY - 2025 UR - https://arxiv.org/abs/2507.16864 ID - 2507.16864 ER -