TY - RPRT TI - Reinforcement Learning with Inverse Rewards for World Model Post-training AU - Yang Ye AU - Tianyu He AU - Shuo Yang AU - Jiang Bian PY - 2025 UR - https://arxiv.org/abs/2509.23958 ID - 2509.23958 ER -