TY - RPRT TI - RN-D: Discretized Categorical Actors for On-Policy Reinforcement Learning AU - Yuexin Bian AU - Jie Feng AU - Tao Wang AU - Yijiang Li AU - Sicun Gao AU - Yuanyuan Shi PY - 2026 UR - https://arxiv.org/abs/2601.23075 ID - 2601.23075 ER -