TY - RPRT TI - Safe Reinforcement Learning with Preference-based Constraint Inference AU - Chenglin Li AU - Grant Ruan AU - Hua Geng PY - 2026 UR - https://arxiv.org/abs/2603.23565 ID - 2603.23565 ER -