TY - RPRT TI - Policy learning under constraint: Maximizing a primary outcome while controlling an adverse event AU - Laura Fuentes-Vicente AU - Mathieu Even AU - Gaelle Dormion AU - Julie Josse AU - Antoine Chambaz PY - 2026 UR - https://arxiv.org/abs/2601.22717 ID - 2601.22717 ER -