TY - RPRT TI - Offline Reinforcement Learning of High-Quality Behaviors Under Robust Style Alignment AU - Mathieu Petitbois AU - Rémy Portelas AU - Sylvain Lamprier PY - 2026 UR - https://arxiv.org/abs/2601.22823 ID - 2601.22823 ER -