TY - RPRT TI - Min Max Generalization for Two-stage Deterministic Batch Mode Reinforcement Learning: Relaxation Schemes AU - Raphael Fonteneau AU - Damien Ernst AU - Bernard Boigelot AU - Quentin Louveaux PY - 2012 UR - https://arxiv.org/abs/1202.5298 ID - 1202.5298 ER -