TY - RPRT TI - Reinforcement learning from comparisons: Three alternatives is enough, two is not AU - Benoit Laslier AU - Jean-Francois Laslier PY - 2013 UR - https://arxiv.org/abs/1301.5734 ID - 1301.5734 ER -