TY - RPRT TI - Optimism in Reinforcement Learning and Kullback-Leibler Divergence AU - Sarah Filippi AU - Olivier Cappé AU - Aurélien Garivier PY - 2010 DO - 10.1109/allerton.2010.5706896 UR - https://arxiv.org/abs/1004.5229 ID - 1004.5229 ER -