TY - RPRT TI - Linear combination of one-step predictive information with an external reward in an episodic policy gradient setting: a critical analysis AU - Keyan Zahedi AU - Georg Martius AU - Nihat Ay PY - 2013 UR - https://arxiv.org/abs/1309.6989 ID - 1309.6989 ER -