TY - RPRT TI - Policy learning for time-bounded reachability in Continuous-Time Markov Decision Processes via doubly-stochastic gradient ascent AU - Ezio Bartocci AU - Luca Bortolussi AU - Tomǎš Brázdil AU - Dimitrios Milios AU - Guido Sanguinetti PY - 2016 UR - https://arxiv.org/abs/1605.09703 ID - 1605.09703 ER -