@misc{indiciae12d1fe93c95e, title = {Policy learning for time-bounded reachability in Continuous-Time Markov Decision Processes via doubly-stochastic gradient ascent}, author = {Ezio Bartocci and Luca Bortolussi and Tomǎš Brázdil and Dimitrios Milios and Guido Sanguinetti}, year = {2016}, url = {https://arxiv.org/abs/1605.09703}, note = {Source identifier: 1605.09703} }