TY - RPRT TI - A general Markov decision process formalism for action-state entropy-regularized reward maximization AU - Dmytro Grytskyy AU - Jorge Ramírez-Ruiz AU - Rubén Moreno-Bote PY - 2023 UR - https://arxiv.org/abs/2302.01098 ID - 2302.01098 ER -