TY - RPRT TI - Bayesian learning of the optimal action-value function in a Markov decision process AU - Jiaqi Guo AU - Chon Wai Ho AU - Sumeetpal S. Singh PY - 2025 UR - https://arxiv.org/abs/2505.01859 ID - 2505.01859 ER -