TY - RPRT TI - A Reinforcement Learning Method for Environments with Stochastic Variables: Post-Decision Proximal Policy Optimization with Dual Critic Networks AU - Leonardo Kanashiro Felizardo AU - Edoardo Fadda AU - Paolo Brandimarte AU - Emilio Del-Moral-Hernandez AU - MariĆ” Cristina Vasconcelos Nascimento PY - 2025 DO - 10.1109/ijcnn64981.2025.11227565 UR - https://arxiv.org/abs/2504.05150 ID - 2504.05150 ER -