TY - RPRT TI - Convergence of Neural Network Policies for Risk--Reward Optimization AU - Chang Chen AU - Duy-Minh Dang PY - 2026 UR - https://arxiv.org/abs/2603.06563 ID - 2603.06563 ER -