TY - RPRT TI - Reinforcement Learning for Dividend Optimization in Partially Observed Regime-Switching Diffusion Model AU - Zhongqin Gao AU - Yan Lv AU - Jingmin He PY - 2026 UR - https://arxiv.org/abs/2601.20387 ID - 2601.20387 ER -