TY - RPRT TI - Adaptive Learning via Off-Model Training and Importance Sampling for Fully Non-Markovian Optimal Stochastic Control. Complete version AU - Dorival Leão AU - Alberto Ohashi AU - Simone Scotti AU - Adolfo M. D da Silva PY - 2026 UR - https://arxiv.org/abs/2604.13147 ID - 2604.13147 ER -