TY - RPRT TI - Your Offline Policy is Not Trustworthy: Bilevel Reinforcement Learning for Sequential Portfolio Optimization AU - Haochen Yuan AU - Minting Pan AU - Yunbo Wang AU - Siyu Gao AU - Philip S. Yu AU - Xiaokang Yang PY - 2025 UR - https://arxiv.org/abs/2505.12759 ID - 2505.12759 ER -