@misc{indiciaead2056de3922, title = {Your Offline Policy is Not Trustworthy: Bilevel Reinforcement Learning for Sequential Portfolio Optimization}, author = {Haochen Yuan and Minting Pan and Yunbo Wang and Siyu Gao and Philip S. Yu and Xiaokang Yang}, year = {2025}, url = {https://arxiv.org/abs/2505.12759}, note = {Source identifier: 2505.12759} }