TY - RPRT TI - Learning Optimal and Sample-Efficient Decision Policies with Guarantees AU - Daqian Shao PY - 2026 UR - https://arxiv.org/abs/2602.17978 ID - 2602.17978 ER -