TY - RPRT TI - Bayesian Conservative Policy Optimization (BCPO): A Novel Uncertainty-Calibrated Offline Reinforcement Learning with Credible Lower Bounds AU - Debashis Chatterjee PY - 2026 UR - https://arxiv.org/abs/2603.12284 ID - 2603.12284 ER -