@misc{indiciae63ee3dca0eda, title = {Benchmarking Reinforcement Learning via Stochastic Converse Optimality: Generating Systems with Known Optimal Policies}, author = {Sinan Ibrahim and Grégoire Ouerdane and Hadi Salloum and Henni Ouerdane and Stefan Streif and Pavel Osinenko}, year = {2026}, url = {https://arxiv.org/abs/2603.17631}, note = {Source identifier: 2603.17631} }