TY - RPRT TI - An Online Multiobjective Policy Gradient for Long-run Average-reward Markov Decision Process AU - Rahul Misra AU - Manuela L. Bujorianu AU - RafaƂ Wisniewski PY - 2025 UR - https://arxiv.org/abs/2511.13034 ID - 2511.13034 ER -