@misc{indiciae5a7341cb6f45, title = {Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization}, author = {Tanmay Ambadkar and Sourav Panda and Shreyash Kale and Jonathan Dodge and Abhinav Verma}, year = {2026}, url = {https://arxiv.org/abs/2602.07764}, note = {Source identifier: 2602.07764} }