TY - RPRT TI - Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization AU - Tanmay Ambadkar AU - Sourav Panda AU - Shreyash Kale AU - Jonathan Dodge AU - Abhinav Verma PY - 2026 UR - https://arxiv.org/abs/2602.07764 ID - 2602.07764 ER -