TY - RPRT TI - Human Implicit Preference-Based Policy Fine-tuning for Multi-Agent Reinforcement Learning in USV Swarm AU - Hyeonjun Kim AU - Kanghoon Lee AU - Junho Park AU - Jiachen Li AU - Jinkyoo Park PY - 2025 UR - https://arxiv.org/abs/2503.03796 ID - 2503.03796 ER -