TY - RPRT TI - MaPPO: Maximum a Posteriori Preference Optimization with Prior Knowledge AU - Guangchen Lan AU - Sipeng Zhang AU - Tianle Wang AU - Yuwei Zhang AU - Daoan Zhang AU - Xinpeng Wei AU - Xiaoman Pan AU - Hongming Zhang AU - Dong-Jun Han AU - Christopher G. Brinton PY - 2026 UR - https://arxiv.org/abs/2507.21183 ID - 2507.21183 ER -