TY - RPRT TI - PersoDPO: Scalable Preference Optimization for Instruction-Adherent, Persona-Grounded Dialogue via Multi-LLM Evaluation AU - Saleh Afzoon AU - MohammadHossein Ahmadi AU - Usman Naseem AU - Amin Beheshti PY - 2026 UR - https://arxiv.org/abs/2602.04493 ID - 2602.04493 ER -