TY - RPRT TI - PARM: Multi-Objective Test-Time Alignment via Preference-Aware Autoregressive Reward Model AU - Baijiong Lin AU - Weisen Jiang AU - Yuancheng Xu AU - Hao Chen AU - Ying-Cong Chen PY - 2025 UR - https://arxiv.org/abs/2505.06274 ID - 2505.06274 ER -