TY - RPRT TI - Detoxifying Large Language Models via Autoregressive Reward Guided Representation Editing AU - Yisong Xiao AU - Aishan Liu AU - Siyuan Liang AU - Zonghao Ying AU - Xianglong Liu AU - Dacheng Tao PY - 2025 UR - https://arxiv.org/abs/2510.01243 ID - 2510.01243 ER -