TY - RPRT TI - Dynamic Rewarding with Prompt Optimization Enables Tuning-free Self-Alignment of Language Models AU - Somanshu Singla AU - Zhen Wang AU - Tianyang Liu AU - Abdullah Ashfaq AU - Zhiting Hu AU - Eric P. Xing PY - 2024 UR - https://arxiv.org/abs/2411.08733 ID - 2411.08733 ER -