TY - RPRT TI - Token Preference Optimization with Self-Calibrated Visual-Anchored Rewards for Hallucination Mitigation AU - Jihao Gu AU - Yingyao Wang AU - Meng Cao AU - Pi Bu AU - Jun Song AU - Yancheng He AU - Shilong Li AU - Bo Zheng PY - 2025 UR - https://arxiv.org/abs/2412.14487 ID - 2412.14487 ER -