TY - RPRT TI - LLMs for High-Frequency Decision-Making: Normalized Action Reward-Guided Consistency Policy Optimization AU - Yang Zhao AU - Zihao Li AU - Zhiyu Jiang AU - Dandan Ma AU - Ganchao Liu AU - Wenzhe Zhao PY - 2026 UR - https://arxiv.org/abs/2603.02680 ID - 2603.02680 ER -