TY - RPRT TI - Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective AU - Haichuan Wang AU - Tao Lin AU - Lingkai Kong AU - Ce Li AU - Hezi Jiang AU - Milind Tambe PY - 2026 UR - https://arxiv.org/abs/2602.02572 ID - 2602.02572 ER -