TY - RPRT TI - Dynamic Minimax Regret Optimization for Robust LLM Post-Training AU - Chengbo Zang AU - Haoyu Dong AU - Mehmet Kerem Turkcan AU - Gil Zussman AU - Zoran Kostic AU - Javad Ghaderi PY - 2026 UR - https://arxiv.org/abs/2610.06329 ID - 2610.06329 ER -