TY - RPRT TI - Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs AU - Wang Wei AU - Tiankai Yang AU - Hongjie Chen AU - Yue Zhao AU - Franck Dernoncourt AU - Ryan A. Rossi AU - Hoda Eldardiry PY - 2025 UR - https://arxiv.org/abs/2510.07429 ID - 2510.07429 ER -