TY - RPRT TI - Toward the Evaluation of Large Language Models Considering Score Variance across Instruction Templates AU - Yusuke Sakai AU - Adam Nohejl AU - Jiangnan Hang AU - Hidetaka Kamigaito AU - Taro Watanabe PY - 2024 UR - https://arxiv.org/abs/2408.12263 ID - 2408.12263 ER -