TY - RPRT TI - Spark-LLM-Eval: A Distributed Framework for Statistically Rigorous Large Language Model Evaluation AU - Subhadip Mitra PY - 2026 UR - https://arxiv.org/abs/2603.28769 ID - 2603.28769 ER -