TY - RPRT TI - DeepSeek-R1 vs. o3-mini: How Well can Reasoning LLMs Evaluate MT and Summarization? AU - Daniil Larionov AU - Sotaro Takeshita AU - Ran Zhang AU - Yanran Chen AU - Christoph Leiter AU - Zhipin Wang AU - Christian Greisinger AU - Steffen Eger PY - 2025 UR - https://arxiv.org/abs/2504.08120 ID - 2504.08120 ER -