TY - RPRT TI - ExpertLongBench: Benchmarking Language Models on Expert-Level Long-Form Generation Tasks with Structured Checklists AU - Jie Ruan AU - Inderjeet Nair AU - Shuyang Cao AU - Amy Liu AU - Sheza Munir AU - Micah Pollens-Dempsey AU - Tiffany Chiang AU - Lucy Kates AU - Nicholas David AU - Sihan Chen AU - Ruxin Yang AU - Yuqian Yang AU - Jasmine Gump AU - Tessa Bialek AU - Vivek Sankaran AU - Margo Schlanger AU - Lu Wang PY - 2025 UR - https://arxiv.org/abs/2506.01241 ID - 2506.01241 ER -