@misc{indiciae897893d7f520, title = {ExpertLongBench: Benchmarking Language Models on Expert-Level Long-Form Generation Tasks with Structured Checklists}, author = {Jie Ruan and Inderjeet Nair and Shuyang Cao and Amy Liu and Sheza Munir and Micah Pollens-Dempsey and Tiffany Chiang and Lucy Kates and Nicholas David and Sihan Chen and Ruxin Yang and Yuqian Yang and Jasmine Gump and Tessa Bialek and Vivek Sankaran and Margo Schlanger and Lu Wang}, year = {2025}, url = {https://arxiv.org/abs/2506.01241}, note = {Source identifier: 2506.01241} }