@misc{indiciae246e6c90e0d5, title = {VEGAS: Human-Aligned Video Caption Evaluation via Gaze}, author = {Shenghui Chen and Po-han Li and Ximeng Sun and Shijia Yang and Emad Barsoum and Zicheng Liu and Sandeep Chinchali and Ufuk Topcu}, year = {2026}, url = {https://arxiv.org/abs/2607.08489}, note = {Source identifier: 2607.08489} }