@misc{indiciae103a55a12951, title = {VETO: Video Efficient Token Optimization for Vision Language Models}, author = {Gueter Josmy Faure and Hao Ping Wang and Min-Hung Chen and Winston H. Hsu}, year = {2026}, url = {https://arxiv.org/abs/2610.01785}, note = {Source identifier: 2610.01785} }