@misc{indiciae6b745879428d, title = {Video-VoT-R1: An efficient video inference model integrating image packing and AoE architecture}, author = {Cheng Li and Jiexiong Liu and Yixuan Chen and Yanqin Jia}, year = {2025}, url = {https://arxiv.org/abs/2503.15807}, note = {Source identifier: 2503.15807} }