@misc{indiciae5b9f194b91bf, title = {StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models}, author = {Zhe Liu and Jinghua Hou and Yuxiang Lu and Zhenya Yang and Xianzhe Fan and Junwei Luo and Junyi Li and Ruihua Han and Zhi Hou and Hengshuang Zhao}, year = {2026}, url = {https://arxiv.org/abs/2608.26067}, note = {Source identifier: 2608.26067} }