@misc{indiciaea2bb7a3655bc, title = {DepthCache: Depth-Guided Training-Free Visual Token Merging for Vision-Language-Action Model Inference}, author = {Yuquan Li and Lianjie Ma and Han Ding and Lijun Zhu}, year = {2026}, url = {https://arxiv.org/abs/2603.10469}, note = {Source identifier: 2603.10469} }