@misc{indiciae84e5edbd75d6, title = {Improving Vision-Language-Action Model Fine-Tuning with Structured Stage and Keyframe Supervision}, author = {Yuan Xu and Yixiang Chen and Kai Wang and Jiabing Yang and Peiyan Li and Qisen Ma and Yan Huang and Liang Wang}, year = {2026}, url = {https://arxiv.org/abs/2606.26801}, note = {Source identifier: 2606.26801} }