TY - RPRT TI - Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos AU - Hao Zheng AU - Jinyi Huang AU - Tiantian Zheng AU - Xun Xu AU - Tuka Alhanai PY - 2026 UR - https://arxiv.org/abs/2607.10797 ID - 2607.10797 ER -