TY - RPRT TI - OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction AU - Huang Huang AU - Fangchen Liu AU - Letian Fu AU - Tingfan Wu AU - Mustafa Mukadam AU - Jitendra Malik AU - Ken Goldberg AU - Pieter Abbeel PY - 2025 UR - https://arxiv.org/abs/2503.03734 ID - 2503.03734 ER -