TY - RPRT TI - PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding? AU - Mennatullah Siam PY - 2025 UR - https://arxiv.org/abs/2509.02807 ID - 2509.02807 ER -