@misc{indiciae1b03abd80453, title = {VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model}, author = {Hanqing Wang and Mingyu Liu and Xiaoyu Chen and Chengwei MA and Yiming Zhong and Wenti Yin and Yuhao Liu and Zhiqing Cui and Jiahao Yuan and Lu Dai and Zhiyuan Ma and Hui Xiong}, year = {2026}, url = {https://arxiv.org/abs/2602.09638}, note = {Source identifier: 2602.09638} }