@misc{indiciae479fbf7e9b4e, title = {LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description}, author = {Yizhang Jin and Jian Li and Jiangning Zhang and Jianlong Hu and Zhenye Gan and Xin Tan and Yong Liu and Yabiao Wang and Chengjie Wang and Lizhuang Ma}, year = {2024}, url = {https://arxiv.org/abs/2408.04957}, note = {Source identifier: 2408.04957} }