@misc{indiciae2aec06fe21a4, title = {HPE-CogVLM: Advancing Vision Language Models with a Head Pose Grounding Task}, author = {Yu Tian and Tianqi Shao and Tsukasa Demizu and Xuyang Wu and Hsin-Tai Wu}, year = {2026}, doi = {10.1109/tcsvt.2026.3675940}, url = {https://arxiv.org/abs/2406.01914}, note = {Source identifier: 2406.01914} }