@misc{indiciae7a1ab3340083, title = {HENASY: Learning to Assemble Scene-Entities for Egocentric Video-Language Model}, author = {Khoa Vo and Thinh Phan and Kashu Yamazaki and Minh Tran and Ngan Le}, year = {2024}, url = {https://arxiv.org/abs/2406.00307}, note = {Source identifier: 2406.00307} }