@misc{indiciae68214f343c4b, title = {Building a Video-and-Language Dataset with Human Actions for Multimodal Logical Inference}, author = {Riko Suzuki and Hitomi Yanaka and Koji Mineshima and Daisuke Bekki}, year = {2021}, url = {https://arxiv.org/abs/2106.14137}, note = {Source identifier: 2106.14137} }