@article{spatiotemporalscenegraphsforvideodialog, title = {Dynamic Graph Representation Learning for Video Dialog via Multi-Modal Shuffled Transformers}, author = {Shijie Geng and Peng Gao and Moitreya Chatterjee and Chiori Hori and Jonathan Le Roux and Yongfeng Zhang and Hongsheng Li and Anoop Cherian}, year = {2020}, eprint = {2007.03848}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2007.03848v2}, }