@article{synchronizedaudiovisualframeswith, title = {Synchronized Audio-Visual Frames with Fractional Positional Encoding for Transformers in Video-to-Text Translation}, author = {Philipp Harzig and Moritz Einfalt and Rainer Lienhart}, year = {2021}, eprint = {2112.14088}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2112.14088v1}, }