@article{improvingjointaudiovideogenerationwithcr, title = {Improving Joint Audio-Video Generation with Cross-Modal Context Learning}, author = {Bingqi Ma and Linlong Lang and Ming Zhang and Dailan He and Xingtong Ge and Yi Zhang and Guanglu Song and Yu Liu}, year = {2026}, eprint = {2603.18600}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2603.18600}, }