@article{videollmknowswhentospeakenhancingtime, title = {VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format}, author = {Yueqian Wang and Xiaojun Meng and Yuxuan Wang and Jianxin Liang and Jiansheng Wei and Huishuai Zhang and Dongyan Zhao}, year = {2024}, eprint = {2411.17991}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2411.17991v1}, }