@article{achallengingmultimodalvideosummary, title = {A Challenging Multimodal Video Summary: Simultaneously Extracting and Generating Keyframe-Caption Pairs from Video}, author = {Keito Kudo and Haruki Nagasawa and Jun Suzuki and Nobuyuki Shimizu}, year = {2023}, eprint = {2312.01575}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2312.01575v1}, }