{"task":"Video Summarization","dataset":"Shot2Story20K","metric_names":["CIDEr","BLEU-4","METEOR","ROUGE"],"rows":[{"id":18500,"task":"Video Summarization","parent_task":"Video","dataset":"Shot2Story20K","model_name":"Shotluck-Holmes (3.1B)","metrics":{"BLEU-4":"7.67","CIDEr":"152.3","METEOR":"23.2","ROUGE":"43"},"paper_url":"https://arxiv.org/abs/2405.20648v2","paper_title":"Shotluck Holmes: A Family of Efficient Small-Scale Large Language Vision Models For Video Captioning and Summarization","paper_date":"2024-05-31","code_links":[{"title":"Skyline-9/Shotluck-Holmes","url":"https://github.com/Skyline-9/Shotluck-Holmes"}],"metrics_order":"[\"CIDEr\", \"BLEU-4\", \"METEOR\", \"ROUGE\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":18501,"task":"Video Summarization","parent_task":"Video","dataset":"Shot2Story20K","model_name":"SUM-shot","metrics":{"BLEU-4":"11.7","CIDEr":"8.6","METEOR":"19.7","ROUGE":"26.8"},"paper_url":"https://arxiv.org/abs/2312.10300v2","paper_title":"Shot2Story20K: A New Benchmark for Comprehensive Understanding of Multi-shot Videos","paper_date":"2023-12-16","code_links":[{"title":"bytedance/Shot2Story","url":"https://github.com/bytedance/Shot2Story"}],"metrics_order":"[\"CIDEr\", \"BLEU-4\", \"METEOR\", \"ROUGE\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":54673,"task":"Video Summarization","parent_task":null,"dataset":"Shot2Story20K","model_name":"Shotluck-Holmes (3.1B)","metrics":{"BLEU-4":"7.67","CIDEr":"152.3","METEOR":"23.2","ROUGE":"43"},"paper_url":"https://arxiv.org/abs/2405.20648v2","paper_title":"Shotluck Holmes: A Family of Efficient Small-Scale Large Language Vision Models For Video Captioning and Summarization","paper_date":"2024-05-31","code_links":[{"title":"Skyline-9/Shotluck-Holmes","url":"https://github.com/Skyline-9/Shotluck-Holmes"}],"metrics_order":"[\"CIDEr\", \"BLEU-4\", \"METEOR\", \"ROUGE\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":54674,"task":"Video Summarization","parent_task":null,"dataset":"Shot2Story20K","model_name":"SUM-shot","metrics":{"BLEU-4":"11.7","CIDEr":"8.6","METEOR":"19.7","ROUGE":"26.8"},"paper_url":"https://arxiv.org/abs/2312.10300v2","paper_title":"Shot2Story20K: A New Benchmark for Comprehensive Understanding of Multi-shot Videos","paper_date":"2023-12-16","code_links":[{"title":"bytedance/Shot2Story","url":"https://github.com/bytedance/Shot2Story"}],"metrics_order":"[\"CIDEr\", \"BLEU-4\", \"METEOR\", \"ROUGE\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]}]}