{"task":"Video Captioning","dataset":"TVC","metric_names":["BLEU-4","CIDEr"],"rows":[{"id":47335,"task":"Video Captioning","parent_task":null,"dataset":"TVC","model_name":"VAST","metrics":{"BLEU-4":"19.9","CIDEr":"74.1"},"paper_url":"https://arxiv.org/abs/2305.18500v2","paper_title":"VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset","paper_date":"2023-05-29","code_links":[{"title":"TXH-mercury/VALOR","url":"https://github.com/TXH-mercury/VALOR"},{"title":"txh-mercury/vast","url":"https://github.com/txh-mercury/vast"}],"metrics_order":"[\"BLEU-4\", \"CIDEr\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":47336,"task":"Video Captioning","parent_task":null,"dataset":"TVC","model_name":"COSA","metrics":{"BLEU-4":"18.8","CIDEr":"70.7"},"paper_url":"https://arxiv.org/abs/2306.09085v1","paper_title":"COSA: Concatenated Sample Pretrained Vision-Language Foundation Model","paper_date":"2023-06-15","code_links":[{"title":"txh-mercury/cosa","url":"https://github.com/txh-mercury/cosa"}],"metrics_order":"[\"BLEU-4\", \"CIDEr\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]}]}