{"task":"Video Retrieval","dataset":"VATEX","metric_names":["text-to-video R@1","text-to-video R@5","text-to-video R@10","text-to-video R@50","text-to-video MedianR","text-to-video MeanR","video-to-text R@1","video-to-text R@10"],"rows":[{"id":590502,"task":"Video Retrieval","parent_task":null,"dataset":"VATEX","model_name":"Vote-in-Context","metrics":{"text-to-video R@1":"99.6"},"paper_url":"https://paperswithcode.com/paper/vote-in-context-turning-vlms-into-zero-shot-rank-fusers","paper_title":"Vote-in-Context: Turning VLMs into Zero-Shot Rank Fusers","paper_date":"2025-11-03","code_links":[],"metrics_order":null,"area":null,"uses_additional_data":null,"source":"auto","tags":[]},{"id":17085,"task":"Video Retrieval","parent_task":"Video","dataset":"VATEX","model_name":"GRAM","metrics":{"text-to-video R@1":"87.7","text-to-video R@10":"100","video-to-text R@1":"84.6","video-to-text R@10":"100"},"paper_url":"https://arxiv.org/abs/2412.11959v1","paper_title":"Gramian Multimodal Representation Learning and Alignment","paper_date":"2024-12-16","code_links":[{"title":"ispamm/GRAM","url":"https://github.com/ispamm/GRAM"},{"title":"luigisigillo/gwit","url":"https://github.com/luigisigillo/gwit"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":17086,"task":"Video Retrieval","parent_task":"Video","dataset":"VATEX","model_name":"VAST","metrics":{"text-to-video R@1":"83.0","text-to-video R@10":"99.2","text-to-video R@5":"98.2"},"paper_url":"https://arxiv.org/abs/2305.18500v2","paper_title":"VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset","paper_date":"2023-05-29","code_links":[{"title":"TXH-mercury/VALOR","url":"https://github.com/TXH-mercury/VALOR"},{"title":"txh-mercury/vast","url":"https://github.com/txh-mercury/vast"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":17087,"task":"Video Retrieval","parent_task":"Video","dataset":"VATEX","model_name":"VALOR","metrics":{"text-to-video R@1":"78.5","text-to-video R@10":"98.7","text-to-video R@5":"97.1"},"paper_url":"https://arxiv.org/abs/2304.08345v2","paper_title":"VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset","paper_date":"2023-04-17","code_links":[{"title":"TXH-mercury/VALOR","url":"https://github.com/TXH-mercury/VALOR"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":17088,"task":"Video Retrieval","parent_task":"Video","dataset":"VATEX","model_name":"InternVideo2-6B","metrics":{"text-to-video R@1":"75.5","video-to-text R@1":"89.3"},"paper_url":"https://arxiv.org/abs/2403.15377v4","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","paper_date":"2024-03-22","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"opengvlab/internvideo2","url":"https://github.com/opengvlab/internvideo2"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":17089,"task":"Video Retrieval","parent_task":"Video","dataset":"VATEX","model_name":"Unmasked Teacher","metrics":{"text-to-video R@1":"72","text-to-video R@10":"97.8","text-to-video R@5":"95.1","video-to-text R@1":"86.0","video-to-text R@10":"99.6"},"paper_url":"https://arxiv.org/abs/2303.16058v2","paper_title":"Unmasked Teacher: Towards Training-Efficient Video Foundation Models","paper_date":"2023-03-28","code_links":[{"title":"opengvlab/unmasked_teacher","url":"https://github.com/opengvlab/unmasked_teacher"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17090,"task":"Video Retrieval","parent_task":"Video","dataset":"VATEX","model_name":"InternVideo","metrics":{"text-to-video R@1":"71.1","video-to-text R@1":"87.2"},"paper_url":"https://arxiv.org/abs/2212.03191v2","paper_title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","paper_date":"2022-12-06","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"yingsen1/unimd","url":"https://github.com/yingsen1/unimd"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17091,"task":"Video Retrieval","parent_task":"Video","dataset":"VATEX","model_name":"Side4Video","metrics":{"text-to-video MedianR":"2.7","text-to-video R@1":"68.8","text-to-video R@10":"97.0","text-to-video R@5":"93.5","text-to-video R@50":"1.0"},"paper_url":"https://arxiv.org/abs/2311.15769v1","paper_title":"Side4Video: Spatial-Temporal Side Network for Memory-Efficient Image-to-Video Transfer Learning","paper_date":"2023-11-27","code_links":[{"title":"whwu95/ATM","url":"https://github.com/whwu95/ATM"},{"title":"HJYao00/Side4Video","url":"https://github.com/HJYao00/Side4Video"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17092,"task":"Video Retrieval","parent_task":"Video","dataset":"VATEX","model_name":"Cap4Video","metrics":{"text-to-video MeanR":"2.7","text-to-video MedianR":"1","text-to-video R@1":"66.6","text-to-video R@10":"97.0","text-to-video R@5":"93.1","video-to-text R@1":"80.9","video-to-text R@10":"99.6"},"paper_url":"https://arxiv.org/abs/2301.00184v3","paper_title":"Cap4Video: What Can Auxiliary Captions Do for Text-Video Retrieval?","paper_date":"2022-12-31","code_links":[{"title":"whwu95/Cap4Video","url":"https://github.com/whwu95/Cap4Video"},{"title":"whwu95/text4vis","url":"https://github.com/whwu95/text4vis"},{"title":"whwu95/GPT4Vis","url":"https://github.com/whwu95/GPT4Vis"},{"title":"whwu95/BIKE","url":"https://github.com/whwu95/BIKE"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17093,"task":"Video Retrieval","parent_task":"Video","dataset":"VATEX","model_name":"TeachCLIP","metrics":{"text-to-video R@1":"63.6","text-to-video R@10":"96.1","text-to-video R@5":"91.9"},"paper_url":"http://openaccess.thecvf.com//content/CVPR2024/html/Tian_Holistic_Features_are_almost_Sufficient_for_Text-to-Video_Retrieval_CVPR_2024_paper.html","paper_title":"Holistic Features are almost Sufficient for Text-to-Video Retrieval","paper_date":"2024-01-01","code_links":[{"title":"ruc-aimc-lab/teachclip","url":"https://github.com/ruc-aimc-lab/teachclip"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17094,"task":"Video Retrieval","parent_task":"Video","dataset":"VATEX","model_name":"TS2-Net","metrics":{"text-to-video R@1":"59.1","text-to-video R@10":"95.2"},"paper_url":"https://arxiv.org/abs/2207.07852v1","paper_title":"TS2-Net: Token Shift and Selection Transformer for Text-Video Retrieval","paper_date":"2022-07-16","code_links":[{"title":"yuqi657/ts2_net","url":"https://github.com/yuqi657/ts2_net"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17095,"task":"Video Retrieval","parent_task":"Video","dataset":"VATEX","model_name":"LAFF","metrics":{"text-to-video R@1":"59.1","text-to-video R@10":"91.7","text-to-video R@50":"96.3"},"paper_url":"https://arxiv.org/abs/2112.01832v3","paper_title":"Lightweight Attentional Feature Fusion: A New Baseline for Text-to-Video Retrieval","paper_date":"2021-12-03","code_links":[{"title":"ruc-aimc-lab/laff","url":"https://github.com/ruc-aimc-lab/laff"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":17096,"task":"Video Retrieval","parent_task":"Video","dataset":"VATEX","model_name":"QB-Norm+CLIP2Video","metrics":{"text-to-video R@1":"58.8","text-to-video R@10":"93.8"},"paper_url":"https://arxiv.org/abs/2112.12777v3","paper_title":"Cross Modal Retrieval with Querybank Normalisation","paper_date":"2021-12-23","code_links":[{"title":"ioanacroi/qb-norm","url":"https://github.com/ioanacroi/qb-norm"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":17097,"task":"Video Retrieval","parent_task":"Video","dataset":"VATEX","model_name":"CLIP2Video","metrics":{"text-to-video R@1":"57.3","text-to-video R@10":"90","text-to-video R@50":"95.5"},"paper_url":"https://arxiv.org/abs/2106.11097v1","paper_title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","paper_date":"2021-06-21","code_links":[{"title":"CryhanFang/CLIP2Video","url":"https://github.com/CryhanFang/CLIP2Video"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":109555,"task":"Video Retrieval","parent_task":null,"dataset":"VATEX","model_name":"GRAM","metrics":{"text-to-video R@1":"87.7","text-to-video R@10":"100","video-to-text R@1":"84.6","video-to-text R@10":"100"},"paper_url":"https://arxiv.org/abs/2412.11959v1","paper_title":"Gramian Multimodal Representation Learning and Alignment","paper_date":"2024-12-16","code_links":[{"title":"ispamm/GRAM","url":"https://github.com/ispamm/GRAM"},{"title":"luigisigillo/gwit","url":"https://github.com/luigisigillo/gwit"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":109556,"task":"Video Retrieval","parent_task":null,"dataset":"VATEX","model_name":"VAST","metrics":{"text-to-video R@1":"83.0","text-to-video R@10":"99.2","text-to-video R@5":"98.2"},"paper_url":"https://arxiv.org/abs/2305.18500v2","paper_title":"VAST: A Vision-Audio-Subtitle-Text Omni-Modality Foundation Model and Dataset","paper_date":"2023-05-29","code_links":[{"title":"TXH-mercury/VALOR","url":"https://github.com/TXH-mercury/VALOR"},{"title":"txh-mercury/vast","url":"https://github.com/txh-mercury/vast"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":109557,"task":"Video Retrieval","parent_task":null,"dataset":"VATEX","model_name":"VALOR","metrics":{"text-to-video R@1":"78.5","text-to-video R@10":"98.7","text-to-video R@5":"97.1"},"paper_url":"https://arxiv.org/abs/2304.08345v2","paper_title":"VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset","paper_date":"2023-04-17","code_links":[{"title":"TXH-mercury/VALOR","url":"https://github.com/TXH-mercury/VALOR"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":109558,"task":"Video Retrieval","parent_task":null,"dataset":"VATEX","model_name":"InternVideo2-6B","metrics":{"text-to-video R@1":"75.5","video-to-text R@1":"89.3"},"paper_url":"https://arxiv.org/abs/2403.15377v4","paper_title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","paper_date":"2024-03-22","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"opengvlab/internvideo2","url":"https://github.com/opengvlab/internvideo2"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":109559,"task":"Video Retrieval","parent_task":null,"dataset":"VATEX","model_name":"Unmasked Teacher","metrics":{"text-to-video R@1":"72","text-to-video R@10":"97.8","text-to-video R@5":"95.1","video-to-text R@1":"86.0","video-to-text R@10":"99.6"},"paper_url":"https://arxiv.org/abs/2303.16058v2","paper_title":"Unmasked Teacher: Towards Training-Efficient Video Foundation Models","paper_date":"2023-03-28","code_links":[{"title":"opengvlab/unmasked_teacher","url":"https://github.com/opengvlab/unmasked_teacher"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":109560,"task":"Video Retrieval","parent_task":null,"dataset":"VATEX","model_name":"InternVideo","metrics":{"text-to-video R@1":"71.1","video-to-text R@1":"87.2"},"paper_url":"https://arxiv.org/abs/2212.03191v2","paper_title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","paper_date":"2022-12-06","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"},{"title":"yingsen1/unimd","url":"https://github.com/yingsen1/unimd"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":109561,"task":"Video Retrieval","parent_task":null,"dataset":"VATEX","model_name":"Side4Video","metrics":{"text-to-video MedianR":"2.7","text-to-video R@1":"68.8","text-to-video R@10":"97.0","text-to-video R@5":"93.5","text-to-video R@50":"1.0"},"paper_url":"https://arxiv.org/abs/2311.15769v1","paper_title":"Side4Video: Spatial-Temporal Side Network for Memory-Efficient Image-to-Video Transfer Learning","paper_date":"2023-11-27","code_links":[{"title":"whwu95/ATM","url":"https://github.com/whwu95/ATM"},{"title":"HJYao00/Side4Video","url":"https://github.com/HJYao00/Side4Video"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":109562,"task":"Video Retrieval","parent_task":null,"dataset":"VATEX","model_name":"Cap4Video","metrics":{"text-to-video MeanR":"2.7","text-to-video MedianR":"1","text-to-video R@1":"66.6","text-to-video R@10":"97.0","text-to-video R@5":"93.1","video-to-text R@1":"80.9","video-to-text R@10":"99.6"},"paper_url":"https://arxiv.org/abs/2301.00184v3","paper_title":"Cap4Video: What Can Auxiliary Captions Do for Text-Video Retrieval?","paper_date":"2022-12-31","code_links":[{"title":"whwu95/Cap4Video","url":"https://github.com/whwu95/Cap4Video"},{"title":"whwu95/text4vis","url":"https://github.com/whwu95/text4vis"},{"title":"whwu95/GPT4Vis","url":"https://github.com/whwu95/GPT4Vis"},{"title":"whwu95/BIKE","url":"https://github.com/whwu95/BIKE"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":109563,"task":"Video Retrieval","parent_task":null,"dataset":"VATEX","model_name":"TeachCLIP","metrics":{"text-to-video R@1":"63.6","text-to-video R@10":"96.1","text-to-video R@5":"91.9"},"paper_url":"http://openaccess.thecvf.com//content/CVPR2024/html/Tian_Holistic_Features_are_almost_Sufficient_for_Text-to-Video_Retrieval_CVPR_2024_paper.html","paper_title":"Holistic Features are almost Sufficient for Text-to-Video Retrieval","paper_date":"2024-01-01","code_links":[{"title":"ruc-aimc-lab/teachclip","url":"https://github.com/ruc-aimc-lab/teachclip"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":109564,"task":"Video Retrieval","parent_task":null,"dataset":"VATEX","model_name":"TS2-Net","metrics":{"text-to-video R@1":"59.1","text-to-video R@10":"95.2"},"paper_url":"https://arxiv.org/abs/2207.07852v1","paper_title":"TS2-Net: Token Shift and Selection Transformer for Text-Video Retrieval","paper_date":"2022-07-16","code_links":[{"title":"yuqi657/ts2_net","url":"https://github.com/yuqi657/ts2_net"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":109565,"task":"Video Retrieval","parent_task":null,"dataset":"VATEX","model_name":"LAFF","metrics":{"text-to-video R@1":"59.1","text-to-video R@10":"91.7","text-to-video R@50":"96.3"},"paper_url":"https://arxiv.org/abs/2112.01832v3","paper_title":"Lightweight Attentional Feature Fusion: A New Baseline for Text-to-Video Retrieval","paper_date":"2021-12-03","code_links":[{"title":"ruc-aimc-lab/laff","url":"https://github.com/ruc-aimc-lab/laff"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":109566,"task":"Video Retrieval","parent_task":null,"dataset":"VATEX","model_name":"QB-Norm+CLIP2Video","metrics":{"text-to-video R@1":"58.8","text-to-video R@10":"93.8"},"paper_url":"https://arxiv.org/abs/2112.12777v3","paper_title":"Cross Modal Retrieval with Querybank Normalisation","paper_date":"2021-12-23","code_links":[{"title":"ioanacroi/qb-norm","url":"https://github.com/ioanacroi/qb-norm"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":109567,"task":"Video Retrieval","parent_task":null,"dataset":"VATEX","model_name":"CLIP2Video","metrics":{"text-to-video R@1":"57.3","text-to-video R@10":"90","text-to-video R@50":"95.5"},"paper_url":"https://arxiv.org/abs/2106.11097v1","paper_title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","paper_date":"2021-06-21","code_links":[{"title":"CryhanFang/CLIP2Video","url":"https://github.com/CryhanFang/CLIP2Video"}],"metrics_order":"[\"text-to-video R@1\", \"text-to-video R@5\", \"text-to-video R@10\", \"text-to-video R@50\", \"text-to-video MedianR\", \"text-to-video MeanR\", \"video-to-text R@1\", \"video-to-text R@10\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]}]}