paper-with-me

Natural Language Moment Retrieval 벤치마크

Natural Language Moment Retrieval on MAD

8개 결과 · ⬇ CSV · JSON

R@1,IoU=0.1

0.09 4.393 8.695 13 17.3 2021-12 2026-09 CLIP — 6.57 (2021-12-01) VLG-Net — 3.5 (2021-12-01) Random Chance — 0.09 (2021-12-01) Zero-Shot CLIP + Guidance Model — 9.3 (2023-02-26) VLG-Net + Guidance Model — 5.6 (2023-02-26) RGNet — 12.43 (2023-12-11) ReVisionLLM — 17.3 (2024-11-22) DeCafNet — 13.25 (2025-05-22) CLIP — 6.57 (2021-12-01) Zero-Shot CLIP + Guidance Model — 9.3 (2023-02-26) RGNet — 12.43 (2023-12-11) ReVisionLLM — 17.3 (2024-11-22)
RankModel R@1,IoU=0.1R@1,IoU=0.3R@1,IoU=0.5R@10,IoU=0.1R@10,IoU=0.3R@10,IoU=0.5R@100,IoU=0.1R@100,IoU=0.3 PaperCodeYear
1 ReVisionLLM 17.312.76.7 ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos tanveer81/revisionllm 2024
2 DeCafNet 13.2510.967.06 DeCafNet: Delegate and Conquer for Efficient Temporal Grounding in Long Videos zijialewislu/cvpr2025-decafnet 2025
3 RGNet 12.439.485.61 RGNet: A Unified Clip Retrieval and Grounding Network for Long Videos tanveer81/revisionllm · tanveer81/rgnet 2023
4 Zero-Shot CLIP + Guidance Model 9.34.652.1624.3017.7311.0947.3539.58 Localizing Moments in Long Video Via Multimodal Guidance waybarrios/guidance-based-video-grounding 2023
5 CLIP 6.573.131.3920.2614.138.3847.7336.98 MAD: A Scalable Dataset for Language Grounding in Videos from Movie Audio Descriptions Soldelli/MAD 2021
6 VLG-Net + Guidance Model 5.604.282.4823.6419.8613.7255.5949.38 Localizing Moments in Long Video Via Multimodal Guidance waybarrios/guidance-based-video-grounding 2023
7 VLG-Net 3.502.631.6118.3215.210.1849.6543.95 MAD: A Scalable Dataset for Language Grounding in Videos from Movie Audio Descriptions Soldelli/MAD 2021
8 Random Chance 0.090.040.010.880.390.148.473.80 MAD: A Scalable Dataset for Language Grounding in Videos from Movie Audio Descriptions Soldelli/MAD 2021
1–8 / 8 페이지당 10 20 50 100