paper-with-me

Referring Video Object Segmentation 벤치마크

Referring Video Object Segmentation on Refer-YouTube-VOS

36개 결과 · ⬇ CSV · JSON

J&F

36.4 45.73 55.05 64.38 73.7 2019-04 2026-09 CMSA — 36.4 (2019-04-09) CMSA — 36.4 (2019-04-09) ReferFormer (Large) — 62.9 (2022-01-03) ReferFormer (Large) — 62.9 (2022-01-03) R2VOS (Swin-T) — 60.2 (2022-07-04) R2VOS (Swin-T) — 60.2 (2022-07-04) VLT — 63.8 (2022-10-28) VLT — 63.8 (2022-10-28) HTML-SwinL — 63.4 (2023-01-01) HTML-Video-SwinB — 63.4 (2023-01-01) HTML-Video-SwinS — 61.4 (2023-01-01) HTML-Video-SwinT — 61.2 (2023-01-01) HTML-ResNet101 — 58.5 (2023-01-01) HTML-ResNet50 — 57.8 (2023-01-01) HTML-SwinL — 63.4 (2023-01-01) HTML-Video-SwinB — 63.4 (2023-01-01) HTML-Video-SwinS — 61.4 (2023-01-01) HTML-Video-SwinT — 61.2 (2023-01-01) HTML-ResNet101 — 58.5 (2023-01-01) HTML-ResNet50 — 57.8 (2023-01-01) SOC — 66.0 (2023-05-26) SOC — 66.0 (2023-05-26) SgMg — 65.7 (2023-07-25) SgMg — 65.7 (2023-07-25) GLEE-Pro — 70.6 (2023-12-14) GLEE-Plus — 67.7 (2023-12-14) GLEE-Pro — 70.6 (2023-12-14) GLEE-Plus — 67.7 (2023-12-14) HTR — 67.1 (2024-03-28) HTR — 67.1 (2024-03-28) VATEX — 65.4 (2024-04-12) VATEX — 65.4 (2024-04-12) HyperSeg — 68.5 (2024-11-26) HyperSeg — 68.5 (2024-11-26) FindTrack — 73.7 (2025-03-05) FindTrack — 73.7 (2025-03-05) CMSA — 36.4 (2019-04-09) ReferFormer (Large) — 62.9 (2022-01-03) VLT — 63.8 (2022-10-28) SOC — 66.0 (2023-05-26) GLEE-Pro — 70.6 (2023-12-14) FindTrack — 73.7 (2025-03-05)
RankModel J&FJF Extra Training Data PaperCodeYear
21 HyperSeg 68.5 HyperSeg: Towards Universal Visual Segmentation with Large Language Model congvvc/HyperSeg 2024
22 GLEE-Plus 67.765.669.7 General Object Foundation Model for Images and Videos at Scale FoundationVision/GLEE 2023
23 HTR 67.165.368.9 Temporally Consistent Referring Video Object Segmentation with Hybrid Memory bo-miao/HTR 2024
24 SOC 66.064.167.9 SOC: Semantic-Assisted Object Cluster for Referring Video Object Segmentation RobertLuo1/NeurIPS2023_SOC 2023
25 SgMg 65.763.967.4 Spectrum-guided Multi-granularity Referring Video Object Segmentation bo-miao/sgmg 2023
26 VATEX 65.463.367.5 Vision-Aware Text Features in Referring Image Segmentation: From Object Understanding to Context Understanding nero1342/VATEX 2024
27 VLT 63.861.965.6 VLT: Vision-Language Transformer and Query Generation for Referring Segmentation henghuiding/Vision-Language-Transformer 2022
28 HTML-SwinL 63.461.565.3 HTML: Hybrid Temporal-scale Multimodal Learning Framework for Referring Video Object Segmentation 2023
28 HTML-Video-SwinB 63.461.565.2 HTML: Hybrid Temporal-scale Multimodal Learning Framework for Referring Video Object Segmentation 2023
30 ReferFormer (Large) 62.961.364.6 Language as Queries for Referring Video Object Segmentation wjn922/referformer 2022
31 HTML-Video-SwinS 61.459.962.9 HTML: Hybrid Temporal-scale Multimodal Learning Framework for Referring Video Object Segmentation 2023
32 HTML-Video-SwinT 61.259.563.0 HTML: Hybrid Temporal-scale Multimodal Learning Framework for Referring Video Object Segmentation 2023
33 R2VOS (Swin-T) 60.258.961.5 Towards Robust Referring Video Object Segmentation with Cyclic Relational Consensus lxa9867/R2VOS 2022
34 HTML-ResNet101 58.557.359.8 HTML: Hybrid Temporal-scale Multimodal Learning Framework for Referring Video Object Segmentation 2023
35 HTML-ResNet50 57.856.559.0 HTML: Hybrid Temporal-scale Multimodal Learning Framework for Referring Video Object Segmentation 2023
36 CMSA 36.434.838.1 Cross-Modal Self-Attention Network for Referring Image Segmentation lwye/CMSA-Net 2019
← 이전 21–36 / 36 페이지당 10 20 50 100