{"task":"Referring Video Object Segmentation","dataset":"MeViS","metric_names":["J&F","J","F"],"rows":[{"id":16851,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"MPG-SAM 2","metrics":{"F":"56.7","J":"50.7","J&F":"53.7"},"paper_url":"https://arxiv.org/abs/2501.13667v1","paper_title":"MPG-SAM 2: Adapting SAM 2 with Mask Priors and Global Context for Referring Video Object Segmentation","paper_date":"2025-01-23","code_links":[{"title":"rongfu-dsb/MPG-SAM2","url":"https://github.com/rongfu-dsb/MPG-SAM2"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16852,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"FindTrack","metrics":{"F":"55.9","J":"50.5","J&F":"53.2"},"paper_url":"https://arxiv.org/abs/2503.03492v1","paper_title":"Find First, Track Next: Decoupling Identification and Propagation in Referring Video Object Segmentation","paper_date":"2025-03-05","code_links":[{"title":"suhwan-cho/FindTrack","url":"https://github.com/suhwan-cho/FindTrack"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16853,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"GLUS","metrics":{"F":"54.2","J":"48.5","J&F":"51.3"},"paper_url":"https://arxiv.org/abs/2504.07962v1","paper_title":"GLUS: Global-Local Reasoning Unified into A Single Large Language Model for Video Segmentation","paper_date":"2025-04-10","code_links":[{"title":"GLUS-video/GLUS","url":"https://github.com/GLUS-video/GLUS"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16854,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"VRS-HQ (Chat-UniVi-13B)","metrics":{"F":"53.7","J":"48","J&F":"50.9"},"paper_url":"https://arxiv.org/abs/2501.08549v1","paper_title":"The Devil is in Temporal Token: High Quality Video Reasoning Segmentation","paper_date":"2025-01-15","code_links":[{"title":"sitonggong/vrs-hq","url":"https://github.com/sitonggong/vrs-hq"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16855,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"ReferDINO (Swin-B)","metrics":{"F":"53.9","J":"44.7","J&F":"49.3"},"paper_url":"https://arxiv.org/abs/2501.14607v1","paper_title":"ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations","paper_date":"2025-01-24","code_links":[],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16856,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"SAMWISE","metrics":{"F":"51.2","J":"45.4","J&F":"48.3"},"paper_url":"https://arxiv.org/abs/2411.17646v2","paper_title":"SAMWISE: Infusing Wisdom in SAM2 for Text-Driven Video Segmentation","paper_date":"2024-11-26","code_links":[{"title":"claudiacuttano/samwise","url":"https://github.com/claudiacuttano/samwise"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16857,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"DsHmp + MTCM","metrics":{"F":"51.1","J":"44.1","J&F":"47.6"},"paper_url":"https://arxiv.org/abs/2501.04939v2","paper_title":"Multi-Context Temporal Consistent Modeling for Referring Video Object Segmentation","paper_date":"2025-01-09","code_links":[{"title":"choi58/mtcm","url":"https://github.com/choi58/mtcm"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16858,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"DsHmp","metrics":{"F":"49.8","J":"43","J&F":"46.4"},"paper_url":"https://arxiv.org/abs/2404.03645v1","paper_title":"Decoupling Static and Hierarchical Motion Perception for Referring Video Segmentation","paper_date":"2024-04-04","code_links":[{"title":"heshuting555/dshmp","url":"https://github.com/heshuting555/dshmp"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16859,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"HTR","metrics":{"F":"45.5","J":"39.9","J&F":"42.7"},"paper_url":"https://arxiv.org/abs/2403.19407v2","paper_title":"Temporally Consistent Referring Video Object Segmentation with Hybrid Memory","paper_date":"2024-03-28","code_links":[{"title":"bo-miao/HTR","url":"https://github.com/bo-miao/HTR"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16860,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"LMPM","metrics":{"F":"40.2","J":"34.2","J&F":"37.2"},"paper_url":"https://arxiv.org/abs/2308.08544v1","paper_title":"MeViS: A Large-scale Benchmark for Video Segmentation with Motion Expressions","paper_date":"2023-08-16","code_links":[{"title":"henghuiding/MeViS","url":"https://github.com/henghuiding/MeViS"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16861,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"VLT+TC","metrics":{"F":"37.3","J":"33.6","J&F":"35.5"},"paper_url":"https://arxiv.org/abs/2210.15871v1","paper_title":"VLT: Vision-Language Transformer and Query Generation for Referring Segmentation","paper_date":"2022-10-28","code_links":[{"title":"henghuiding/Vision-Language-Transformer","url":"https://github.com/henghuiding/Vision-Language-Transformer"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16862,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"InternVideo2.5","metrics":{"J&F":"32"},"paper_url":"https://arxiv.org/abs/2501.12386v2","paper_title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","paper_date":"2025-01-21","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16863,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"ReferFormer","metrics":{"F":"32.2","J":"29.8","J&F":"31.0"},"paper_url":"https://arxiv.org/abs/2201.00487v2","paper_title":"Language as Queries for Referring Video Object Segmentation","paper_date":"2022-01-03","code_links":[{"title":"wjn922/referformer","url":"https://github.com/wjn922/referformer"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16864,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"MTTR","metrics":{"F":"31.2","J":"28.8","J&F":"30.0"},"paper_url":"https://arxiv.org/abs/2111.14821v2","paper_title":"End-to-End Referring Video Object Segmentation with Multimodal Transformers","paper_date":"2021-11-29","code_links":[{"title":"mttr2021/MTTR","url":"https://github.com/mttr2021/MTTR"},{"title":"JerryX1110/awesome-rvos","url":"https://github.com/JerryX1110/awesome-rvos"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16865,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"LBDT","metrics":{"F":"30.8","J":"27.8","J&F":"29.3"},"paper_url":"https://arxiv.org/abs/2206.03789v1","paper_title":"Language-Bridged Spatial-Temporal Interaction for Referring Video Object Segmentation","paper_date":"2022-06-08","code_links":[{"title":"dzh19990407/lbdt","url":"https://github.com/dzh19990407/lbdt"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16866,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"URVOS","metrics":{"F":"29.9","J":"25.7","J&F":"27.8"},"paper_url":"https://www.ecva.net/papers/eccv_2020/papers_ECCV/html/2327_ECCV_2020_paper.php","paper_title":"URVOS: Unified Referring Video Object Segmentation Network with a Large-Scale Benchmark","paper_date":null,"code_links":[{"title":"skynbe/Refer-Youtube-VOS","url":"https://github.com/skynbe/Refer-Youtube-VOS"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87992,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"MPG-SAM 2","metrics":{"F":"56.7","J":"50.7","J&F":"53.7"},"paper_url":"https://arxiv.org/abs/2501.13667v1","paper_title":"MPG-SAM 2: Adapting SAM 2 with Mask Priors and Global Context for Referring Video Object Segmentation","paper_date":"2025-01-23","code_links":[{"title":"rongfu-dsb/MPG-SAM2","url":"https://github.com/rongfu-dsb/MPG-SAM2"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87993,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"FindTrack","metrics":{"F":"55.9","J":"50.5","J&F":"53.2"},"paper_url":"https://arxiv.org/abs/2503.03492v1","paper_title":"Find First, Track Next: Decoupling Identification and Propagation in Referring Video Object Segmentation","paper_date":"2025-03-05","code_links":[{"title":"suhwan-cho/FindTrack","url":"https://github.com/suhwan-cho/FindTrack"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87994,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"GLUS","metrics":{"F":"54.2","J":"48.5","J&F":"51.3"},"paper_url":"https://arxiv.org/abs/2504.07962v1","paper_title":"GLUS: Global-Local Reasoning Unified into A Single Large Language Model for Video Segmentation","paper_date":"2025-04-10","code_links":[{"title":"GLUS-video/GLUS","url":"https://github.com/GLUS-video/GLUS"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87995,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"VRS-HQ (Chat-UniVi-13B)","metrics":{"F":"53.7","J":"48","J&F":"50.9"},"paper_url":"https://arxiv.org/abs/2501.08549v1","paper_title":"The Devil is in Temporal Token: High Quality Video Reasoning Segmentation","paper_date":"2025-01-15","code_links":[{"title":"sitonggong/vrs-hq","url":"https://github.com/sitonggong/vrs-hq"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87996,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"ReferDINO (Swin-B)","metrics":{"F":"53.9","J":"44.7","J&F":"49.3"},"paper_url":"https://arxiv.org/abs/2501.14607v1","paper_title":"ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations","paper_date":"2025-01-24","code_links":[],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87997,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"SAMWISE","metrics":{"F":"51.2","J":"45.4","J&F":"48.3"},"paper_url":"https://arxiv.org/abs/2411.17646v2","paper_title":"SAMWISE: Infusing Wisdom in SAM2 for Text-Driven Video Segmentation","paper_date":"2024-11-26","code_links":[{"title":"claudiacuttano/samwise","url":"https://github.com/claudiacuttano/samwise"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87998,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"DsHmp + MTCM","metrics":{"F":"51.1","J":"44.1","J&F":"47.6"},"paper_url":"https://arxiv.org/abs/2501.04939v2","paper_title":"Multi-Context Temporal Consistent Modeling for Referring Video Object Segmentation","paper_date":"2025-01-09","code_links":[{"title":"choi58/mtcm","url":"https://github.com/choi58/mtcm"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87999,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"DsHmp","metrics":{"F":"49.8","J":"43","J&F":"46.4"},"paper_url":"https://arxiv.org/abs/2404.03645v1","paper_title":"Decoupling Static and Hierarchical Motion Perception for Referring Video Segmentation","paper_date":"2024-04-04","code_links":[{"title":"heshuting555/dshmp","url":"https://github.com/heshuting555/dshmp"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":88000,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"HTR","metrics":{"F":"45.5","J":"39.9","J&F":"42.7"},"paper_url":"https://arxiv.org/abs/2403.19407v2","paper_title":"Temporally Consistent Referring Video Object Segmentation with Hybrid Memory","paper_date":"2024-03-28","code_links":[{"title":"bo-miao/HTR","url":"https://github.com/bo-miao/HTR"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":88001,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"LMPM","metrics":{"F":"40.2","J":"34.2","J&F":"37.2"},"paper_url":"https://arxiv.org/abs/2308.08544v1","paper_title":"MeViS: A Large-scale Benchmark for Video Segmentation with Motion Expressions","paper_date":"2023-08-16","code_links":[{"title":"henghuiding/MeViS","url":"https://github.com/henghuiding/MeViS"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":88002,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"VLT+TC","metrics":{"F":"37.3","J":"33.6","J&F":"35.5"},"paper_url":"https://arxiv.org/abs/2210.15871v1","paper_title":"VLT: Vision-Language Transformer and Query Generation for Referring Segmentation","paper_date":"2022-10-28","code_links":[{"title":"henghuiding/Vision-Language-Transformer","url":"https://github.com/henghuiding/Vision-Language-Transformer"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":88003,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"InternVideo2.5","metrics":{"J&F":"32"},"paper_url":"https://arxiv.org/abs/2501.12386v2","paper_title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","paper_date":"2025-01-21","code_links":[{"title":"opengvlab/internvideo","url":"https://github.com/opengvlab/internvideo"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":88004,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"ReferFormer","metrics":{"F":"32.2","J":"29.8","J&F":"31.0"},"paper_url":"https://arxiv.org/abs/2201.00487v2","paper_title":"Language as Queries for Referring Video Object Segmentation","paper_date":"2022-01-03","code_links":[{"title":"wjn922/referformer","url":"https://github.com/wjn922/referformer"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":88005,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"MTTR","metrics":{"F":"31.2","J":"28.8","J&F":"30.0"},"paper_url":"https://arxiv.org/abs/2111.14821v2","paper_title":"End-to-End Referring Video Object Segmentation with Multimodal Transformers","paper_date":"2021-11-29","code_links":[{"title":"mttr2021/MTTR","url":"https://github.com/mttr2021/MTTR"},{"title":"JerryX1110/awesome-rvos","url":"https://github.com/JerryX1110/awesome-rvos"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":88006,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"LBDT","metrics":{"F":"30.8","J":"27.8","J&F":"29.3"},"paper_url":"https://arxiv.org/abs/2206.03789v1","paper_title":"Language-Bridged Spatial-Temporal Interaction for Referring Video Object Segmentation","paper_date":"2022-06-08","code_links":[{"title":"dzh19990407/lbdt","url":"https://github.com/dzh19990407/lbdt"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":88007,"task":"Referring Video Object Segmentation","parent_task":"Video Object Segmentation","dataset":"MeViS","model_name":"URVOS","metrics":{"F":"29.9","J":"25.7","J&F":"27.8"},"paper_url":"https://www.ecva.net/papers/eccv_2020/papers_ECCV/html/2327_ECCV_2020_paper.php","paper_title":"URVOS: Unified Referring Video Object Segmentation Network with a Large-Scale Benchmark","paper_date":null,"code_links":[{"title":"skynbe/Refer-Youtube-VOS","url":"https://github.com/skynbe/Refer-Youtube-VOS"}],"metrics_order":"[\"J&F\", \"J\", \"F\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":590350,"task":"Referring Video Object Segmentation","parent_task":null,"dataset":"MeViS","model_name":"STVG-R1","metrics":{"F":"47.3"},"paper_url":"https://paperswithcode.com/paper/stvg-r1-incentivizing-instance-level-reasoning-and-grounding-in-videos-via-reinforcement-learning","paper_title":"STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning","paper_date":"2026-02-12","code_links":[],"metrics_order":null,"area":null,"uses_additional_data":null,"source":"auto","tags":[]}]}