{"task":"Video Object Segmentation","dataset":"DAVIS 2016","metric_names":["J&F","F-Score","Jaccard (Mean)","mIoU","Contour Accuracy"],"rows":[{"id":16315,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"ISVOS (BL30K, MS)","metrics":{"F-Score":"94.2","J&F":"93.4","Jaccard (Mean)":"92.5"},"paper_url":"https://arxiv.org/abs/2212.06826v1","paper_title":"Look Before You Match: Instance Understanding Matters in Video Object Segmentation","paper_date":"2022-12-13","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16316,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"XMem (BL30K, MS)","metrics":{"F-Score":"94.4","J&F":"93.3","Jaccard (Mean)":"92.2"},"paper_url":"https://arxiv.org/abs/2207.07115v2","paper_title":"XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model","paper_date":"2022-07-14","code_links":[{"title":"hkchengrex/XMem","url":"https://github.com/hkchengrex/XMem"},{"title":"tianyuan168326/videosemanticcompression-pytorch","url":"https://github.com/tianyuan168326/videosemanticcompression-pytorch"}],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16317,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"BATMAN (val)","metrics":{"F-Score":"94.2","J&F":"92.5","Jaccard (Mean)":"90.7"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16318,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"STCN (val)","metrics":{"F-Score":"92.5","J&F":"91.6","Jaccard (Mean)":"90.8"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16319,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"XMem","metrics":{"F-Score":"92.7","J&F":"91.5","Jaccard (Mean)":"90.4"},"paper_url":"https://arxiv.org/abs/2207.07115v2","paper_title":"XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model","paper_date":"2022-07-14","code_links":[{"title":"hkchengrex/XMem","url":"https://github.com/hkchengrex/XMem"},{"title":"tianyuan168326/videosemanticcompression-pytorch","url":"https://github.com/tianyuan168326/videosemanticcompression-pytorch"}],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16320,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"MobileVOS (val)","metrics":{"F-Score":"92.6","J&F":"91.4","Jaccard (Mean)":"90.3"},"paper_url":"https://arxiv.org/abs/2303.07815v1","paper_title":"MobileVOS: Real-Time Video Object Segmentation Contrastive Learning meets Knowledge Distillation","paper_date":"2023-03-14","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16321,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"AOT (val)","metrics":{"F-Score":"92.1","J&F":"91.1","Jaccard (Mean)":"90.1"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16322,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"LCM (val)","metrics":{"F-Score":"91.4","J&F":"90.7","Jaccard (Mean)":"89.9"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16323,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"RPCMVOS (val)","metrics":{"F-Score":"94","J&F":"90.6","Jaccard (Mean)":"87.1"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16324,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"KMN (val)","metrics":{"F-Score":"91.5","J&F":"90.5","Jaccard (Mean)":"89.5"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16325,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"TransVOS (val)","metrics":{"F-Score":"91.2","J&F":"90.5","Jaccard (Mean)":"89.8"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16326,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"CFBI+ (val)","metrics":{"F-Score":"91.1","J&F":"89.9","Jaccard (Mean)":"88.7"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16327,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"ViTAE-T-Stage","metrics":{"F-Score":"90.4","J&F":"89.8","Jaccard (Mean)":"89.2"},"paper_url":"https://arxiv.org/abs/2106.03348v4","paper_title":"ViTAE: Vision Transformer Advanced by Exploring Intrinsic Inductive Bias","paper_date":"2021-06-07","code_links":[{"title":"ViTAE-Transformer/ViTAE-Transformer","url":"https://github.com/ViTAE-Transformer/ViTAE-Transformer"},{"title":"Annbless/ViTAE","url":"https://github.com/Annbless/ViTAE"}],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16328,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"CFBI (val)","metrics":{"F-Score":"90.5","J&F":"89.4","Jaccard (Mean)":"88.3"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16329,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"RMN (val)","metrics":{"F-Score":"88.7","J&F":"88.8","Jaccard (Mean)":"88.9"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16330,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"AOC-MF (val)","metrics":{"F-Score":"94.7","Jaccard (Mean)":"88.5"},"paper_url":"https://arxiv.org/abs/2207.00887v1","paper_title":"Towards Robust Video Object Segmentation with Adaptive Object Calibration","paper_date":"2022-07-02","code_links":[{"title":"jerryx1110/robust-video-object-segmentation","url":"https://github.com/jerryx1110/robust-video-object-segmentation"}],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16331,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"STM (val)","metrics":{"F-Score":"89.9","Jaccard (Mean)":"88.7"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16332,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"3DC-Seg","metrics":{"F-Score":"84.7","Jaccard (Mean)":"84.3"},"paper_url":"https://arxiv.org/abs/2008.11516v2","paper_title":"Making a Case for 3D Convolutions for Object Segmentation in Videos","paper_date":"2020-08-26","code_links":[{"title":"sabarim/3DC-Seg","url":"https://github.com/sabarim/3DC-Seg"}],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":16333,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"DFNet","metrics":{"F-Score":"81.8"},"paper_url":"https://arxiv.org/abs/2008.01270v1","paper_title":"Learning Discriminative Feature with CRF for Unsupervised Video Object Segmentation","paper_date":"2020-08-04","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16334,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"Ours","metrics":{"Jaccard (Mean)":"83.4"},"paper_url":"https://arxiv.org/abs/2008.01270v1","paper_title":"Learning Discriminative Feature with CRF for Unsupervised Video Object Segmentation","paper_date":"2020-08-04","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16335,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"VOSwL (Mask+Language)","metrics":{"mIoU":"84.5"},"paper_url":"http://arxiv.org/abs/1803.08006v3","paper_title":"Video Object Segmentation with Language Referring Expressions","paper_date":"2018-03-21","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16336,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"VOSwL (Language)","metrics":{"mIoU":"82.8"},"paper_url":"http://arxiv.org/abs/1803.08006v3","paper_title":"Video Object Segmentation with Language Referring Expressions","paper_date":"2018-03-21","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16337,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"LOCATE","metrics":{"Contour Accuracy":"88.7","mIoU":"80.9"},"paper_url":"https://arxiv.org/abs/2308.11239v3","paper_title":"LOCATE: Self-supervised Object Discovery via Flow-guided Graph-cut and Bootstrapped Self-training","paper_date":"2023-08-22","code_links":[{"title":"silky1708/locate","url":"https://github.com/silky1708/locate"}],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16338,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2016","model_name":"FODVid","metrics":{"mIoU":"78.71"},"paper_url":"https://arxiv.org/abs/2307.04392v1","paper_title":"FODVid: Flow-guided Object Discovery in Videos","paper_date":"2023-07-10","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87456,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"ISVOS (BL30K, MS)","metrics":{"F-Score":"94.2","J&F":"93.4","Jaccard (Mean)":"92.5"},"paper_url":"https://arxiv.org/abs/2212.06826v1","paper_title":"Look Before You Match: Instance Understanding Matters in Video Object Segmentation","paper_date":"2022-12-13","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87457,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"XMem (BL30K, MS)","metrics":{"F-Score":"94.4","J&F":"93.3","Jaccard (Mean)":"92.2"},"paper_url":"https://arxiv.org/abs/2207.07115v2","paper_title":"XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model","paper_date":"2022-07-14","code_links":[{"title":"hkchengrex/XMem","url":"https://github.com/hkchengrex/XMem"},{"title":"tianyuan168326/videosemanticcompression-pytorch","url":"https://github.com/tianyuan168326/videosemanticcompression-pytorch"}],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87458,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"BATMAN (val)","metrics":{"F-Score":"94.2","J&F":"92.5","Jaccard (Mean)":"90.7"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87459,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"STCN (val)","metrics":{"F-Score":"92.5","J&F":"91.6","Jaccard (Mean)":"90.8"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87460,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"XMem","metrics":{"F-Score":"92.7","J&F":"91.5","Jaccard (Mean)":"90.4"},"paper_url":"https://arxiv.org/abs/2207.07115v2","paper_title":"XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model","paper_date":"2022-07-14","code_links":[{"title":"hkchengrex/XMem","url":"https://github.com/hkchengrex/XMem"},{"title":"tianyuan168326/videosemanticcompression-pytorch","url":"https://github.com/tianyuan168326/videosemanticcompression-pytorch"}],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87461,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"MobileVOS (val)","metrics":{"F-Score":"92.6","J&F":"91.4","Jaccard (Mean)":"90.3"},"paper_url":"https://arxiv.org/abs/2303.07815v1","paper_title":"MobileVOS: Real-Time Video Object Segmentation Contrastive Learning meets Knowledge Distillation","paper_date":"2023-03-14","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87462,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"AOT (val)","metrics":{"F-Score":"92.1","J&F":"91.1","Jaccard (Mean)":"90.1"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87463,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"LCM (val)","metrics":{"F-Score":"91.4","J&F":"90.7","Jaccard (Mean)":"89.9"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87464,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"RPCMVOS (val)","metrics":{"F-Score":"94","J&F":"90.6","Jaccard (Mean)":"87.1"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87465,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"KMN (val)","metrics":{"F-Score":"91.5","J&F":"90.5","Jaccard (Mean)":"89.5"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87466,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"TransVOS (val)","metrics":{"F-Score":"91.2","J&F":"90.5","Jaccard (Mean)":"89.8"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87467,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"CFBI+ (val)","metrics":{"F-Score":"91.1","J&F":"89.9","Jaccard (Mean)":"88.7"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87468,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"ViTAE-T-Stage","metrics":{"F-Score":"90.4","J&F":"89.8","Jaccard (Mean)":"89.2"},"paper_url":"https://arxiv.org/abs/2106.03348v4","paper_title":"ViTAE: Vision Transformer Advanced by Exploring Intrinsic Inductive Bias","paper_date":"2021-06-07","code_links":[{"title":"ViTAE-Transformer/ViTAE-Transformer","url":"https://github.com/ViTAE-Transformer/ViTAE-Transformer"},{"title":"Annbless/ViTAE","url":"https://github.com/Annbless/ViTAE"}],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87469,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"CFBI (val)","metrics":{"F-Score":"90.5","J&F":"89.4","Jaccard (Mean)":"88.3"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87470,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"RMN (val)","metrics":{"F-Score":"88.7","J&F":"88.8","Jaccard (Mean)":"88.9"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87471,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"AOC-MF (val)","metrics":{"F-Score":"94.7","Jaccard (Mean)":"88.5"},"paper_url":"https://arxiv.org/abs/2207.00887v1","paper_title":"Towards Robust Video Object Segmentation with Adaptive Object Calibration","paper_date":"2022-07-02","code_links":[{"title":"jerryx1110/robust-video-object-segmentation","url":"https://github.com/jerryx1110/robust-video-object-segmentation"}],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87472,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"STM (val)","metrics":{"F-Score":"89.9","Jaccard (Mean)":"88.7"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87473,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"3DC-Seg","metrics":{"F-Score":"84.7","Jaccard (Mean)":"84.3"},"paper_url":"https://arxiv.org/abs/2008.11516v2","paper_title":"Making a Case for 3D Convolutions for Object Segmentation in Videos","paper_date":"2020-08-26","code_links":[{"title":"sabarim/3DC-Seg","url":"https://github.com/sabarim/3DC-Seg"}],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":87474,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"DFNet","metrics":{"F-Score":"81.8"},"paper_url":"https://arxiv.org/abs/2008.01270v1","paper_title":"Learning Discriminative Feature with CRF for Unsupervised Video Object Segmentation","paper_date":"2020-08-04","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87475,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"Ours","metrics":{"Jaccard (Mean)":"83.4"},"paper_url":"https://arxiv.org/abs/2008.01270v1","paper_title":"Learning Discriminative Feature with CRF for Unsupervised Video Object Segmentation","paper_date":"2020-08-04","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87476,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"VOSwL (Mask+Language)","metrics":{"mIoU":"84.5"},"paper_url":"http://arxiv.org/abs/1803.08006v3","paper_title":"Video Object Segmentation with Language Referring Expressions","paper_date":"2018-03-21","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87477,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"VOSwL (Language)","metrics":{"mIoU":"82.8"},"paper_url":"http://arxiv.org/abs/1803.08006v3","paper_title":"Video Object Segmentation with Language Referring Expressions","paper_date":"2018-03-21","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87478,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"LOCATE","metrics":{"Contour Accuracy":"88.7","mIoU":"80.9"},"paper_url":"https://arxiv.org/abs/2308.11239v3","paper_title":"LOCATE: Self-supervised Object Discovery via Flow-guided Graph-cut and Bootstrapped Self-training","paper_date":"2023-08-22","code_links":[{"title":"silky1708/locate","url":"https://github.com/silky1708/locate"}],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87479,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2016","model_name":"FODVid","metrics":{"mIoU":"78.71"},"paper_url":"https://arxiv.org/abs/2307.04392v1","paper_title":"FODVid: Flow-guided Object Discovery in Videos","paper_date":"2023-07-10","code_links":[],"metrics_order":"[\"J&F\", \"F-Score\", \"Jaccard (Mean)\", \"mIoU\", \"Contour Accuracy\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]}]}