{"task":"Video Object Segmentation","dataset":"DAVIS 2017 (val)","metric_names":["Mean Jaccard & F-Measure","F-measure","Jaccard"],"rows":[{"id":16366,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2017 (val)","model_name":"XMem (BLK30K, MS)","metrics":{"F-measure":"92.6","Jaccard":"86.3","Mean Jaccard & F-Measure":"89.5"},"paper_url":"https://arxiv.org/abs/2207.07115v2","paper_title":"XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model","paper_date":"2022-07-14","code_links":[{"title":"hkchengrex/XMem","url":"https://github.com/hkchengrex/XMem"},{"title":"tianyuan168326/videosemanticcompression-pytorch","url":"https://github.com/tianyuan168326/videosemanticcompression-pytorch"}],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16367,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2017 (val)","model_name":"XMem","metrics":{"F-measure":"89.5","Jaccard":"82.9","Mean Jaccard & F-Measure":"86.2"},"paper_url":"https://arxiv.org/abs/2207.07115v2","paper_title":"XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model","paper_date":"2022-07-14","code_links":[{"title":"hkchengrex/XMem","url":"https://github.com/hkchengrex/XMem"},{"title":"tianyuan168326/videosemanticcompression-pytorch","url":"https://github.com/tianyuan168326/videosemanticcompression-pytorch"}],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16368,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2017 (val)","model_name":"BATMAN","metrics":{"F-measure":"89.3","Mean Jaccard & F-Measure":"86.2"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16369,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2017 (val)","model_name":"STCN","metrics":{"F-measure":"88.6","Jaccard":"82.2","Mean Jaccard & F-Measure":"85.4"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16370,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2017 (val)","model_name":"AOT","metrics":{"F-measure":"87.5","Jaccard":"82.3","Mean Jaccard & F-Measure":"84.9"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16371,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2017 (val)","model_name":"TransVOS","metrics":{"F-measure":"86.4","Jaccard":"81.4","Mean Jaccard & F-Measure":"83.9"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16372,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2017 (val)","model_name":"RPCMVOS","metrics":{"Jaccard":"81.3","Mean Jaccard & F-Measure":"83.7"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16373,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2017 (val)","model_name":"RMN","metrics":{"F-measure":"86","Jaccard":"81","Mean Jaccard & F-Measure":"83.5"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16374,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2017 (val)","model_name":"CFBI+","metrics":{"F-measure":"85.7","Jaccard":"80.1","Mean Jaccard & F-Measure":"82.9"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16375,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2017 (val)","model_name":"KMN","metrics":{"F-measure":"85.6","Jaccard":"80","Mean Jaccard & F-Measure":"82.8"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16376,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2017 (val)","model_name":"SST","metrics":{"F-measure":"85.1","Jaccard":"79.9","Mean Jaccard & F-Measure":"82.5"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16377,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2017 (val)","model_name":"CFBI","metrics":{"F-measure":"84.5","Jaccard":"79.3","Mean Jaccard & F-Measure":"81.9"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16378,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2017 (val)","model_name":"LWL","metrics":{"F-measure":"84.1","Jaccard":"79.1","Mean Jaccard & F-Measure":"81.6"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16379,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2017 (val)","model_name":"UniVS(Swin-L)","metrics":{"F-measure":"79.5","Jaccard":"72.8","Mean Jaccard & F-Measure":"76.2"},"paper_url":"https://arxiv.org/abs/2402.18115v2","paper_title":"UniVS: Unified and Universal Video Segmentation with Prompts as Queries","paper_date":"2024-02-28","code_links":[{"title":"minghanli/univs","url":"https://github.com/minghanli/univs"}],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":16380,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2017 (val)","model_name":"AFB-URR","metrics":{"F-measure":"76.1","Jaccard":"73","Mean Jaccard & F-Measure":"74.6"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16381,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2017 (val)","model_name":"LCM","metrics":{"F-measure":"86.5","Jaccard":"80.5"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":16382,"task":"Video Object Segmentation","parent_task":"Video","dataset":"DAVIS 2017 (val)","model_name":"STM","metrics":{"F-measure":"84.3","Jaccard":"79.2"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87507,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2017 (val)","model_name":"XMem (BLK30K, MS)","metrics":{"F-measure":"92.6","Jaccard":"86.3","Mean Jaccard & F-Measure":"89.5"},"paper_url":"https://arxiv.org/abs/2207.07115v2","paper_title":"XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model","paper_date":"2022-07-14","code_links":[{"title":"hkchengrex/XMem","url":"https://github.com/hkchengrex/XMem"},{"title":"tianyuan168326/videosemanticcompression-pytorch","url":"https://github.com/tianyuan168326/videosemanticcompression-pytorch"}],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87508,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2017 (val)","model_name":"XMem","metrics":{"F-measure":"89.5","Jaccard":"82.9","Mean Jaccard & F-Measure":"86.2"},"paper_url":"https://arxiv.org/abs/2207.07115v2","paper_title":"XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model","paper_date":"2022-07-14","code_links":[{"title":"hkchengrex/XMem","url":"https://github.com/hkchengrex/XMem"},{"title":"tianyuan168326/videosemanticcompression-pytorch","url":"https://github.com/tianyuan168326/videosemanticcompression-pytorch"}],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87509,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2017 (val)","model_name":"BATMAN","metrics":{"F-measure":"89.3","Mean Jaccard & F-Measure":"86.2"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87510,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2017 (val)","model_name":"STCN","metrics":{"F-measure":"88.6","Jaccard":"82.2","Mean Jaccard & F-Measure":"85.4"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87511,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2017 (val)","model_name":"AOT","metrics":{"F-measure":"87.5","Jaccard":"82.3","Mean Jaccard & F-Measure":"84.9"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87512,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2017 (val)","model_name":"TransVOS","metrics":{"F-measure":"86.4","Jaccard":"81.4","Mean Jaccard & F-Measure":"83.9"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87513,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2017 (val)","model_name":"RPCMVOS","metrics":{"Jaccard":"81.3","Mean Jaccard & F-Measure":"83.7"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87514,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2017 (val)","model_name":"RMN","metrics":{"F-measure":"86","Jaccard":"81","Mean Jaccard & F-Measure":"83.5"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87515,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2017 (val)","model_name":"CFBI+","metrics":{"F-measure":"85.7","Jaccard":"80.1","Mean Jaccard & F-Measure":"82.9"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87516,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2017 (val)","model_name":"KMN","metrics":{"F-measure":"85.6","Jaccard":"80","Mean Jaccard & F-Measure":"82.8"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87517,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2017 (val)","model_name":"SST","metrics":{"F-measure":"85.1","Jaccard":"79.9","Mean Jaccard & F-Measure":"82.5"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87518,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2017 (val)","model_name":"CFBI","metrics":{"F-measure":"84.5","Jaccard":"79.3","Mean Jaccard & F-Measure":"81.9"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87519,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2017 (val)","model_name":"LWL","metrics":{"F-measure":"84.1","Jaccard":"79.1","Mean Jaccard & F-Measure":"81.6"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87520,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2017 (val)","model_name":"UniVS(Swin-L)","metrics":{"F-measure":"79.5","Jaccard":"72.8","Mean Jaccard & F-Measure":"76.2"},"paper_url":"https://arxiv.org/abs/2402.18115v2","paper_title":"UniVS: Unified and Universal Video Segmentation with Prompts as Queries","paper_date":"2024-02-28","code_links":[{"title":"minghanli/univs","url":"https://github.com/minghanli/univs"}],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":1,"source":"archive","tags":[]},{"id":87521,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2017 (val)","model_name":"AFB-URR","metrics":{"F-measure":"76.1","Jaccard":"73","Mean Jaccard & F-Measure":"74.6"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87522,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2017 (val)","model_name":"LCM","metrics":{"F-measure":"86.5","Jaccard":"80.5"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":87523,"task":"Video Object Segmentation","parent_task":null,"dataset":"DAVIS 2017 (val)","model_name":"STM","metrics":{"F-measure":"84.3","Jaccard":"79.2"},"paper_url":"https://arxiv.org/abs/2208.01159v4","paper_title":"BATMAN: Bilateral Attention Transformer in Motion-Appearance Neighboring Space for Video Object Segmentation","paper_date":"2022-08-01","code_links":[],"metrics_order":"[\"Mean Jaccard & F-Measure\", \"F-measure\", \"Jaccard\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]}]}