{"task":"Sound Prompted Semantic Segmentation","dataset":"ADE20K","metric_names":["mAP","mIoU"],"rows":[{"id":38530,"task":"Sound Prompted Semantic Segmentation","parent_task":"Semantic Segmentation","dataset":"ADE20K","model_name":"DenseAV","metrics":{"mAP":"32.7","mIoU":"24.7"},"paper_url":"https://arxiv.org/abs/2406.05629v1","paper_title":"Separating the \"Chirp\" from the \"Chat\": Self-supervised Visual Grounding of Sound and Language","paper_date":"2024-06-09","code_links":[{"title":"mhamilton723/DenseAV","url":"https://github.com/mhamilton723/DenseAV"}],"metrics_order":"[\"mAP\", \"mIoU\"]","area":"Medical","uses_additional_data":0,"source":"archive","tags":[]},{"id":38531,"task":"Sound Prompted Semantic Segmentation","parent_task":"Semantic Segmentation","dataset":"ADE20K","model_name":"CAVMAE","metrics":{"mAP":"26.0","mIoU":"17.0"},"paper_url":"https://arxiv.org/abs/2210.07839v4","paper_title":"Contrastive Audio-Visual Masked Autoencoder","paper_date":"2022-10-02","code_links":[{"title":"yuangongnd/cav-mae","url":"https://github.com/yuangongnd/cav-mae"}],"metrics_order":"[\"mAP\", \"mIoU\"]","area":"Medical","uses_additional_data":0,"source":"archive","tags":[]},{"id":38532,"task":"Sound Prompted Semantic Segmentation","parent_task":"Semantic Segmentation","dataset":"ADE20K","model_name":"ImageBIND","metrics":{"mAP":"19.7","mIoU":"20.5"},"paper_url":"https://arxiv.org/abs/2305.05665v2","paper_title":"ImageBind: One Embedding Space To Bind Them All","paper_date":"2023-05-09","code_links":[{"title":"facebookresearch/imagebind","url":"https://github.com/facebookresearch/imagebind"},{"title":"klemens-floege/oneprot","url":"https://github.com/klemens-floege/oneprot"},{"title":"ginihumer/amumo","url":"https://github.com/ginihumer/amumo"}],"metrics_order":"[\"mAP\", \"mIoU\"]","area":"Medical","uses_additional_data":0,"source":"archive","tags":[]},{"id":38533,"task":"Sound Prompted Semantic Segmentation","parent_task":"Semantic Segmentation","dataset":"ADE20K","model_name":"DAVENet","metrics":{"mAP":"16.8","mIoU":"18.1"},"paper_url":"http://arxiv.org/abs/1804.01452v1","paper_title":"Jointly Discovering Visual Objects and Spoken Words from Raw Sensory Input","paper_date":"2018-04-04","code_links":[],"metrics_order":"[\"mAP\", \"mIoU\"]","area":"Medical","uses_additional_data":0,"source":"archive","tags":[]},{"id":140275,"task":"Sound Prompted Semantic Segmentation","parent_task":"Semantic Segmentation","dataset":"ADE20K","model_name":"DenseAV","metrics":{"mAP":"32.7","mIoU":"24.7"},"paper_url":"https://arxiv.org/abs/2406.05629v1","paper_title":"Separating the \"Chirp\" from the \"Chat\": Self-supervised Visual Grounding of Sound and Language","paper_date":"2024-06-09","code_links":[{"title":"mhamilton723/DenseAV","url":"https://github.com/mhamilton723/DenseAV"}],"metrics_order":"[\"mAP\", \"mIoU\"]","area":"Medical","uses_additional_data":0,"source":"archive","tags":[]},{"id":140276,"task":"Sound Prompted Semantic Segmentation","parent_task":"Semantic Segmentation","dataset":"ADE20K","model_name":"CAVMAE","metrics":{"mAP":"26.0","mIoU":"17.0"},"paper_url":"https://arxiv.org/abs/2210.07839v4","paper_title":"Contrastive Audio-Visual Masked Autoencoder","paper_date":"2022-10-02","code_links":[{"title":"yuangongnd/cav-mae","url":"https://github.com/yuangongnd/cav-mae"}],"metrics_order":"[\"mAP\", \"mIoU\"]","area":"Medical","uses_additional_data":0,"source":"archive","tags":[]},{"id":140277,"task":"Sound Prompted Semantic Segmentation","parent_task":"Semantic Segmentation","dataset":"ADE20K","model_name":"ImageBIND","metrics":{"mAP":"19.7","mIoU":"20.5"},"paper_url":"https://arxiv.org/abs/2305.05665v2","paper_title":"ImageBind: One Embedding Space To Bind Them All","paper_date":"2023-05-09","code_links":[{"title":"facebookresearch/imagebind","url":"https://github.com/facebookresearch/imagebind"},{"title":"klemens-floege/oneprot","url":"https://github.com/klemens-floege/oneprot"},{"title":"ginihumer/amumo","url":"https://github.com/ginihumer/amumo"}],"metrics_order":"[\"mAP\", \"mIoU\"]","area":"Medical","uses_additional_data":0,"source":"archive","tags":[]},{"id":140278,"task":"Sound Prompted Semantic Segmentation","parent_task":"Semantic Segmentation","dataset":"ADE20K","model_name":"DAVENet","metrics":{"mAP":"16.8","mIoU":"18.1"},"paper_url":"http://arxiv.org/abs/1804.01452v1","paper_title":"Jointly Discovering Visual Objects and Spoken Words from Raw Sensory Input","paper_date":"2018-04-04","code_links":[],"metrics_order":"[\"mAP\", \"mIoU\"]","area":"Medical","uses_additional_data":0,"source":"archive","tags":[]}]}