{"task":"Situation Recognition","dataset":"imSitu","metric_names":["Top-1 Verb","Top-1 Verb & Value","Top-5 Verbs","Top-5 Verbs & Value"],"rows":[{"id":129392,"task":"Situation Recognition","parent_task":null,"dataset":"imSitu","model_name":"Ours","metrics":{"Top-1 Verb":"58.88"},"paper_url":"https://arxiv.org/abs/2501.11653v3","paper_title":"Dynamic Scene Understanding from Vision-Language Representations","paper_date":"2025-01-20","code_links":[],"metrics_order":"[\"Top-1 Verb\", \"Top-1 Verb & Value\", \"Top-5 Verbs\", \"Top-5 Verbs & Value\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":129393,"task":"Situation Recognition","parent_task":null,"dataset":"imSitu","model_name":"ClipSitu","metrics":{"Top-1 Verb":"47.23","Top-1 Verb & Value":"29.73","Top-5 Verbs":"85.69","Top-5 Verbs & Value":"68.42"},"paper_url":"https://arxiv.org/abs/2307.00586v3","paper_title":"ClipSitu: Effectively Leveraging CLIP for Conditional Predictions in Situation Recognition","paper_date":"2023-07-02","code_links":[{"title":"LUNAProject22/CLIPSitu","url":"https://github.com/LUNAProject22/CLIPSitu"}],"metrics_order":"[\"Top-1 Verb\", \"Top-1 Verb & Value\", \"Top-5 Verbs\", \"Top-5 Verbs & Value\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":129394,"task":"Situation Recognition","parent_task":null,"dataset":"imSitu","model_name":"CoFormer","metrics":{"Top-1 Verb":"44.66","Top-1 Verb & Value":"35.98","Top-5 Verbs":"73.31","Top-5 Verbs & Value":"57.76"},"paper_url":"https://arxiv.org/abs/2203.16518v1","paper_title":"Collaborative Transformers for Grounded Situation Recognition","paper_date":"2022-03-30","code_links":[{"title":"towhee-io/towhee","url":"https://github.com/towhee-io/towhee/tree/main/towhee/models/coformer"},{"title":"jhcho99/coformer","url":"https://github.com/jhcho99/coformer"},{"title":"ruipingl/opensu","url":"https://github.com/ruipingl/opensu"}],"metrics_order":"[\"Top-1 Verb\", \"Top-1 Verb & Value\", \"Top-5 Verbs\", \"Top-5 Verbs & Value\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":129395,"task":"Situation Recognition","parent_task":null,"dataset":"imSitu","model_name":"SituFormer","metrics":{"Top-1 Verb":"44.2","Top-1 Verb & Value":"35.24","Top-5 Verbs":"71.21","Top-5 Verbs & Value":"55.75"},"paper_url":"https://arxiv.org/abs/2112.05375v1","paper_title":"Rethinking the Two-Stage Framework for Grounded Situation Recognition","paper_date":"2021-12-10","code_links":[{"title":"kellyiss/situformer","url":"https://github.com/kellyiss/situformer"}],"metrics_order":"[\"Top-1 Verb\", \"Top-1 Verb & Value\", \"Top-5 Verbs\", \"Top-5 Verbs & Value\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":129396,"task":"Situation Recognition","parent_task":null,"dataset":"imSitu","model_name":"Kernel GraphNet","metrics":{"Top-1 Verb":"43.27","Top-1 Verb & Value":"35.41","Top-5 Verbs":"68.72","Top-5 Verbs & Value":"55.62"},"paper_url":"http://openaccess.thecvf.com/content_ICCV_2019/html/Suhail_Mixture-Kernel_Graph_Attention_Network_for_Situation_Recognition_ICCV_2019_paper.html","paper_title":"Mixture-Kernel Graph Attention Network for Situation Recognition","paper_date":"2019-10-01","code_links":[],"metrics_order":"[\"Top-1 Verb\", \"Top-1 Verb & Value\", \"Top-5 Verbs\", \"Top-5 Verbs & Value\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":129397,"task":"Situation Recognition","parent_task":null,"dataset":"imSitu","model_name":"GSRTR","metrics":{"Top-1 Verb":"40.63","Top-1 Verb & Value":"32.15","Top-5 Verbs":"69.81","Top-5 Verbs & Value":"54.13"},"paper_url":"https://arxiv.org/abs/2111.10135v1","paper_title":"Grounded Situation Recognition with Transformers","paper_date":"2021-11-19","code_links":[{"title":"jhcho99/gsrtr","url":"https://github.com/jhcho99/gsrtr"}],"metrics_order":"[\"Top-1 Verb\", \"Top-1 Verb & Value\", \"Top-5 Verbs\", \"Top-5 Verbs & Value\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":129398,"task":"Situation Recognition","parent_task":null,"dataset":"imSitu","model_name":"JSL","metrics":{"Top-1 Verb":"39.94","Top-1 Verb & Value":"31.44","Top-5 Verbs":"67.6","Top-5 Verbs & Value":"51.88"},"paper_url":"https://arxiv.org/abs/2003.12058v1","paper_title":"Grounded Situation Recognition","paper_date":"2020-03-26","code_links":[{"title":"allenai/swig","url":"https://github.com/allenai/swig"}],"metrics_order":"[\"Top-1 Verb\", \"Top-1 Verb & Value\", \"Top-5 Verbs\", \"Top-5 Verbs & Value\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":129399,"task":"Situation Recognition","parent_task":null,"dataset":"imSitu","model_name":"ISL","metrics":{"Top-1 Verb":"39.36","Top-1 Verb & Value":"30.09","Top-5 Verbs":"65.51","Top-5 Verbs & Value":"50.16"},"paper_url":"https://arxiv.org/abs/2003.12058v1","paper_title":"Grounded Situation Recognition","paper_date":"2020-03-26","code_links":[{"title":"allenai/swig","url":"https://github.com/allenai/swig"}],"metrics_order":"[\"Top-1 Verb\", \"Top-1 Verb & Value\", \"Top-5 Verbs\", \"Top-5 Verbs & Value\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":129400,"task":"Situation Recognition","parent_task":null,"dataset":"imSitu","model_name":"CAQ + RE-VGG","metrics":{"Top-1 Verb":"38.19","Top-1 Verb & Value":"30.23","Top-5 Verbs":"65.05","Top-5 Verbs & Value":"50.21"},"paper_url":"http://openaccess.thecvf.com/content_CVPR_2020/html/Cooray_Attention-Based_Context_Aware_Reasoning_for_Situation_Recognition_CVPR_2020_paper.html","paper_title":"Attention-Based Context Aware Reasoning for Situation Recognition","paper_date":"2020-06-01","code_links":[{"title":"thilinicooray/context-aware-reasoning-for-sr","url":"https://github.com/thilinicooray/context-aware-reasoning-for-sr"}],"metrics_order":"[\"Top-1 Verb\", \"Top-1 Verb & Value\", \"Top-5 Verbs\", \"Top-5 Verbs & Value\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":129401,"task":"Situation Recognition","parent_task":null,"dataset":"imSitu","model_name":"GraphNet","metrics":{"Top-1 Verb":"36.72","Top-1 Verb & Value":"27.52","Top-5 Verbs":"61.90","Top-5 Verbs & Value":"45.39"},"paper_url":"http://arxiv.org/abs/1708.04320v1","paper_title":"Situation Recognition with Graph Neural Networks","paper_date":"2017-08-14","code_links":[{"title":"thilinicooray/context-aware-reasoning-for-sr","url":"https://github.com/thilinicooray/context-aware-reasoning-for-sr"}],"metrics_order":"[\"Top-1 Verb\", \"Top-1 Verb & Value\", \"Top-5 Verbs\", \"Top-5 Verbs & Value\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":129402,"task":"Situation Recognition","parent_task":null,"dataset":"imSitu","model_name":"RNN + Fusion","metrics":{"Top-1 Verb":"35.9","Top-1 Verb & Value":"27.45","Top-5 Verbs":"63.08","Top-5 Verbs & Value":"46.88"},"paper_url":"http://arxiv.org/abs/1703.06233v2","paper_title":"Recurrent Models for Situation Recognition","paper_date":"2017-03-18","code_links":[],"metrics_order":"[\"Top-1 Verb\", \"Top-1 Verb & Value\", \"Top-5 Verbs\", \"Top-5 Verbs & Value\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":129403,"task":"Situation Recognition","parent_task":null,"dataset":"imSitu","model_name":"CRF + Aug","metrics":{"Top-1 Verb":"34.12","Top-1 Verb & Value":"26.45","Top-5 Verbs":"62.59","Top-5 Verbs & Value":"46.88"},"paper_url":"http://arxiv.org/abs/1612.00901v1","paper_title":"Commonly Uncommon: Semantic Sparsity in Situation Recognition","paper_date":"2016-12-03","code_links":[{"title":"my89/imSitu","url":"https://github.com/my89/imSitu"},{"title":"thilinicooray/my_imsitu","url":"https://github.com/thilinicooray/my_imsitu"}],"metrics_order":"[\"Top-1 Verb\", \"Top-1 Verb & Value\", \"Top-5 Verbs\", \"Top-5 Verbs & Value\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":129404,"task":"Situation Recognition","parent_task":null,"dataset":"imSitu","model_name":"CRF","metrics":{"Top-1 Verb":"32.34","Top-1 Verb & Value":"24.64","Top-5 Verbs":"58.88","Top-5 Verbs & Value":"42.76"},"paper_url":"http://openaccess.thecvf.com/content_cvpr_2016/html/Yatskar_Situation_Recognition_Visual_CVPR_2016_paper.html","paper_title":"Situation Recognition: Visual Semantic Role Labeling for Image Understanding","paper_date":"2016-06-01","code_links":[{"title":"my89/imSitu","url":"https://github.com/my89/imSitu"}],"metrics_order":"[\"Top-1 Verb\", \"Top-1 Verb & Value\", \"Top-5 Verbs\", \"Top-5 Verbs & Value\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]}]}