{"task":"Pose Estimation","dataset":"COCO (Common Objects in Context)","metric_names":["AP","AR","AP50","AP75","APL","APM"],"rows":[{"id":41415,"task":"Pose Estimation","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"OmniPose (WASPv2)","metrics":{"AP":"79.5","AP50":"93.6","AP75":"85.9","APL":"84.6","APM":"76","AR":"81.9"},"paper_url":"https://arxiv.org/abs/2103.10180v1","paper_title":"OmniPose: A Multi-Scale Framework for Multi-Person Pose Estimation","paper_date":"2021-03-18","code_links":[{"title":"bmartacho/OmniPose","url":"https://github.com/bmartacho/OmniPose"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":41416,"task":"Pose Estimation","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"MetaPrompt-SD","metrics":{"AP":"79.0"},"paper_url":"https://arxiv.org/abs/2312.14733v1","paper_title":"Harnessing Diffusion Models for Visual Perception with Meta Prompts","paper_date":"2023-12-22","code_links":[{"title":"fudan-zvg/meta-prompts","url":"https://github.com/fudan-zvg/meta-prompts"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":41417,"task":"Pose Estimation","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"Hulk(Finetune, ViT-L)","metrics":{"AP":"78.7"},"paper_url":"https://arxiv.org/abs/2312.01697v4","paper_title":"Hulk: A Universal Knowledge Translator for Human-Centric Tasks","paper_date":"2023-12-04","code_links":[{"title":"opengvlab/humanbench","url":"https://github.com/opengvlab/humanbench"},{"title":"opengvlab/hulk","url":"https://github.com/opengvlab/hulk"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":41418,"task":"Pose Estimation","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"BUCTD (PETR,  with generative sampling)","metrics":{"AP":"77.8"},"paper_url":"https://arxiv.org/abs/2306.07879v2","paper_title":"Rethinking pose estimation in crowds: overcoming the detection information-bottleneck and ambiguity","paper_date":"2023-06-13","code_links":[{"title":"amathislab/BUCTD","url":"https://github.com/amathislab/BUCTD"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":41419,"task":"Pose Estimation","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"Hulk(Finetune, ViT-B)","metrics":{"AP":"77.5"},"paper_url":"https://arxiv.org/abs/2312.01697v4","paper_title":"Hulk: A Universal Knowledge Translator for Human-Centric Tasks","paper_date":"2023-12-04","code_links":[{"title":"opengvlab/humanbench","url":"https://github.com/opengvlab/humanbench"},{"title":"opengvlab/hulk","url":"https://github.com/opengvlab/hulk"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":41420,"task":"Pose Estimation","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"I²R-Net (1st stage:HRFormer-B)","metrics":{"AP":"77.3","AP50":"91","AP75":"83.6","APL":"84.5","APM":"73","AR":"82.1"},"paper_url":"https://arxiv.org/abs/2206.10892v2","paper_title":"I^2R-Net: Intra- and Inter-Human Relation Network for Multi-Person Pose Estimation","paper_date":"2022-06-22","code_links":[{"title":"leijue222/Intra-and-Inter-Human-Relation-Network-for-MPEE","url":"https://github.com/leijue222/Intra-and-Inter-Human-Relation-Network-for-MPEE"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":41421,"task":"Pose Estimation","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"PATH (Partial FT)","metrics":{"AP":"77.1"},"paper_url":"https://arxiv.org/abs/2303.05675v1","paper_title":"HumanBench: Towards General Human-centric Perception with Projector Assisted Pretraining","paper_date":"2023-03-10","code_links":[{"title":"opengvlab/humanbench","url":"https://github.com/opengvlab/humanbench"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":41422,"task":"Pose Estimation","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"SOLIDER (swin-B)","metrics":{"AP":"76.6","AR":"81.5"},"paper_url":"https://arxiv.org/abs/2303.17602v1","paper_title":"Beyond Appearance: a Semantic Controllable Self-Supervised Learning Framework for Human-Centric Visual Tasks","paper_date":"2023-03-30","code_links":[{"title":"modelscope/modelscope","url":"https://github.com/modelscope/modelscope"},{"title":"tinyvision/SOLIDER","url":"https://github.com/tinyvision/SOLIDER"},{"title":"hasanirtiza/Pedestron","url":"https://github.com/hasanirtiza/Pedestron"},{"title":"DengpanFu/LUPerson","url":"https://github.com/DengpanFu/LUPerson"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":41423,"task":"Pose Estimation","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"PEFORMER-Xcit-dino-p8","metrics":{"AP":"72.6","AR":"79.4"},"paper_url":"https://arxiv.org/abs/2112.04981v1","paper_title":"PE-former: Pose Estimation Transformer","paper_date":"2021-12-09","code_links":[{"title":"padeler/pe-former","url":"https://github.com/padeler/pe-former"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":41424,"task":"Pose Estimation","parent_task":null,"dataset":"COCO (Common Objects in Context)","model_name":"BUCTD (PETR, with generative sampling)","metrics":{"APL":"83.7","APM":"74.2"},"paper_url":"https://arxiv.org/abs/2306.07879v2","paper_title":"Rethinking pose estimation in crowds: overcoming the detection information-bottleneck and ambiguity","paper_date":"2023-06-13","code_links":[{"title":"amathislab/BUCTD","url":"https://github.com/amathislab/BUCTD"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":79262,"task":"Pose Estimation","parent_task":"3D","dataset":"COCO (Common Objects in Context)","model_name":"OmniPose (WASPv2)","metrics":{"AP":"79.5","AP50":"93.6","AP75":"85.9","APL":"84.6","APM":"76","AR":"81.9"},"paper_url":"https://arxiv.org/abs/2103.10180v1","paper_title":"OmniPose: A Multi-Scale Framework for Multi-Person Pose Estimation","paper_date":"2021-03-18","code_links":[{"title":"bmartacho/OmniPose","url":"https://github.com/bmartacho/OmniPose"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":79263,"task":"Pose Estimation","parent_task":"3D","dataset":"COCO (Common Objects in Context)","model_name":"MetaPrompt-SD","metrics":{"AP":"79.0"},"paper_url":"https://arxiv.org/abs/2312.14733v1","paper_title":"Harnessing Diffusion Models for Visual Perception with Meta Prompts","paper_date":"2023-12-22","code_links":[{"title":"fudan-zvg/meta-prompts","url":"https://github.com/fudan-zvg/meta-prompts"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":79264,"task":"Pose Estimation","parent_task":"3D","dataset":"COCO (Common Objects in Context)","model_name":"Hulk(Finetune, ViT-L)","metrics":{"AP":"78.7"},"paper_url":"https://arxiv.org/abs/2312.01697v4","paper_title":"Hulk: A Universal Knowledge Translator for Human-Centric Tasks","paper_date":"2023-12-04","code_links":[{"title":"opengvlab/humanbench","url":"https://github.com/opengvlab/humanbench"},{"title":"opengvlab/hulk","url":"https://github.com/opengvlab/hulk"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":79265,"task":"Pose Estimation","parent_task":"3D","dataset":"COCO (Common Objects in Context)","model_name":"BUCTD (PETR,  with generative sampling)","metrics":{"AP":"77.8"},"paper_url":"https://arxiv.org/abs/2306.07879v2","paper_title":"Rethinking pose estimation in crowds: overcoming the detection information-bottleneck and ambiguity","paper_date":"2023-06-13","code_links":[{"title":"amathislab/BUCTD","url":"https://github.com/amathislab/BUCTD"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":79266,"task":"Pose Estimation","parent_task":"3D","dataset":"COCO (Common Objects in Context)","model_name":"Hulk(Finetune, ViT-B)","metrics":{"AP":"77.5"},"paper_url":"https://arxiv.org/abs/2312.01697v4","paper_title":"Hulk: A Universal Knowledge Translator for Human-Centric Tasks","paper_date":"2023-12-04","code_links":[{"title":"opengvlab/humanbench","url":"https://github.com/opengvlab/humanbench"},{"title":"opengvlab/hulk","url":"https://github.com/opengvlab/hulk"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":79267,"task":"Pose Estimation","parent_task":"3D","dataset":"COCO (Common Objects in Context)","model_name":"I²R-Net (1st stage:HRFormer-B)","metrics":{"AP":"77.3","AP50":"91","AP75":"83.6","APL":"84.5","APM":"73","AR":"82.1"},"paper_url":"https://arxiv.org/abs/2206.10892v2","paper_title":"I^2R-Net: Intra- and Inter-Human Relation Network for Multi-Person Pose Estimation","paper_date":"2022-06-22","code_links":[{"title":"leijue222/Intra-and-Inter-Human-Relation-Network-for-MPEE","url":"https://github.com/leijue222/Intra-and-Inter-Human-Relation-Network-for-MPEE"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":79268,"task":"Pose Estimation","parent_task":"3D","dataset":"COCO (Common Objects in Context)","model_name":"PATH (Partial FT)","metrics":{"AP":"77.1"},"paper_url":"https://arxiv.org/abs/2303.05675v1","paper_title":"HumanBench: Towards General Human-centric Perception with Projector Assisted Pretraining","paper_date":"2023-03-10","code_links":[{"title":"opengvlab/humanbench","url":"https://github.com/opengvlab/humanbench"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":79269,"task":"Pose Estimation","parent_task":"3D","dataset":"COCO (Common Objects in Context)","model_name":"SOLIDER (swin-B)","metrics":{"AP":"76.6","AR":"81.5"},"paper_url":"https://arxiv.org/abs/2303.17602v1","paper_title":"Beyond Appearance: a Semantic Controllable Self-Supervised Learning Framework for Human-Centric Visual Tasks","paper_date":"2023-03-30","code_links":[{"title":"modelscope/modelscope","url":"https://github.com/modelscope/modelscope"},{"title":"tinyvision/SOLIDER","url":"https://github.com/tinyvision/SOLIDER"},{"title":"hasanirtiza/Pedestron","url":"https://github.com/hasanirtiza/Pedestron"},{"title":"DengpanFu/LUPerson","url":"https://github.com/DengpanFu/LUPerson"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":79270,"task":"Pose Estimation","parent_task":"3D","dataset":"COCO (Common Objects in Context)","model_name":"PEFORMER-Xcit-dino-p8","metrics":{"AP":"72.6","AR":"79.4"},"paper_url":"https://arxiv.org/abs/2112.04981v1","paper_title":"PE-former: Pose Estimation Transformer","paper_date":"2021-12-09","code_links":[{"title":"padeler/pe-former","url":"https://github.com/padeler/pe-former"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":79271,"task":"Pose Estimation","parent_task":"3D","dataset":"COCO (Common Objects in Context)","model_name":"BUCTD (PETR, with generative sampling)","metrics":{"APL":"83.7","APM":"74.2"},"paper_url":"https://arxiv.org/abs/2306.07879v2","paper_title":"Rethinking pose estimation in crowds: overcoming the detection information-bottleneck and ambiguity","paper_date":"2023-06-13","code_links":[{"title":"amathislab/BUCTD","url":"https://github.com/amathislab/BUCTD"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":146721,"task":"Pose Estimation","parent_task":"1 Image, 2*2 Stitchi","dataset":"COCO (Common Objects in Context)","model_name":"OmniPose (WASPv2)","metrics":{"AP":"79.5","AP50":"93.6","AP75":"85.9","APL":"84.6","APM":"76","AR":"81.9"},"paper_url":"https://arxiv.org/abs/2103.10180v1","paper_title":"OmniPose: A Multi-Scale Framework for Multi-Person Pose Estimation","paper_date":"2021-03-18","code_links":[{"title":"bmartacho/OmniPose","url":"https://github.com/bmartacho/OmniPose"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":146722,"task":"Pose Estimation","parent_task":"1 Image, 2*2 Stitchi","dataset":"COCO (Common Objects in Context)","model_name":"MetaPrompt-SD","metrics":{"AP":"79.0"},"paper_url":"https://arxiv.org/abs/2312.14733v1","paper_title":"Harnessing Diffusion Models for Visual Perception with Meta Prompts","paper_date":"2023-12-22","code_links":[{"title":"fudan-zvg/meta-prompts","url":"https://github.com/fudan-zvg/meta-prompts"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":146723,"task":"Pose Estimation","parent_task":"1 Image, 2*2 Stitchi","dataset":"COCO (Common Objects in Context)","model_name":"Hulk(Finetune, ViT-L)","metrics":{"AP":"78.7"},"paper_url":"https://arxiv.org/abs/2312.01697v4","paper_title":"Hulk: A Universal Knowledge Translator for Human-Centric Tasks","paper_date":"2023-12-04","code_links":[{"title":"opengvlab/humanbench","url":"https://github.com/opengvlab/humanbench"},{"title":"opengvlab/hulk","url":"https://github.com/opengvlab/hulk"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":146724,"task":"Pose Estimation","parent_task":"1 Image, 2*2 Stitchi","dataset":"COCO (Common Objects in Context)","model_name":"BUCTD (PETR,  with generative sampling)","metrics":{"AP":"77.8"},"paper_url":"https://arxiv.org/abs/2306.07879v2","paper_title":"Rethinking pose estimation in crowds: overcoming the detection information-bottleneck and ambiguity","paper_date":"2023-06-13","code_links":[{"title":"amathislab/BUCTD","url":"https://github.com/amathislab/BUCTD"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":146725,"task":"Pose Estimation","parent_task":"1 Image, 2*2 Stitchi","dataset":"COCO (Common Objects in Context)","model_name":"Hulk(Finetune, ViT-B)","metrics":{"AP":"77.5"},"paper_url":"https://arxiv.org/abs/2312.01697v4","paper_title":"Hulk: A Universal Knowledge Translator for Human-Centric Tasks","paper_date":"2023-12-04","code_links":[{"title":"opengvlab/humanbench","url":"https://github.com/opengvlab/humanbench"},{"title":"opengvlab/hulk","url":"https://github.com/opengvlab/hulk"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":146726,"task":"Pose Estimation","parent_task":"1 Image, 2*2 Stitchi","dataset":"COCO (Common Objects in Context)","model_name":"I²R-Net (1st stage:HRFormer-B)","metrics":{"AP":"77.3","AP50":"91","AP75":"83.6","APL":"84.5","APM":"73","AR":"82.1"},"paper_url":"https://arxiv.org/abs/2206.10892v2","paper_title":"I^2R-Net: Intra- and Inter-Human Relation Network for Multi-Person Pose Estimation","paper_date":"2022-06-22","code_links":[{"title":"leijue222/Intra-and-Inter-Human-Relation-Network-for-MPEE","url":"https://github.com/leijue222/Intra-and-Inter-Human-Relation-Network-for-MPEE"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":146727,"task":"Pose Estimation","parent_task":"1 Image, 2*2 Stitchi","dataset":"COCO (Common Objects in Context)","model_name":"PATH (Partial FT)","metrics":{"AP":"77.1"},"paper_url":"https://arxiv.org/abs/2303.05675v1","paper_title":"HumanBench: Towards General Human-centric Perception with Projector Assisted Pretraining","paper_date":"2023-03-10","code_links":[{"title":"opengvlab/humanbench","url":"https://github.com/opengvlab/humanbench"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":146728,"task":"Pose Estimation","parent_task":"1 Image, 2*2 Stitchi","dataset":"COCO (Common Objects in Context)","model_name":"SOLIDER (swin-B)","metrics":{"AP":"76.6","AR":"81.5"},"paper_url":"https://arxiv.org/abs/2303.17602v1","paper_title":"Beyond Appearance: a Semantic Controllable Self-Supervised Learning Framework for Human-Centric Visual Tasks","paper_date":"2023-03-30","code_links":[{"title":"modelscope/modelscope","url":"https://github.com/modelscope/modelscope"},{"title":"tinyvision/SOLIDER","url":"https://github.com/tinyvision/SOLIDER"},{"title":"hasanirtiza/Pedestron","url":"https://github.com/hasanirtiza/Pedestron"},{"title":"DengpanFu/LUPerson","url":"https://github.com/DengpanFu/LUPerson"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":146729,"task":"Pose Estimation","parent_task":"1 Image, 2*2 Stitchi","dataset":"COCO (Common Objects in Context)","model_name":"PEFORMER-Xcit-dino-p8","metrics":{"AP":"72.6","AR":"79.4"},"paper_url":"https://arxiv.org/abs/2112.04981v1","paper_title":"PE-former: Pose Estimation Transformer","paper_date":"2021-12-09","code_links":[{"title":"padeler/pe-former","url":"https://github.com/padeler/pe-former"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]},{"id":146730,"task":"Pose Estimation","parent_task":"1 Image, 2*2 Stitchi","dataset":"COCO (Common Objects in Context)","model_name":"BUCTD (PETR, with generative sampling)","metrics":{"APL":"83.7","APM":"74.2"},"paper_url":"https://arxiv.org/abs/2306.07879v2","paper_title":"Rethinking pose estimation in crowds: overcoming the detection information-bottleneck and ambiguity","paper_date":"2023-06-13","code_links":[{"title":"amathislab/BUCTD","url":"https://github.com/amathislab/BUCTD"}],"metrics_order":"[\"AP\", \"AR\", \"AP50\", \"AP75\", \"APL\", \"APM\"]","area":"Computer Vision","uses_additional_data":0,"source":"archive","tags":[]}]}