{"task":"Code Generation","dataset":"HumanEval","metric_names":["Pass@1"],"rows":[{"id":29583,"task":"Code Generation","parent_task":null,"dataset":"HumanEval","model_name":"DeepSeek-R1 (MGDebugger)","metrics":{"Pass@1":"100"},"paper_url":"https://arxiv.org/abs/2410.01215v2","paper_title":"From Code to Correctness: Closing the Last Mile of Code Generation with Hierarchical Debugging","paper_date":"2024-10-02","code_links":[{"title":"YerbaPage/MGDebugger","url":"https://github.com/YerbaPage/MGDebugger"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":29584,"task":"Code Generation","parent_task":null,"dataset":"HumanEval","model_name":"LLaMA 3","metrics":{"Pass@1":"99.4"},"paper_url":"https://arxiv.org/abs/2402.16906v6","paper_title":"Debug like a Human: A Large Language Model Debugger via Verifying Runtime Execution Step-by-step","paper_date":"2024-02-25","code_links":[{"title":"floridsleeves/llmdebugger","url":"https://github.com/floridsleeves/llmdebugger"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":29585,"task":"Code Generation","parent_task":null,"dataset":"HumanEval","model_name":"QualityFlow (Sonnet-3.5)","metrics":{"Pass@1":"98.8"},"paper_url":"https://arxiv.org/abs/2501.17167v2","paper_title":"QualityFlow: An Agentic Workflow for Program Synthesis Controlled by LLM Quality Checks","paper_date":"2025-01-20","code_links":[],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":29586,"task":"Code Generation","parent_task":null,"dataset":"HumanEval","model_name":"Phi-2","metrics":{"Pass@1":"98.2"},"paper_url":"https://arxiv.org/abs/2411.14503v3","paper_title":"Planning-Driven Programming: A Large Language Model Programming Workflow","paper_date":"2024-11-21","code_links":[{"title":"you68681/lpw","url":"https://github.com/you68681/lpw"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":29587,"task":"Code Generation","parent_task":null,"dataset":"HumanEval","model_name":"EG-CFG (DeepSeek-V3-0324)","metrics":{"Pass@1":"96.95"},"paper_url":"https://arxiv.org/abs/2506.10948v1","paper_title":"Execution Guided Line-by-Line Code Generation","paper_date":"2025-06-12","code_links":[{"title":"boazlavon/eg_cfg","url":"https://github.com/boazlavon/eg_cfg"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":597460,"task":"Code Generation","parent_task":null,"dataset":"HumanEval","model_name":"How Many Tries Does It Take? Iterative S","metrics":{"Pass@1":"96.3"},"paper_url":"https://paperswithcode.com/paper/how-many-tries-does-it-take-iterative-self-repair-in-llm-code-generation-across-model-scales-and-benchmarks","paper_title":"How Many Tries Does It Take? Iterative Self-Repair in LLM Code Generation Across Model Scales and Benchmarks","paper_date":"2026-04-12","code_links":[],"metrics_order":null,"area":null,"uses_additional_data":null,"source":"auto","tags":[]},{"id":597446,"task":"Code Generation","parent_task":null,"dataset":"HumanEval","model_name":"SolidCoder","metrics":{"Pass@1":"95.7"},"paper_url":"https://paperswithcode.com/paper/solidcoder-bridging-the-mental-reality-gap-in-llm-code-generation-through-concrete-execution","paper_title":"SolidCoder: Bridging the Mental-Reality Gap in LLM Code Generation through Concrete Execution","paper_date":"2026-04-20","code_links":[],"metrics_order":null,"area":null,"uses_additional_data":null,"source":"auto","tags":[]},{"id":597597,"task":"Code Generation","parent_task":null,"dataset":"HumanEval","model_name":"DebateCoder","metrics":{"Pass@1":"95"},"paper_url":"https://paperswithcode.com/paper/adaptive-confidence-gating-in-multi-agent-collaboration-for-efficient-and-optimized-code-generation","paper_title":"Adaptive Confidence Gating in Multi-Agent Collaboration for Efficient and Optimized Code Generation","paper_date":"2026-01-29","code_links":[],"metrics_order":null,"area":null,"uses_additional_data":null,"source":"auto","tags":[]},{"id":29588,"task":"Code Generation","parent_task":null,"dataset":"HumanEval","model_name":"Mistral 7B","metrics":{"Pass@1":"93.9"},"paper_url":"https://arxiv.org/abs/2405.11403v1","paper_title":"MapCoder: Multi-Agent Code Generation for Competitive Problem Solving","paper_date":"2024-05-18","code_links":[{"title":"md-ashraful-pramanik/mapcoder","url":"https://github.com/md-ashraful-pramanik/mapcoder"},{"title":"Luoji-zju/Agents4PLC_release","url":"https://github.com/Luoji-zju/Agents4PLC_release"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":597599,"task":"Code Generation","parent_task":null,"dataset":"HumanEval","model_name":"Multi-task Code LLMs","metrics":{"Pass@1":"92.7"},"paper_url":"https://paperswithcode.com/paper/multi-task-code-llms-data-mix-or-model-merge","paper_title":"Multi-task Code LLMs: Data Mix or Model Merge?","paper_date":"2026-01-28","code_links":[],"metrics_order":null,"area":null,"uses_additional_data":null,"source":"auto","tags":[]},{"id":29589,"task":"Code Generation","parent_task":null,"dataset":"HumanEval","model_name":"Claude Sonnet 3.5","metrics":{"Pass@1":"90.85"},"paper_url":null,"paper_title":null,"paper_date":null,"code_links":[],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":29590,"task":"Code Generation","parent_task":null,"dataset":"HumanEval","model_name":"L2MAC (GPT-4)","metrics":{"Pass@1":"90.2"},"paper_url":"https://arxiv.org/abs/2310.02003v5","paper_title":"L2MAC: Large Language Model Automatic Computer for Extensive Code Generation","paper_date":"2023-10-02","code_links":[{"title":"samholt/l2mac","url":"https://github.com/samholt/l2mac"},{"title":"vanderschaarlab/l2mac","url":"https://github.com/vanderschaarlab/l2mac"}],"metrics_order":"[\"Pass@1\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]}]}