{"task":"Code Generation","dataset":"Turbulence","metric_names":["CorrSc"],"rows":[{"id":29350,"task":"Code Generation","parent_task":null,"dataset":"Turbulence","model_name":"GPT-4","metrics":{"CorrSc":"0.848"},"paper_url":"https://arxiv.org/abs/2312.14856v3","paper_title":"Turbulence: Systematically and Automatically Testing Instruction-Tuned Large Language Models for Code","paper_date":"2023-12-22","code_links":[{"title":"shahinhonarvar/turbulence-benchmark","url":"https://github.com/shahinhonarvar/turbulence-benchmark"}],"metrics_order":"[\"CorrSc\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":29351,"task":"Code Generation","parent_task":null,"dataset":"Turbulence","model_name":"GPT-3.5-Turbo","metrics":{"CorrSc":"0.617"},"paper_url":"https://arxiv.org/abs/2312.14856v3","paper_title":"Turbulence: Systematically and Automatically Testing Instruction-Tuned Large Language Models for Code","paper_date":"2023-12-22","code_links":[{"title":"shahinhonarvar/turbulence-benchmark","url":"https://github.com/shahinhonarvar/turbulence-benchmark"}],"metrics_order":"[\"CorrSc\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":29352,"task":"Code Generation","parent_task":null,"dataset":"Turbulence","model_name":"CodeLlama:13B-4bit-quantised","metrics":{"CorrSc":"0.327"},"paper_url":"https://arxiv.org/abs/2312.14856v3","paper_title":"Turbulence: Systematically and Automatically Testing Instruction-Tuned Large Language Models for Code","paper_date":"2023-12-22","code_links":[{"title":"shahinhonarvar/turbulence-benchmark","url":"https://github.com/shahinhonarvar/turbulence-benchmark"}],"metrics_order":"[\"CorrSc\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":29353,"task":"Code Generation","parent_task":null,"dataset":"Turbulence","model_name":"CodeLlama:7B-4bit-quantised","metrics":{"CorrSc":"0.289"},"paper_url":"https://arxiv.org/abs/2312.14856v3","paper_title":"Turbulence: Systematically and Automatically Testing Instruction-Tuned Large Language Models for Code","paper_date":"2023-12-22","code_links":[{"title":"shahinhonarvar/turbulence-benchmark","url":"https://github.com/shahinhonarvar/turbulence-benchmark"}],"metrics_order":"[\"CorrSc\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]},{"id":29354,"task":"Code Generation","parent_task":null,"dataset":"Turbulence","model_name":"Command","metrics":{"CorrSc":"0.063"},"paper_url":"https://arxiv.org/abs/2312.14856v3","paper_title":"Turbulence: Systematically and Automatically Testing Instruction-Tuned Large Language Models for Code","paper_date":"2023-12-22","code_links":[{"title":"shahinhonarvar/turbulence-benchmark","url":"https://github.com/shahinhonarvar/turbulence-benchmark"}],"metrics_order":"[\"CorrSc\"]","area":"Natural Language Processing","uses_additional_data":0,"source":"archive","tags":[]}]}