{"task":"Logical Reasoning","dataset":"BIG-bench (Temporal Sequences)","metric_names":["Accuracy"],"rows":[{"id":129294,"task":"Logical Reasoning","parent_task":null,"dataset":"BIG-bench (Temporal Sequences)","model_name":"PaLM 2 (few-shot, k=3, CoT)","metrics":{"Accuracy":"100"},"paper_url":"https://arxiv.org/abs/2305.10403v3","paper_title":"PaLM 2 Technical Report","paper_date":"2023-05-17","code_links":[{"title":"eternityyw/tram-benchmark","url":"https://github.com/eternityyw/tram-benchmark"}],"metrics_order":"[\"Accuracy\"]","area":"Methodology","uses_additional_data":0,"source":"archive","tags":[]},{"id":129295,"task":"Logical Reasoning","parent_task":null,"dataset":"BIG-bench (Temporal Sequences)","model_name":"PaLM 2 (few-shot, k=3, Direct)","metrics":{"Accuracy":"96.4"},"paper_url":"https://arxiv.org/abs/2305.10403v3","paper_title":"PaLM 2 Technical Report","paper_date":"2023-05-17","code_links":[{"title":"eternityyw/tram-benchmark","url":"https://github.com/eternityyw/tram-benchmark"}],"metrics_order":"[\"Accuracy\"]","area":"Methodology","uses_additional_data":0,"source":"archive","tags":[]},{"id":129296,"task":"Logical Reasoning","parent_task":null,"dataset":"BIG-bench (Temporal Sequences)","model_name":"PaLM 540B (few-shot, k=3)","metrics":{"Accuracy":"39.6"},"paper_url":"https://arxiv.org/abs/2303.17564v3","paper_title":"BloombergGPT: A Large Language Model for Finance","paper_date":"2023-03-30","code_links":[{"title":"yangletliu/finlora","url":"https://github.com/yangletliu/finlora"},{"title":"open-finance-lab/finlora","url":"https://github.com/open-finance-lab/finlora"}],"metrics_order":"[\"Accuracy\"]","area":"Methodology","uses_additional_data":0,"source":"archive","tags":[]},{"id":129297,"task":"Logical Reasoning","parent_task":null,"dataset":"BIG-bench (Temporal Sequences)","model_name":"BLOOM 176B (few-shot, k=3)","metrics":{"Accuracy":"36.8"},"paper_url":"https://arxiv.org/abs/2303.17564v3","paper_title":"BloombergGPT: A Large Language Model for Finance","paper_date":"2023-03-30","code_links":[{"title":"yangletliu/finlora","url":"https://github.com/yangletliu/finlora"},{"title":"open-finance-lab/finlora","url":"https://github.com/open-finance-lab/finlora"}],"metrics_order":"[\"Accuracy\"]","area":"Methodology","uses_additional_data":0,"source":"archive","tags":[]},{"id":129298,"task":"Logical Reasoning","parent_task":null,"dataset":"BIG-bench (Temporal Sequences)","model_name":"Chinchilla-70B (few-shot, k=5)","metrics":{"Accuracy":"32.0"},"paper_url":"https://arxiv.org/abs/2203.15556v1","paper_title":"Training Compute-Optimal Large Language Models","paper_date":"2022-03-29","code_links":[{"title":"karpathy/llama2.c","url":"https://github.com/karpathy/llama2.c"},{"title":"nkluge-correa/teenytinyllama","url":"https://github.com/nkluge-correa/teenytinyllama"}],"metrics_order":"[\"Accuracy\"]","area":"Methodology","uses_additional_data":0,"source":"archive","tags":[]},{"id":129299,"task":"Logical Reasoning","parent_task":null,"dataset":"BIG-bench (Temporal Sequences)","model_name":"Bloomberg GPT (few-shot, k=3)","metrics":{"Accuracy":"29.2"},"paper_url":"https://arxiv.org/abs/2303.17564v3","paper_title":"BloombergGPT: A Large Language Model for Finance","paper_date":"2023-03-30","code_links":[{"title":"yangletliu/finlora","url":"https://github.com/yangletliu/finlora"},{"title":"open-finance-lab/finlora","url":"https://github.com/open-finance-lab/finlora"}],"metrics_order":"[\"Accuracy\"]","area":"Methodology","uses_additional_data":0,"source":"archive","tags":[]},{"id":129300,"task":"Logical Reasoning","parent_task":null,"dataset":"BIG-bench (Temporal Sequences)","model_name":"OPT 66B (few-shot, k=3)","metrics":{"Accuracy":"23.6"},"paper_url":"https://arxiv.org/abs/2303.17564v3","paper_title":"BloombergGPT: A Large Language Model for Finance","paper_date":"2023-03-30","code_links":[{"title":"yangletliu/finlora","url":"https://github.com/yangletliu/finlora"},{"title":"open-finance-lab/finlora","url":"https://github.com/open-finance-lab/finlora"}],"metrics_order":"[\"Accuracy\"]","area":"Methodology","uses_additional_data":0,"source":"archive","tags":[]},{"id":129301,"task":"Logical Reasoning","parent_task":null,"dataset":"BIG-bench (Temporal Sequences)","model_name":"GPT-NeoX (few-shot, k=3)","metrics":{"Accuracy":"21.2"},"paper_url":"https://arxiv.org/abs/2303.17564v3","paper_title":"BloombergGPT: A Large Language Model for Finance","paper_date":"2023-03-30","code_links":[{"title":"yangletliu/finlora","url":"https://github.com/yangletliu/finlora"},{"title":"open-finance-lab/finlora","url":"https://github.com/open-finance-lab/finlora"}],"metrics_order":"[\"Accuracy\"]","area":"Methodology","uses_additional_data":0,"source":"archive","tags":[]},{"id":129302,"task":"Logical Reasoning","parent_task":null,"dataset":"BIG-bench (Temporal Sequences)","model_name":"Gopher-280B (few-shot, k=5)","metrics":{"Accuracy":"19.0"},"paper_url":"https://arxiv.org/abs/2112.11446v2","paper_title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","paper_date":"2021-12-08","code_links":[{"title":"allenai/dolma","url":"https://github.com/allenai/dolma"},{"title":"rvlopes/gloria","url":"https://github.com/rvlopes/gloria"},{"title":"bramiozo/PubScience","url":"https://github.com/bramiozo/PubScience"}],"metrics_order":"[\"Accuracy\"]","area":"Methodology","uses_additional_data":0,"source":"archive","tags":[]}]}