{"task":"MuJoCo Games","dataset":"Walker2d","metric_names":["Mean"],"rows":[{"id":131222,"task":"MuJoCo Games","parent_task":null,"dataset":"Walker2d","model_name":"IQ-Learn","metrics":{"Mean":"5134"},"paper_url":"https://arxiv.org/abs/2106.12142v4","paper_title":"IQ-Learn: Inverse soft-Q Learning for Imitation","paper_date":"2021-06-23","code_links":[{"title":"Div99/IQ-Learn","url":"https://github.com/Div99/IQ-Learn"},{"title":"robfiras/ls-iq","url":"https://github.com/robfiras/ls-iq"},{"title":"google-deepmind/csil","url":"https://github.com/google-deepmind/csil"},{"title":"edmundmills/basalt-competition","url":"https://github.com/edmundmills/basalt-competition"},{"title":"MilkSilk/masters_thesis","url":"https://github.com/MilkSilk/masters_thesis"}],"metrics_order":"[\"Mean\"]","area":"Robots","uses_additional_data":0,"source":"archive","tags":[]},{"id":131223,"task":"MuJoCo Games","parent_task":null,"dataset":"Walker2d","model_name":"POP3D","metrics":{"Mean":"3966.01"},"paper_url":"http://arxiv.org/abs/1807.00442v4","paper_title":"Policy Optimization With Penalized Point Probability Distance: An Alternative To Proximal Policy Optimization","paper_date":"2018-07-02","code_links":[{"title":"cxxgtxy/POP3D","url":"https://github.com/cxxgtxy/POP3D"},{"title":"paperwithcode/pop3d","url":"https://github.com/paperwithcode/pop3d"}],"metrics_order":"[\"Mean\"]","area":"Robots","uses_additional_data":0,"source":"archive","tags":[]}]}