OpenAI Gym
17개 벤치마크 · 논문 406편 · 이 태스크의 논문 보기 →
Benchmarks
Ant-v4
HalfCheetah-v4
Hopper-v4
Humanoid-v4
Walker2d-v4
Ant-v2
CartPole-v1
HalfCheetah-v2
Hopper-v2
LunarLander-v2
Mountain Car
Pendulum-v1
Walker2d-v2
Humanoid-v2
InvertedPendulum-v2
MountainCarContinuous-v0
Most implemented
Proximal Policy Optimization Algorithms
Continuous control with deep reinforcement learning
Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor
Addressing Function Approximation Error in Actor-Critic Methods
Multi-Goal Reinforcement Learning: Challenging Robotics Environments and Request for Research
Decision Transformer: Reinforcement Learning via Sequence Modeling
Papers
SPADE: Self-Play in Adaptive Synthetic Executable Environments
Continuous self-improvement requires an ever-expanding pool of self-generated, diverse, adaptive goals. For language agents, existing training environment pools (hand-curated, statically synthesized, or frozen-verifier) …
OpenAI GymProDVI: Programmatic Dynamics Priors for Value Network Initialization
Deep Reinforcement Learning (RL) is notoriously sample inefficient. One contributing factor is that RL agents are typically initialized from scratch, forcing them to acquire task-relevant knowledge through online interac…
Reinforcement LearningOpenAI GymLagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies
Behavior cloning with high-capacity generative policies achieves strong imitation performance, but is often limited by demonstration coverage and distribution shift. Direct reinforcement learning fine-tuning can improve …
Reinforcement LearningOpenAI GymReflex: Reinforcement Learning with Reflection Symmetry Exploitation in State-Based Continuous Control
Reinforcement learning has long struggled with poor sample efficiency. One promising approach to mitigate this problem is leveraging group-invariant Markov Decision Processes ($G$-invariant MDPs). Existing works in this …
Reinforcement LearningContinuous ControlOpenAI GymInterpretable experiential learning based on state history and global feedback
A new interpretable experiential learning model based on state history and global feedback is presented. It is capable of learning a behavioral model represented by a transition graph between sets of states, with transit…
Reinforcement LearningOpenAI GymBitboard version of Tetris AI
The efficiency of game engines and policy optimization algorithms is crucial for training reinforcement learning (RL) agents in complex sequential decision-making tasks, such as Tetris. Existing Tetris implementations su…
Reinforcement LearningOpenAI Gym