paper-with-me

OpenAI Gym

17개 벤치마크 · 논문 406편 · 이 태스크의 논문 보기 →

Benchmarks

Ant-v4

결과 5개

HalfCheetah-v4

결과 5개

Hopper-v4

결과 5개

Humanoid-v4

결과 5개

Walker2d-v4

결과 5개

Ant-v2

결과 2개

CartPole-v1

결과 2개

HalfCheetah-v2

결과 2개

Hopper-v2

결과 2개

LunarLander-v2

결과 2개

Mountain Car

결과 2개

Pendulum-v1

결과 2개

Walker2d-v2

결과 2개

Humanoid-v2

결과 1개

InvertedPendulum-v2

결과 1개

Most implemented

Proximal Policy Optimization Algorithms

2017-07-20 · 구현 188개

Papers

SPADE: Self-Play in Adaptive Synthetic Executable Environments

2026-08-19 · Bo Liu, Simon Yu, Yiding Jiang, Ao Qu 외 arxiv

Continuous self-improvement requires an ever-expanding pool of self-generated, diverse, adaptive goals. For language agents, existing training environment pools (hand-curated, statically synthesized, or frozen-verifier) …

OpenAI Gym

ProDVI: Programmatic Dynamics Priors for Value Network Initialization

2026-08-06 · Xinwei Liu, Junyuan Liang, Jianting Zhang, Wuhui Chen arxiv

Deep Reinforcement Learning (RL) is notoriously sample inefficient. One contributing factor is that RL agents are typically initialized from scratch, forcing them to acquire task-relevant knowledge through online interac…

Reinforcement LearningOpenAI Gym

Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies

2026-05-31 · Hikmet Simsir, Ozgur S. Oguz arxiv

Behavior cloning with high-capacity generative policies achieves strong imitation performance, but is often limited by demonstration coverage and distribution shift. Direct reinforcement learning fine-tuning can improve …

Reinforcement LearningOpenAI Gym

Reflex: Reinforcement Learning with Reflection Symmetry Exploitation in State-Based Continuous Control

2026-05-22 · Shuai Zhen, Yifan Zhang, Yuling Wang, Yanhua Yu arxiv

Reinforcement learning has long struggled with poor sample efficiency. One promising approach to mitigate this problem is leveraging group-invariant Markov Decision Processes ($G$-invariant MDPs). Existing works in this …

Reinforcement LearningContinuous ControlOpenAI Gym

Interpretable experiential learning based on state history and global feedback

2026-05-01 · Anton Kolonin arxiv

A new interpretable experiential learning model based on state history and global feedback is presented. It is capable of learning a behavioral model represented by a transition graph between sets of states, with transit…

Reinforcement LearningOpenAI Gym

Bitboard version of Tetris AI

2026-03-24 · Xingguo Chen, Pingshou Xiong, Zhenyu Luo, Mengfei Hu 외 arxiv

The efficiency of game engines and policy optimization algorithms is crucial for training reinforcement learning (RL) agents in complex sequential decision-making tasks, such as Tetris. Existing Tetris implementations su…

Reinforcement LearningOpenAI Gym

전체 406편 보기 →