paper-with-me

Papers OpenAI Gym

“OpenAI Gym” 태그가 달린 논문 406편 · 필터 해제

SPADE: Self-Play in Adaptive Synthetic Executable Environments

2026-08-19 · Bo Liu, Simon Yu, Yiding Jiang, Ao Qu 외 arxiv

Continuous self-improvement requires an ever-expanding pool of self-generated, diverse, adaptive goals. For language agents, existing training environment pools (hand-curated, statically synthesized, or frozen-verifier) …

OpenAI Gym

ProDVI: Programmatic Dynamics Priors for Value Network Initialization

2026-08-06 · Xinwei Liu, Junyuan Liang, Jianting Zhang, Wuhui Chen arxiv

Deep Reinforcement Learning (RL) is notoriously sample inefficient. One contributing factor is that RL agents are typically initialized from scratch, forcing them to acquire task-relevant knowledge through online interac…

Reinforcement LearningOpenAI Gym

Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies

2026-05-31 · Hikmet Simsir, Ozgur S. Oguz arxiv

Behavior cloning with high-capacity generative policies achieves strong imitation performance, but is often limited by demonstration coverage and distribution shift. Direct reinforcement learning fine-tuning can improve …

Reinforcement LearningOpenAI Gym

Reflex: Reinforcement Learning with Reflection Symmetry Exploitation in State-Based Continuous Control

2026-05-22 · Shuai Zhen, Yifan Zhang, Yuling Wang, Yanhua Yu arxiv

Reinforcement learning has long struggled with poor sample efficiency. One promising approach to mitigate this problem is leveraging group-invariant Markov Decision Processes ($G$-invariant MDPs). Existing works in this …

Reinforcement LearningContinuous ControlOpenAI Gym

Interpretable experiential learning based on state history and global feedback

2026-05-01 · Anton Kolonin arxiv

A new interpretable experiential learning model based on state history and global feedback is presented. It is capable of learning a behavioral model represented by a transition graph between sets of states, with transit…

Reinforcement LearningOpenAI Gym

Bitboard version of Tetris AI

2026-03-24 · Xingguo Chen, Pingshou Xiong, Zhenyu Luo, Mengfei Hu 외 arxiv

The efficiency of game engines and policy optimization algorithms is crucial for training reinforcement learning (RL) agents in complex sequential decision-making tasks, such as Tetris. Existing Tetris implementations su…

Reinforcement LearningOpenAI Gym

Robust Transfer Learning with Side Information

2026-03-09 · Akram S. Awad, Shihab Ahmed, Yue Wang, George K. Atia arxiv

Robust Markov Decision Processes (MDPs) address environmental shift through distributionally robust optimization (DRO) by finding an optimal worst-case policy within an uncertainty set of transition kernels. However, sta…

Transfer LearningOpenAI Gym

Direct Soft-Policy Sampling via Langevin Dynamics

2026-02-08 · Donghyeon Ki, Hee-Jun Ahn, Kyungyoon Kim, Byung-Jun Lee arxiv

Soft policies in reinforcement learning define policies as Boltzmann distributions over state-action value functions, providing a principled mechanism for balancing exploration and exploitation. However, realizing such s…

Reinforcement LearningOpenAI Gym

One Step Is Enough: Dispersive MeanFlow Policy Optimization

2026-01-28 · Guowei Zou, Haitao Wang, Hejun Wu, Yukun Qian 외 arxiv

Real-time robotic control demands fast action generation. However, existing generative policies based on diffusion and flow matching require multi-step sampling, fundamentally limiting deployment in time-critical scenari…

Knowledge DistillationReinforcement LearningOpenAI Gym

Formulating Reinforcement Learning for Human-Robot Collaboration through Off-Policy Evaluation

2026-01-27 · Saurav Singh, Rodney Sanchez, Alexander Ororbia, Jamison Heard arxiv

Reinforcement learning (RL) has the potential to transform real-world decision-making systems by enabling autonomous agents to learn from experience. Deploying RL in real-world settings, especially in the context of huma…

Reinforcement LearningOffline RLOpenAI Gym

Proximal Policy Optimization with Evolutionary Mutations

2026-01-21 · Casimir Czworkowski, Stephen Hornish, Alhassan S. Yasin arxiv

Proximal Policy Optimization (PPO) is a widely used reinforcement learning algorithm known for its stability and sample efficiency, but it often suffers from premature convergence due to limited exploration. In this pape…

Reinforcement LearningOpenAI Gym

Reward Learning through Ranking Mean Squared Error

2026-01-14 · Chaitanya Kharyal, Calarina Muslimani, Matthew E. Taylor arxiv

Reward design remains a significant bottleneck in applying reinforcement learning (RL) to real-world problems. A popular alternative is reward learning, where reward functions are inferred from human feedback rather than…

Reinforcement LearningOpenAI Gym

Know your Trajectory -- Trustworthy Reinforcement Learning deployment through Importance-Based Trajectory Analysis

2025-12-07 · Clifford F, Devika Jay, Abhishek Sarkar, Satheesh K Perepu 외 arxiv

As Reinforcement Learning (RL) agents are increasingly deployed in real-world applications, ensuring their behavior is transparent and trustworthy is paramount. A key component of trust is explainability, yet much of the…

Reinforcement LearningOpenAI Gym

Enhancing Deep Deterministic Policy Gradients on Continuous Control Tasks with Decoupled Prioritized Experience Replay

2025-12-04 · Mehmet Efe Lorasdagi, Dogan Can Cicek, Furkan Burak Mutlu, Suleyman Serdar Kozat arxiv

Background: Deep Deterministic Policy Gradient-based reinforcement learning algorithms utilize Actor-Critic architectures, where both networks are typically trained using identical batches of replayed transitions. Howeve…

Reinforcement LearningContinuous ControlOpenAI Gym

A Quantitative Comparison of Centralised and Distributed Reinforcement Learning-Based Control for Soft Robotic Arms

2025-11-04 · Linxin Hou, Qirui Wu, Zhihang Qin, Neil Banerjee 외 arxiv

This paper presents a quantitative comparison between centralised and distributed multi-agent reinforcement learning (MARL) architectures for controlling a soft robotic arm modelled as a Cosserat rod in simulation. Using…

Multi-agent Reinforcement LearningOpenAI Gym

Off-policy Reinforcement Learning with Model-based Exploration Augmentation

2025-10-29 · Likun Wang, Xiangteng Zhang, Yinuo Wang, Guojian Zhan 외 arxiv

Exploration is fundamental to reinforcement learning (RL), as it determines how effectively an agent discovers and exploits the underlying structure of its environment to achieve optimal performance. Existing exploration…

Reinforcement LearningOpenAI Gym

Mind Your Entropy: From Maximum Entropy to Trajectory Entropy-Constrained RL

2025-10-25 · Guojian Zhan, Likun Wang, Pengcheng Wang, Feihong Zhang 외 arxiv

Maximum entropy has become a mainstream off-policy reinforcement learning (RL) framework for balancing exploitation and exploration. However, two bottlenecks still limit further performance improvement: (1) non-stationar…

Reinforcement LearningOpenAI Gym

Adversarial Reinforcement Learning for Offensive and Defensive Agents in a Simulated Zero-Sum Network Environment

2025-10-03 · Abrar Shahid, Ibteeker Mahir Ishum, AKM Tahmidul Haque, M Sohel Rahman 외 arxiv

This paper presents a controlled study of adversarial reinforcement learning in network security through a custom OpenAI Gym environment that models brute-force attacks and reactive defenses on multi-port services. The e…

Reinforcement LearningTransfer LearningOpenAI Gym

A Forensic Analysis of Synthetic Data in RL: Diagnosing and Solving Algorithmic Failures in Model-Based Policy Optimization

2025-10-01 · Brett Barkley, David Fridovich-Keil arxiv

Synthetic data is central to data-efficient Dyna-style model-based reinforcement learning, but it can also degrade performance. We study this failure in Model-Based Policy Optimization (MBPO), which performs actor-critic…

Reinforcement LearningContinuous ControlOpenAI Gym

Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient

2025-09-02 · Zhongzhu Zhou, Yibo Yang, Ziyan Chen, Fengxiang Bie 외 arxiv

Policy gradient (PG) methods in reinforcement learning frequently utilize deep neural networks (DNNs) to learn a shared backbone of feature representations used to compute likelihoods in an action selection layer. Numero…

Reinforcement LearningOpenAI Gym
1–20 / 406 다음 →