paper-with-me

Papers

Policy Optimization via Importance Sampling

2018-09-17 · NeurIPS 2018 12 · Alberto Maria Metelli, Matteo Papini, Francesco Faccio, Marcello Restelli

Policy optimization is an effective reinforcement learning approach to solve continuous control tasks. Recent achievements have shown that alternating online and offline optimization is a successful choice for efficient trajectory reuse. However, deciding when to stop optimizing and collect new trajectories is non-trivial, as it requires to account for the variance of the objective function estimate. In this paper, we propose a novel, model-free, policy search algorithm, POIS, applicable in both action-based and parameter-based settings. We first derive a high-confidence bound for importance sampling estimation; then we define a surrogate objective function, which is optimized offline whenever a new batch of trajectories is collected. Finally, the algorithm is tested on a selection of continuous control tasks, with both linear and deep policies, and compared with state-of-the-art policy optimization methods.

📄 PDF Abstract BibTeX arXiv:1809.06098

Code (2)

T3p/pois 공식 구현 tf
t3p/baselines tf

Tasks

continuous-controlContinuous ControlReinforcement Learning

Similar Papers 제목 키워드 기반

Sample Dropout: A Simple yet Effective Variance Reduction Technique in Deep Policy Optimization

2023-02-05 · Zichuan Lin, Xiapeng Wu, Mingfei Sun, Deheng Ye 외

Recent success in Deep Reinforcement Learning (DRL) methods has shown that policy optimization with respect to an off-policy distribution via importance sampling is effective for sample reuse. In this paper, we show that…

Deep Reinforcement LearningMuJoCo

Policy Optimization Through Approximate Importance Sampling

2019-10-09 · Marcin B. Tomczak, Dongho Kim, Peter Vrancx, Kee-Eung Kim

Recent policy optimization approaches (Schulman et al., 2015a; 2017) have achieved substantial empirical successes by constructing new proxy optimization objectives. These proxy objectives allow stable and low variance p…

continuous-controlContinuous Control

Beyond Importance Sampling: Rejection-Gated Policy Optimization

2026-04-16 · Ziwu Sun, Zhen Gao, Jiyong Zhang, Jiaheng Li arxiv

We propose a new perspective on policy optimization: rather than reweighting all samples by their importance ratios, an optimizer should select which samples are trustworthy enough to drive a policy update. Building on t…

Reusing Historical Trajectories in Natural Policy Gradient via Importance Sampling: Convergence and Convergence Rate

2024-03-01 · Yifan Lin, Yuhao Wang, Enlu Zhou

Reinforcement learning provides a mathematical framework for learning-based control, whose success largely depends on the amount of data it can utilize. The efficient utilization of historical trajectories obtained from …

Policy Gradient Methods

GIPO: Gaussian Importance Sampling Policy Optimization

2026-03-04 · Chengxuan Lu, Zhenquan Zhang, Shukuan Wang, Qunzhi Lin 외 arxiv

Post-training with reinforcement learning (RL) has recently shown strong promise for advancing multimodal agents beyond supervised imitation. However, RL remains limited by poor data efficiency, particularly in settings …

Reinforcement Learning