paper-with-me

Papers Continuous Control

“Continuous Control” 태그가 달린 논문 1,431편 · 필터 해제

Think Like a Pilot: Fine-Grained Long-Horizon UAV Navigation

2026-06-05 · Xiangyi Zheng, Xiangyu Wang, Qinan Liao, Zimu Tang 외 arxiv

Language-guided UAV agents must execute long-horizon semantic instructions while producing smooth, physically feasible continuous flight commands, yet existing Vision-Language Navigation (VLN) benchmarks typically use di…

Vision-Language NavigationContinuous Control

ActionMap: Robot Policy Learning via Voxel Action Heatmap

2026-06-05 · Pei Yang, Hai Ci, Yanzhe Chen, Qi Lv 외 arxiv

Vision-language-action (VLA) models have advanced rapidly across backbones, training recipes, and data scale, yet the action decoder, which converts the backbone's hidden state into a continuous control signal, has barel…

Continuous Control

Representation Learning Enables Scalable Multitask Deep Reinforcement Learning

2026-06-04 · Johan Obando-Ceron, Lu Li, Scott Fujimoto, Pierre-Luc Bacon 외 arxiv

Scaling reinforcement learning (RL) to diverse multitask settings remains a central challenge. While recent advances in model-based RL achieve strong performance, they rely on planning and complex training pipelines, mak…

Representation LearningReinforcement LearningContinuous Control

ConTraIRL: Factorized Contrastive Abstractions for Transferable IRL

2026-06-02 · Yikang Gui, Bikramjit Banerjee, Prashant Doshi arxiv

Reward transfer in Inverse Reinforcement Learning (IRL) is unreliable when policies must generalize to unseen combinations of environment dynamics and task goals. We propose Factorized Contrastive Abstractions for Transf…

Reinforcement LearningContinuous Control

From Ticks to Flows: Dynamics of Neural Reinforcement Learning in Continuous Environments

2026-06-02 · Saket Tiwari, Tejas Kotwal, George Konidaris arxiv

We present a novel theoretical framework for deep reinforcement learning (RL) in continuous environments by modeling the problem as a continuous-time stochastic process, drawing on insights from stochastic control. Build…

Reinforcement LearningContinuous Control

When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?

2026-05-29 · Stephane Hatgis-Kessell, Emma Brunskill arxiv

We study when large language models (LLMs) can serve as effective black-box policy optimizers for reinforcement learning (RL) tasks, i.e., when can we replace classical RL algorithms with an LLM? We explore this question…

Reinforcement LearningContinuous Control

Zero Collapse: A Failure Mode of Policy Gradient Methods in Discontinuous Reward Environments

2026-05-29 · Nishant Kumar, Enrique Areyan Viqueira, Amy Greenwald arxiv

Bidding in repeated auctions is a central challenge for reinforcement learning (RL), combining continuous control with the strategic complexities of digital advertising. While policy gradient and value-based methods seem…

Reinforcement LearningContinuous Control

Continuous Reasoning for Vision-Language-Action

2026-05-29 · Yueh-Hua Wu, Tatsuya Matsushima, Kei Ota arxiv

Natural language is a powerful reasoning medium for language and vision-language models, but it is mismatched to the granularity of continuous control. Text and explicit subgoals operate at task-level granularity, wherea…

Continuous Control

ZAPS-DA: Zero-Phase Action Policy Smoothing with Decoupled Actor for Continuous Control in Reinforcement Learning

2026-05-28 · Faiq Shamass arxiv

Continuous control policies trained with off-policy reinforcement learning frequently exhibit high-frequency action jitter, impractical for direct deployment on physical actuators. Post-hoc filtering attenuates jitter bu…

Reinforcement LearningContinuous Control

Beyond Surrogate Gradients: Fully Differentiable Token Pruning for Vision-Language Models

2026-05-27 · Landi He, Mingde Yao, Shawn Young, Lijian Xu arxiv

Visual token pruning reduces the computational cost of Vision-Language Models (VLMs) by removing redundant visual tokens. Existing methods typically rely on Gumbel-Softmax to approximate discrete selection during trainin…

Continuous Control

Theoretical Foundations and Effective Algorithms for Policy-Aware Simulator Learning

2026-05-27 · Christoph Dann, Yishay Mansour, Mehryar Mohri arxiv

Model-based reinforcement learning (MBRL) agents typically learn world models by minimizing predictive loss. However, powerful RL optimizers inevitably exploit minor model inaccuracies, leading to simulator exploitation …

Reinforcement LearningContinuous Control

Ratio-Variance Regularized Policy Optimization

2026-05-26 · Yu Luo, Shuo Han, Yihan Hu, Lei Lv 외 arxiv

Standard on-policy reinforcement learning relies on heuristic clipping to enforce trust regions, but this mechanism imposes a severe cost by indiscriminately truncating high-return yet high-divergence updates. We demonst…

Reinforcement LearningMathematical ReasoningContinuous Control

Streaming Reinforcement Learning under Partial Observability with Real-Time Recurrent Learning

2026-05-23 · Noah Farr, Aryaman Reddi, Carlo D'Eramo, Jan Peters arxiv

Streaming reinforcement learning has emerged as an online learning paradigm that conforms to the restrictions of natural learning agents that process data incrementally, i.e. with a batch size of 1 and no replay buffer. …

Reinforcement LearningContinuous Control

Reflex: Reinforcement Learning with Reflection Symmetry Exploitation in State-Based Continuous Control

2026-05-22 · Shuai Zhen, Yifan Zhang, Yuling Wang, Yanhua Yu arxiv

Reinforcement learning has long struggled with poor sample efficiency. One promising approach to mitigate this problem is leveraging group-invariant Markov Decision Processes ($G$-invariant MDPs). Existing works in this …

Reinforcement LearningContinuous ControlOpenAI Gym

Goal-Conditioned Agents that Learn Everything All at Once

2026-05-22 · Michael Matthews, Matthew Jackson, Michael Beukman, Thomas Foster 외 arxiv

A goal-conditioned reinforcement learning agent exploring an environment will see a wealth of information throughout a trajectory, most of which is discarded when only performing on-policy updates with respect to the com…

Reinforcement LearningContinuous Control

Kernel-Based Safe Exploration in Deep Reinforcement Learning

2026-05-21 · Rupak Majumdar, Nikhil Singh, Sadegh Soudjani arxiv

Safety has been a major concern when deploying deep reinforcement learning algorithms in the real world. A promising direction that ensures that the learned policy does not visit unsafe regions is to learn a \emph{barrie…

Reinforcement LearningContinuous Control

Dreaming Smoothly and Sample Efficiently with Gradient Penalized Latent Dynamics

2026-05-21 · Romil V. Sonigra, P. R. Kumar arxiv

Model-based reinforcement learning improves sample efficiency by learning a world model. However, existing latent world models such as DreamerV3 do not explicitly enforce local smoothness in their learned transition dyna…

Reinforcement LearningContinuous Control

CIG: Exploration via Conditional Information Gain

2026-05-20 · Tim Joseph, Marcus Fechner, Philipp Stegmaier, Karam Daaboul 외 arxiv

Intrinsic rewards for exploration in reinforcement learning condition on different contexts: lifelong rewards score each transition against accumulated experience but ignore within-rollout redundancy; episodic rewards pe…

Reinforcement LearningContinuous Control

PREFINE: Preference-Based Implicit Reward and Cost Fine-Tuning for Safety Alignment

2026-05-20 · Richa Verma, Bavish Kulur, Sanjay Chawla, Balaraman Ravindran arxiv

We address the problem of making a pre-trained reinforcement learning (RL) policy safety-aware by incorporating cost constraints without retraining it from scratch. While costs could be numerically encoded, we assume a m…

Computational EfficiencyReinforcement LearningContinuous ControlDecision Making

Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models

2026-05-19 · Wooseok Jeon, Seungho Park, Seunghyun Shin, Sangeyl Lee 외 arxiv

Image-to-video models often generate videos that remain overly static, compared to text-to-video models. While prior approaches mitigate this issue by weakening or modifying the image-conditioning signal, they often requ…

Continuous Control
← 이전 41–60 / 1,431 다음 →