paper-with-me

홈 › Papers

Task Editing for Generalizable 3D Visuomotor Policy Learning

2026-06-05 · Jian-Jian Jiang, YiHan Yang, Lan Wei, Yuming Luo, Xiao-Ming Wu, Xuhang Chen, Bin Fan, Dandan Zhang, Wei-Shi Zheng arxiv

3D visuomotor policies offer a promising direction for complex robotic manipulation, as depth maps and point clouds provide rich geometric information for spatial reasoning. However, their success often depends on large-scale real-world demonstrations, which are costly and time-consuming to collect. To this end, existing methods commonly use demonstration generation strategies to improve data efficiency by applying object-centric transformations to human-collected demonstrations, such as varying object poses or scales. While effective for local variation, these transformations largely preserve the original scene structure and skill sequence, limiting their ability to synthesize diverse scene-skill-object combinations for complex tasks. In this paper, we propose Task-Edit, a novel demonstration generation framework that generates diverse trajectories from a task-centric editing perspective. The key insight of Task-Edit is to decompose a task into scene, skill and object components, and flexibly recombine them. In this way, Task-Edit enables scalable demonstration generation and significantly improves generalization for long-horizon manipulation tasks. We evaluate Task-Edit through extensive real-world experiments and demonstrate three advantages: (1) Effectiveness: Task-Edit significantly improves 3D visuomotor policies across various real-world tasks and robot embodiments. (2) Generalizability: Task-Edit improves model generalization across different scenario setups. (3) Applicability: Task-Edit enables models to handle scenarios that are difficult to collect in the real world, including disturbance resistance, obstacle avoidance and unseen cluttered scenes.

📄 PDF Abstract BibTeX arXiv:2606.07012

Code (0)

등록된 구현이 없습니다.

Tasks

Spatial ReasoningPoint Clouds

Similar Papers 제목 키워드 기반

Adversarial Feature Training for Generalizable Robotic Visuomotor Control

2019-09-17 · Xi Chen, Ali Ghadirzadeh, Mårten Björkman, Patric Jensfelt

Deep reinforcement learning (RL) has enabled training action-selection policies, end-to-end, by learning a function which maps image pixels to action outputs. However, it's application to visuomotor robotic policy traini…

Deep Reinforcement LearningReinforcement LearningReinforcement Learning (RL)Transfer Learning

Efficient Training of Generalizable Visuomotor Policies via Control-Aware Augmentation

2024-01-17 · Yinuo Zhao, Kun Wu, Tianjiao Yi, Zhiyuan Xu 외

Improving generalization is one key challenge in embodied AI, where obtaining large-scale datasets across diverse scenarios is costly. Traditional weak augmentations, such as cropping and flipping, are insufficient for i…

Data AugmentationReinforcement Learning (RL)Robot Manipulation

DINOv3-Diffusion Policy: Self-Supervised Large Visual Model for Visuomotor Diffusion Policy Learning

2025-09-22 · ThankGod Egbe, Peng Wang, Zhihao Guo, Zidong Chen arxiv

This paper evaluates DINOv3, a recent large-scale self-supervised vision backbone, for visuomotor diffusion policy learning in robotic manipulation. We investigate whether a purely self-supervised encoder can match or su…

A Study on Enhancing the Generalization Ability of Visuomotor Policies via Data Augmentation

2025-11-13 · Hanwen Wang arxiv

The generalization ability of visuomotor policy is crucial, as a good policy should be deployable across diverse scenarios. Some methods can collect large amounts of trajectory augmentation data to train more generalizab…

Data Augmentation

Scalable Multi-Task Reinforcement Learning for Generalizable Spatial Intelligence in Visuomotor Agents

2025-07-31 · Shaofei Cai, Zhancun Mu, Haiwen Xia, Bowei Zhang 외 arxiv

While Reinforcement Learning (RL) has achieved remarkable success in language modeling, its triumph hasn't yet fully translated to visuomotor agents. A primary challenge in RL models is their tendency to overfit specific…

Zero-shot GeneralizationReinforcement LearningSpatial Reasoning