paper-with-me

홈 › Papers

MultiEdit: Advancing Instruction-based Image Editing on Diverse and Challenging Tasks

2025-09-18 · Mingsong Li, Lin Liu, Hongjun Wang, Haoxing Chen, Xijun Gu, Shizhan Liu, Dong Gong, Junbo Zhao, Zhenzhong Lan, Jianguo Li arxiv

Current instruction-based image editing (IBIE) methods struggle with challenging editing tasks, as both editing types and sample counts of existing datasets are limited. Moreover, traditional dataset construction often contains noisy image-caption pairs, which may introduce biases and limit model capabilities in complex editing scenarios. To address these limitations, we introduce MultiEdit, a comprehensive dataset featuring over 107K high-quality image editing samples. It encompasses 6 challenging editing tasks through a diverse collection of 18 non-style-transfer editing types and 38 style transfer operations, covering a spectrum from sophisticated style transfer to complex semantic operations like person reference editing and in-image text editing. We employ a novel dataset construction pipeline that utilizes two multi-modal large language models (MLLMs) to generate visual-adaptive editing instructions and produce high-fidelity edited images, respectively. Extensive experiments demonstrate that fine-tuning foundational open-source models with our MultiEdit-Train set substantially improves models' performance on sophisticated editing tasks in our proposed MultiEdit-Test benchmark, while effectively preserving their capabilities on the standard editing benchmark. We believe MultiEdit provides a valuable resource for advancing research into more diverse and challenging IBIE capabilities. Our dataset is available at https://huggingface.co/datasets/inclusionAI/MultiEdit.

📄 PDF Abstract BibTeX arXiv:2509.14638

Code (0)

등록된 구현이 없습니다.

Tasks

Style TransferImage Editing

Similar Papers 제목 키워드 기반

SpatialFlow-GRPO: Where Spatial Credit Drives Image Editing

2026-06-25 · Yankai Yang, Yancheng Long, Wei Chen, Xingyu Lu 외 arxiv

Recent online reinforcement learning has substantially improved image editing quality. However, existing Flow-GRPO-style methods usually rely on a single whole-image reward, which makes fine-grained editing optimization …

Reinforcement LearningImage Editing

MultiEditor: Controllable Multimodal Object Editing for Driving Scenarios Using 3D Gaussian Splatting Priors

2025-07-29 · Shouyi Lu, Zihan Lin, Chao Lu, Huanran Wang 외 arxiv

Autonomous driving systems rely heavily on multimodal perception data to understand complex environments. However, the long-tailed distribution of real-world data hinders generalization, especially for rare but safety-cr…

Autonomous DrivingPoint Clouds

SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing

2024-05-07 · Yuying Ge, Sijie Zhao, Chen Li, Yixiao Ge 외

In this technical report, we introduce SEED-Data-Edit: a unique hybrid dataset for instruction-guided image editing, which aims to facilitate image manipulation using open-form language. SEED-Data-Edit is composed of thr…

Image ManipulationLanguage ModelingLanguage ModellingLarge Language Model+1

HumanEdit: A High-Quality Human-Rewarded Dataset for Instruction-based Image Editing

2024-12-05 · Jinbin Bai, Wei Chow, Ling Yang, Xiangtai Li 외

We present HumanEdit, a high-quality, human-rewarded dataset specifically designed for instruction-guided image editing, enabling precise and diverse image manipulations through open-form language instructions. Previous …

GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing

2025-05-16 · Yusu Qian, Jiasen Lu, Tsu-Jui Fu, Xinze Wang 외

Editing images using natural language instructions has become a natural and expressive way to modify visual content; yet, evaluating the performance of such models remains challenging. Existing evaluation approaches ofte…

Instruction FollowingMultiple-choicetext-guided-image-editingtext similarity