paper-with-me

홈 › Papers

ImgEdit: A Unified Image Editing Dataset and Benchmark

2025-05-26 · Yang Ye, Xianyi He, Zongjian Li, Bin Lin, Shenghai Yuan, Zhiyuan Yan, Bohan Hou, Li Yuan

Recent advancements in generative models have enabled high-fidelity text-to-image generation. However, open-source image-editing models still lag behind their proprietary counterparts, primarily due to limited high-quality data and insufficient benchmarks. To overcome these limitations, we introduce ImgEdit, a large-scale, high-quality image-editing dataset comprising 1.2 million carefully curated edit pairs, which contain both novel and complex single-turn edits, as well as challenging multi-turn tasks. To ensure the data quality, we employ a multi-stage pipeline that integrates a cutting-edge vision-language model, a detection model, a segmentation model, alongside task-specific in-painting procedures and strict post-processing. ImgEdit surpasses existing datasets in both task novelty and data quality. Using ImgEdit, we train ImgEdit-E1, an editing model using Vision Language Model to process the reference image and editing prompt, which outperforms existing open-source models on multiple tasks, highlighting the value of ImgEdit and model design. For comprehensive evaluation, we introduce ImgEdit-Bench, a benchmark designed to evaluate image editing performance in terms of instruction adherence, editing quality, and detail preservation. It includes a basic testsuite, a challenging single-turn suite, and a dedicated multi-turn suite. We evaluate both open-source and proprietary models, as well as ImgEdit-E1, providing deep analysis and actionable insights into the current behavior of image-editing models. The source data are publicly available on https://github.com/PKU-YuanGroup/ImgEdit.

📄 PDF Abstract BibTeX arXiv:2505.20275

Code (2)

pku-yuangroup/imgedit 공식 구현 pytorch
PKU-YuanGroup/UniWorld-V1 pytorch

Tasks

Image EditingImage GenerationLanguage ModelingLanguage ModellingText to Image GenerationText-to-Image Generation

Similar Papers 제목 키워드 기반

Ovis-U1 Technical Report

2025-06-29 · Guo-Hua Wang, Shanshan Zhao, Xinjie Zhang, Liangfu Cao 외

In this report, we introduce Ovis-U1, a 3-billion-parameter unified model that integrates multimodal understanding, text-to-image generation, and image editing capabilities. Building on the foundation of the Ovis series,…

Image GenerationText to Image GenerationText-to-Image Generation

ScaleEdit-12M: Scaling Open-Source Image Editing Data Generation via Multi-Agent Framework

2026-03-21 · Guanzhou Chen, Erfei Cui, Changyao Tian, Danni Yang 외 arxiv

Instruction-based image editing has emerged as a key capability for unified multimodal models (UMMs), yet constructing large-scale, diverse, and high-quality editing datasets without costly proprietary APIs remains chall…

Image Editing

UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning

2025-11-18 · Rui Tian, Mingfei Gao, Haiming Gang, Jiasen Lu 외 arxiv

We present UniGen-1.5, a unified multimodal large language model (MLLM) for advanced image understanding, generation and editing. Building upon UniGen, we comprehensively enhance the model architecture and training pipel…

Reinforcement LearningImage GenerationImage Editing

OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing

2025-09-29 · Zhihong Chen, Xuehai Bai, Yang Shi, Chaoyou Fu 외 arxiv

The performance of unified multimodal models for image generation and editing is fundamentally constrained by the quality and comprehensiveness of their training data. While existing datasets have covered basic tasks lik…

Image GenerationStyle Transfer

Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation

2025-09-23 · Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin 외 arxiv

We propose Lavida-O, a unified Masked Diffusion Model (MDM) for multimodal understanding and generation. Unlike existing multimodal MDMs such as MMaDa and Muddit which only support simple image-level understanding tasks …

Text-to-Image GenerationMultimodal ReasoningImage Editing