paper-with-me

Papers

OmniGen2: Exploration to Advanced Multimodal Generation

2025-06-23 · Chenyuan Wu, Pengfei Zheng, Ruiran Yan, Shitao Xiao, Xin Luo, Yueze Wang, Wanli Li, Xiyan Jiang, Yexin Liu, Junjie Zhou, Ze Liu, Ziyi Xia, Chaofan Li, Haoge Deng, Jiahao Wang, Kun Luo, Bo Zhang, Defu Lian, Xinlong Wang, Zhongyuan Wang, Tiejun Huang, Zheng Liu

In this work, we introduce OmniGen2, a versatile and open-source generative model designed to provide a unified solution for diverse generation tasks, including text-to-image, image editing, and in-context generation. Unlike OmniGen v1, OmniGen2 features two distinct decoding pathways for text and image modalities, utilizing unshared parameters and a decoupled image tokenizer. This design enables OmniGen2 to build upon existing multimodal understanding models without the need to re-adapt VAE inputs, thereby preserving the original text generation capabilities. To facilitate the training of OmniGen2, we developed comprehensive data construction pipelines, encompassing image editing and in-context generation data. Additionally, we introduce a reflection mechanism tailored for image generation tasks and curate a dedicated reflection dataset based on OmniGen2. Despite its relatively modest parameter size, OmniGen2 achieves competitive results on multiple task benchmarks, including text-to-image and image editing. To further evaluate in-context generation, also referred to as subject-driven tasks, we introduce a new benchmark named OmniContext. OmniGen2 achieves state-of-the-art performance among open-source models in terms of consistency. We will release our models, training code, datasets, and data construction pipeline to support future research in this field. Project Page: https://vectorspacelab.github.io/OmniGen2; GitHub Link: https://github.com/VectorSpaceLab/OmniGen2

📄 PDF Abstract BibTeX arXiv:2506.18871

Code (1)

vectorspacelab/omnigen2 공식 구현 pytorch

Tasks

Image Generationmultimodal generationText Generation

Similar Papers 제목 키워드 기반

OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks

2025-05-24 · Jiayu Wang, Yang Jiao, Yue Yu, Tianwen Qian 외

Recent breakthroughs in large multimodal models (LMMs), such as the impressive GPT-4o-Native, have demonstrated remarkable proficiency in following general-purpose instructions for image generation. However, current benc…

Image GenerationInstruction Followingmultimodal generation

OmniGen: Unified Image Generation

2024-09-17 · CVPR 2025 1 · Shitao Xiao, Yueze Wang, Junjie Zhou, Huaying Yuan 외

The emergence of Large Language Models (LLMs) has unified language generation tasks and revolutionized human-machine interaction. However, in the realm of image generation, a unified model capable of handling various tas…

Edge DetectionImage GenerationPose EstimationText Generation+3

OmniGen-AR: AutoRegressive Any-to-Image Generation

2026-06-08 · Junke Wang, Xun Wang, Qiushan Guo, Peize Sun 외 arxiv

Autoregressive (AR) models have demonstrated strong potential in visual generation, offering superior performance with simple architectures and optimization objectives. However, existing methods are typically limited to …

Text-to-Video GenerationText-to-Image GenerationImage Editing

OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving

2025-12-16 · Tao Tang, Enhui Ma, xia zhou, Letian Wang 외 arxiv

Autonomous driving has seen remarkable advancements, largely driven by extensive real-world data collection. However, acquiring diverse and corner-case data remains costly and inefficient. Generative models have emerged …

Autonomous Driving

UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model

2026-02-15 · Shaobin Zhuang, Yuang Ai, Jiaming Han, Weijia Mao 외 arxiv

Unified Multimodal Large Language Models (MLLMs) require a visual representation that simultaneously supports high-fidelity reconstruction, complex semantic extraction, and generative suitability. However, existing visua…

Image Generation