paper-with-me

홈 › Papers

Minority-Focused Text-to-Image Generation via Prompt Optimization

2024-10-10 · CVPR 2025 1 · Soobin Um, Jong Chul Ye

We investigate the generation of minority samples using pretrained text-to-image (T2I) latent diffusion models. Minority instances, in the context of T2I generation, can be defined as ones living on low-density regions of text-conditional data distributions. They are valuable for various applications of modern T2I generators, such as data augmentation and creative AI. Unfortunately, existing pretrained T2I diffusion models primarily focus on high-density regions, largely due to the influence of guided samplers (like CFG) that are essential for producing high-quality generations. To address this, we present a novel framework to counter the high-density-focus of T2I diffusion models. Specifically, we first develop an online prompt optimization framework that can encourage the emergence of desired properties during inference while preserving semantic contents of user-provided prompts. We subsequently tailor this generic prompt optimizer into a specialized solver that promotes the generation of minority features by incorporating a carefully-crafted likelihood objective. Our comprehensive experiments, conducted across various types of T2I models, demonstrate that our approach significantly enhances the capability to produce high-quality minority instances compared to existing samplers.

📄 PDF Abstract BibTeX arXiv:2410.07838

Code (1)

anonymous5293/minorityprompt 공식 구현 pytorch

Tasks

Data AugmentationImage GenerationText to Image GenerationText-to-Image Generation

Methods 이 논문이 사용한 방법론

Focus 설명 없음
Diffusion Diffusion models generate samples by gradually removing noise from a signal, and their training objective can be expressed as a reweighted variational lower-bound…

Similar Papers 제목 키워드 기반

Self-Improving Diffusion Classifiers with Minority Preference Optimization

2026-07-04 · Hyunsoo Kim, Jungmyung Wi, Soobin Um, Donghyun Kim 외 arxiv

Prior studies have demonstrated that diffusion classifiers achieve robust zero-shot classification performance. However, their effectiveness is strongly tied to the pretraining data distribution: they perform well in maj…

Prompt-Guided Generation of Structured Chest X-Ray Report Using a Pre-trained LLM

2024-04-17 · Hongzhao Li, Hongyu Wang, Xia Sun, Hua He 외

Medical report generation automates radiology descriptions from images, easing the burden on physicians and minimizing errors. However, current methods lack structured outputs and physician interactivity for clear, clini…

AnatomyLanguage ModelingLanguage ModellingLarge Language Model+2

Rethinking Training for De-biasing Text-to-Image Generation: Unlocking the Potential of Stable Diffusion

2024-08-22 · CVPR 2025 1 · Eunji Kim, Siwon Kim, MinJun Park, Rahim Entezari 외

Recent advancements in text-to-image models, such as Stable Diffusion, show significant demographic biases. Existing de-biasing techniques rely heavily on additional training, which imposes high computational costs and r…

FairnessImage GenerationText to Image GenerationText-to-Image Generation

Seeing It Before It Happens: In-Generation NSFW Detection for Diffusion-Based Text-to-Image Models

2025-08-05 · Fan Yang, Yihao Huang, Jiayi Zhu, Ling Shi 외 arxiv

Diffusion-based text-to-image (T2I) models enable high-quality image generation but also pose significant risks of misuse, particularly in producing not-safe-for-work (NSFW) content. While prior detection methods have fo…

Image Generation

C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes

2026-07-10 · Francis Fernandez, Arash Jahangiri, Salimeh Sekeh arxiv

Safety-critical perception systems must reliably detect rare object classes within small label spaces, a setting that long-tailed detection methods, designed for hundreds of classes with dense annotation, fundamentally d…

Natural Language Queries