paper-with-me

Papers

PureGen: Universal Data Purification for Train-Time Poison Defense via Generative Model Dynamics

2024-05-28 · Sunay Bhat, Jeffrey Jiang, Omead Pooladzandi, Alexander Branch, Gregory Pottie

Train-time data poisoning attacks threaten machine learning models by introducing adversarial examples during training, leading to misclassification. Current defense methods often reduce generalization performance, are attack-specific, and impose significant training overhead. To address this, we introduce a set of universal data purification methods using a stochastic transform, $\Psi(x)$, realized via iterative Langevin dynamics of Energy-Based Models (EBMs), Denoising Diffusion Probabilistic Models (DDPMs), or both. These approaches purify poisoned data with minimal impact on classifier generalization. Our specially trained EBMs and DDPMs provide state-of-the-art defense against various attacks (including Narcissus, Bullseye Polytope, Gradient Matching) on CIFAR-10, Tiny-ImageNet, and CINIC-10, without needing attack or classifier-specific information. We discuss performance trade-offs and show that our methods remain highly effective even with poisoned or distributionally shifted generative model training data.

📄 PDF Abstract BibTeX arXiv:2405.18627

Code (1)

SunayBhat1/PureGen_PoisonDefense 공식 구현 pytorch

Tasks

Data PoisoningDenoising

Methods 이 논문이 사용한 방법론

SET Dynamic Sparse Training method where weight mask is updated randomly periodically
Diffusion Diffusion models generate samples by gradually removing noise from a signal, and their training objective can be expressed as a reweighted variational lower-bound…

Similar Papers 제목 키워드 기반

Universal Adversarial Defense in Remote Sensing Based on Pre-trained Denoising Diffusion Models

2023-07-31 · Weikang Yu, Yonghao Xu, Pedram Ghamisi

Deep neural networks (DNNs) have risen to prominence as key solutions in numerous AI applications for earth observation (AI4EO). However, their susceptibility to adversarial examples poses a critical challenge, compromis…

Adversarial DefenseAdversarial PurificationDenoisingEarth Observation+2

Universal Adversarial Purification with DDIM Metric Loss for Stable Diffusion

2026-01-12 · Li Zheng, Liangbin Xie, Jiantao Zhou, He YiMin arxiv

Stable Diffusion (SD) often produces degraded outputs when the training dataset contains adversarial noise. Adversarial purification offers a promising solution by removing adversarial noise from contaminated data. Howev…

PureEBM: Universal Poison Purification via Mid-Run Dynamics of Energy-Based Models

2024-05-28 · Omead Pooladzandi, Jeffrey Jiang, Sunay Bhat, Gregory Pottie

Data poisoning attacks pose a significant threat to the integrity of machine learning models by leading to misclassification of target distribution data by injecting adversarial examples during training. Existing state-o…

Data Poisoning

FLARE: Toward Universal Dataset Purification against Backdoor Attacks

2024-11-29 · Linshan Hou, Wei Luo, Zhongyun Hua, Songhua Chen 외

Deep neural networks (DNNs) are susceptible to backdoor attacks, where adversaries poison datasets with adversary-specified triggers to implant hidden backdoors, enabling malicious manipulation of model predictions. Data…

All

Decoupling Semantics and Fingerprints: A Universal Representation for AI-Generated Image Detection

2026-05-08 · Zhiyuan Wang, Yanxiang Chen, Pengcheng Zhao, Yunfeng Diao 외 arxiv

Detecting AI-generated images across unseen architectures remains challenging, as existing models often overfit to generator-specific fingerprints and semantic content rather than learning universal forgery traces. We at…