paper-with-me

홈 › Papers

Don't Lie to Me: Avoiding Malicious Explanations with STEALTH

2023-01-25 · Lauren Alvarez, Tim Menzies

STEALTH is a method for using some AI-generated model, without suffering from malicious attacks (i.e. lying) or associated unfairness issues. After recursively bi-clustering the data, STEALTH system asks the AI model a limited number of queries about class labels. STEALTH asks so few queries (1 per data cluster) that malicious algorithms (a) cannot detect its operation, nor (b) know when to lie.

📄 PDF Abstract BibTeX arXiv:2301.10407

Code (0)

등록된 구현이 없습니다.

Tasks

Clustering

Similar Papers 제목 키워드 기반

Analyzing Federated Learning through an Adversarial Lens

2018-11-29 · ICLR 2019 5 · Arjun Nitin Bhagoji, Supriyo Chakraborty, Prateek Mittal, Seraphin Calo

Federated learning distributes model training among a multitude of agents, who, guided by privacy concerns, perform training using their local data but share only model parameter updates, for iterative aggregation at the…

Federated LearningModel Poisoningparameter estimation

Fool SHAP with Stealthily Biased Sampling

2022-05-30 · Gabriel Laberge, Ulrich Aïvodji, Satoshi Hara, Mario Marchand. 외

SHAP explanations aim at identifying which features contribute the most to the difference in model prediction at a specific input versus a background distribution. Recent studies have shown that they can be manipulated b…

Fairness

StealthRank: LLM Ranking Manipulation via Stealthy Prompt Optimization

2025-04-08 · Yiming Tang, Yi Fan, Chenxiao Yu, Tiankai Yang 외

The integration of large language models (LLMs) into information retrieval systems introduces new attack surfaces, particularly for adversarial ranking manipulations. We present StealthRank, a novel adversarial ranking a…

Adversarial TextInformation RetrievalProduct RecommendationRecommendation Systems

Can Quantum Federated Learning Withstand Circuit-Level Backdoors?

2026-05-18 · Aakar Mathur, Mohammed Ruknuddin, Ashish Gupta arxiv

Quantum Federated Learning (QFL) inherits the core vulnerability of federated optimization to malicious clients, while also introducing an attack surface from variational circuit training and measurement-driven gradients…

Federated Learning

Stealthy Jailbreak Attacks on Large Language Models via Benign Data Mirroring

2024-10-28 · Honglin Mu, Han He, Yuxin Zhou, Yunlong Feng 외

Large language model (LLM) safety is a critical issue, with numerous studies employing red team testing to enhance model security. Among these, jailbreak methods explore potential vulnerabilities by crafting malicious pr…

Language ModelingLanguage ModellingLarge Language Model