paper-with-me

Model extraction

1개 벤치마크 · 논문 218편 · 이 태스크의 논문 보기 →

Benchmarks

Most implemented

Data-Free Model Extraction

2020-11-30 · 구현 2개

Papers

JudgeStealer: Extracting LLM Judging Capabilities across Evaluation Protocols

2026-08-27 · Chen Chen, Yaolin Chen, Xuehan Sun, Juan Lin 외 arxiv

Large language model (LLM) judges are increasingly used across various evaluation scenarios, making their judgment capabilities valuable intellectual property. However, black-box access exposes these capabilities to mode…

Model extraction

Caliber: Cross-Architecture Extraction-Cost Control for Score-Returning APIs

2026-08-02 · Chi Wang, Hanwen Wang, Yu Xia, Zihan Wang 외 arxiv

We present Caliber, an output-perturbation defense against model extraction that formulates noise selection as a calibration problem: how much the defense degrades the supervision signal used to train a surrogate, and th…

Knowledge DistillationModel extraction

DECODEM: Data Extraction from Corporate Organizational Documents via Enhanced Methods

2026-07-17 · Jens Frankenreiter arxiv

Much empirical legal research depends on translating unstructured text into structured variables. In corporate governance research as elsewhere, this translation has traditionally relied on human coding of documents such…

Binary ClassificationModel extraction

Let Them Steal: Trapping Large Language Model Extraction Attacks with Knowledge Honeypot

2026-06-14 · Yuyang Dai, Yushun Dong arxiv

Large language models deployed as commercial APIs are vulnerable to model extraction attacks, while existing defenses either act too late or degrade utility for legitimate users. We propose \textbf{Knowledge Trap}, a def…

Model extraction

SciR: A Controllable Benchmark for Scientific Reasoning in LLMs

2026-06-11 · Pierre Beckmann, Marco Valentino, Andre Freitas arxiv

Three paradigmatic forms of inference recur across scientific reasoning: deduction, induction, and causal abduction. Reliably evaluating LLMs on these in scientific settings is currently out of reach: scientific benchmar…

Model extraction

T2S: A Rehearsal-Based Approach for Extraction-Resistant Model Watermarking

2026-06-10 · Jian-Ping Mei, Weibin Zhang, Ao Yao, Tiantian Zhu 외 arxiv

Model watermarking safeguards AI model intellectual property by embedding distinctive knowledge that induces unique behavioral signatures. The primary technical challenge lies in ensuring watermark robustness against var…

Model extraction

전체 218편 보기 →