paper-with-me

Papers

Deterministic Continuous Replacement: Fast and Stable Module Replacement in Pretrained Transformers

2025-11-24 · Rowan Bradbury, Aniket Srinivasan Ashok, Sai Ram Kasanagottu, Gunmay Jhingran, Shuai Meng arxiv

Replacing modules in pretrained models, especially swapping quadratic self-attention for efficient attention alternatives, poses a hard optimization problem: cold-start reinitialization destabilizes frozen backbones. We isolate this core stability challenge in a controlled study. Deterministic Continuous Replacement (DCR) blends teacher and student outputs with a deterministic, annealed weight. Theoretically, DCR eliminates gate-induced gradient variance inherent to stochastic replacement. In a single-seed study, DCR attains faster convergence and stronger alignment than stochastic gating and distillation baselines on controlled attention replacement, establishing a foundation for heterogeneous operator swaps.

📄 PDF Abstract BibTeX arXiv:2511.18670

Code (0)

등록된 구현이 없습니다.

Similar Papers 제목 키워드 기반

Deterministic Policy Gradient for Reinforcement Learning with Continuous Time and State

2025-09-28 · Ziheng Cheng, Xin Guo, Yufei Zhang arxiv

The theory of continuous-time reinforcement learning (RL) has progressed rapidly in recent years. While the ultimate objective of RL is typically to learn deterministic control policies, most existing continuous-time RL …

General Reinforcement Learning

Deterministic Discrete Denoising

2025-09-25 · Hideyuki Suzuki, Wataru Kurebayashi, Hiroshi Yamashita arxiv

We propose a deterministic denoising algorithm for discrete-state diffusion models. The key idea is to derandomize the generative reverse Markov chain by introducing a variant of the herding algorithm, which induces dete…

Image Generation

Decision-Aware Quadratic ReLU Replacement for HE-Friendly Inference

2026-05-21 · Rui Li, Wenyuan Wu, Weijie Miao arxiv

Fully homomorphic encryption (FHE) supports only additions and multiplications, so FHE-only neural-network inference typically replaces ReLU with polynomials fitted over empirical activation intervals. Such interval fitt…

Bayesian Layers: A Module for Neural Network Uncertainty

2018-12-10 · NeurIPS 2019 12 · Dustin Tran, Michael W. Dusenberry, Mark van der Wilk, Danijar Hafner

We describe Bayesian Layers, a module designed for fast experimentation with neural network uncertainty. It extends neural network libraries with drop-in replacements for common layers. This enables composition via a uni…

Gaussian ProcessesMachine TranslationProbabilistic ProgrammingTranslation

Snyk VulnBench JS 1.0: Can LLMs Find the Same Bugs Twice?

2026-06-14 · Liran Tal, Johannes Kloos, Arsenii Rudich, Stephen Thoemmes 외 arxiv

We ran 300 repeated vulnerability-finding scans to measure how repeatable agentic large language model (LLM) security review is on the same JavaScript code, prompt, and benchmark harness. The headline result is that LLM …