paper-with-me

홈 › Papers

Training on Synthetic Noise Improves Robustness to Natural Noise in Machine Translation

2019-02-05 · WS 2019 11 · Vladimir Karpukhin, Omer Levy, Jacob Eisenstein, Marjan Ghazvininejad

We consider the problem of making machine translation more robust to character-level variation at the source side, such as typos. Existing methods achieve greater coverage by applying subword models such as byte-pair encoding (BPE) and character-level encoders, but these methods are highly sensitive to spelling mistakes. We show how training on a mild amount of random synthetic noise can dramatically improve robustness to these variations, without diminishing performance on clean text. We focus on translation performance on natural noise, as captured by frequent corrections in Wikipedia edit logs, and show that robustness to such noise can be achieved using a balanced diet of simple synthetic noises at training time, without access to the natural noise data or distribution.

📄 PDF Abstract BibTeX arXiv:1902.01509

Code (0)

등록된 구현이 없습니다.

Tasks

Machine TranslationTranslation

Similar Papers 제목 키워드 기반

Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data

2026-05-11 · Xu Guo, Runyu Peng, Jian Tong, Yunhua Zhou 외 arxiv

Large language models (LLMs) rely on web-scale corpora for pre-training. The noise inherent in these datasets tends to obscure meaningful patterns and ultimately degrade model performance. Data curation mitigates but can…

When Robustness Doesn’t Promote Robustness: Synthetic vs. Natural Distribution Shifts on ImageNet

2019-09-25 · Rohan Taori, Achal Dave, Vaishaal Shankar, Nicholas Carlini 외

We conduct a large experimental comparison of various robustness metrics for image classification. The main question of our study is to what extent current synthetic robustness interventions (lp-adversarial examples, noi…

image-classificationImage Classification

Consistency Regularization Can Improve Robustness to Label Noise

2021-10-04 · Erik Englesson, Hossein Azizpour

Consistency regularization is a commonly-used technique for semi-supervised and self-supervised learning. It is an auxiliary objective function that encourages the prediction of the network to be similar in the vicinity …

Self-Supervised Learning

ASR Under Noise: Exploring Robustness for Sundanese and Javanese

2025-09-30 · Salsabila Zahirah Pranida, Muhammad Cendekia Airlangga, Rifo Ahmad Genadi, Shady Shehata arxiv

We investigate the robustness of Whisper-based automatic speech recognition (ASR) models for two major Indonesian regional languages: Javanese and Sundanese. While recent work has demonstrated strong ASR performance unde…

Speech Recognition

Measuring Robustness to Natural Distribution Shifts in Image Classification

2020-07-01 · NeurIPS 2020 12 · Rohan Taori, Achal Dave, Vaishaal Shankar, Nicholas Carlini 외

We study how robust current ImageNet models are to distribution shifts arising from natural variations in datasets. Most research on robustness focuses on synthetic image perturbations (noise, simulated weather artifacts…

ClassificationDomain GeneralizationGeneral Classificationimage-classification+1