paper-with-me

홈 › Papers

Tokenization vs. Augmentation: A Systematic Study of Writer Variance in IMU-Based Online Handwriting Recognition

2026-02-25 · Jindong Li, Dario Zanca, Vincent Christlein, Tim Hamann, Jens Barth, Peter Kämpf, Björn Eskofier arxiv

Inertial measurement unit-based online handwriting recognition enables the recognition of input signals collected across different writing surfaces but remains challenged by uneven character distributions and inter-writer variability. In this work, we systematically investigate two strategies to address these issues: subword tokenization and concatenation-based data augmentation. Our experiments on the OnHW-Words500 dataset reveal a clear dichotomy between handling inter-writer and intra-writer variance. On the writer-independent split, structural abstraction via Bigram tokenization significantly improves generalization to unseen writing styles, reducing the word error rate (WER) from 15.40% to 12.99%. In contrast, on the writer-dependent split, tokenization degrades performance due to vocabulary distribution shifts between the training and validation sets. Instead, our proposed concatenation-based data augmentation acts as a powerful regularizer, reducing the character error rate by 34.5% and the WER by 25.4%. Further analysis shows that short, low-level tokens benefit model performance and that the performance gains from concatenation-based data augmentation surpass those achieved by proportionally extended training. These findings reveal a clear variance-dependent effect: subword tokenization primarily mitigates inter-writer stylistic variability, whereas concatenation-based data augmentation effectively compensates for intra-writer distributional sparsity.

📄 PDF Abstract BibTeX arXiv:2603.16883

Code (0)

등록된 구현이 없습니다.

Tasks

Handwriting RecognitionData Augmentation

Similar Papers 제목 키워드 기반

Language Models are not Equally Robust to Non-Canonical Tokenization across Languages

2026-07-29 · Poulami Ghosh, Preethi Jyothi arxiv

Despite the existence of exponentially many valid tokenizations for a given string, language models operate on a single canonical sequence deterministically produced by the tokenizer, leaving the broader tokenization spa…

Semi-supervised Feature Learning For Improving Writer Identification

2018-07-15 · Shiming Chen, Yisong Wang, Chin-Teng Lin, Weiping Ding 외

Data augmentation is usually used by supervised learning approaches for offline writer identification, but such approaches require extra training data and potentially lead to overfitting errors. In this study, a semi-sup…

Data Augmentation

Intrapersonal Parameter Optimization for Offline Handwritten Signature Augmentation

2020-10-13 · Teruo M. Maruyama, Luiz S. Oliveira, Alceu S. Britto Jr, Robert Sabourin

Usually, in a real-world scenario, few signature samples are available to train an automatic signature verification system (ASVS). However, such systems do indeed need a lot of signatures to achieve an acceptable perform…

ZAEBUC: An Annotated Arabic-English Bilingual Writer Corpus

2022-06-01 · LREC 2022 6 · Nizar Habash, David Palfreyman

We present ZAEBUC, an annotated Arabic-English bilingual writer corpus comprising short essays by first-year university students at Zayed University in the United Arab Emirates. We describe and discuss the various guidel…

LemmatizationPart-Of-Speech TaggingPOSPOS Tagging

Training Language Models with homotokens Leads to Delayed Overfitting

2026-01-06 · Adrian Cosma, Stefan Ruseti, Emilian Radoi, Mihai Dascalu arxiv

Subword tokenization introduces a computational layer in language models where many distinct token sequences decode to the same surface form and preserve meaning, yet induce different internal computations. Despite this …

Data Augmentation