paper-with-me

Papers

mSFT: Addressing Dataset Mixtures Overfitting Heterogeneously in Multi-task SFT

2026-03-23 · Woosung Koh, Jeyoung Jeon, Youngjin Song, Yujin Cheon, Soowon Oh, Jaehyeong Choi, Se-Young Yun arxiv

Current language model training commonly applies multi-task Supervised Fine-Tuning (SFT) using a homogeneous compute budget across all sub-datasets. This approach is fundamentally sub-optimal: heterogeneous learning dynamics cause faster-learning tasks to overfit early while slower ones remain under-fitted. To address this, we introduce mSFT, an iterative, overfitting-aware search algorithm for multi-task data mixtures. mSFT trains the model on an active mixture, identifies and excludes the earliest overfitting sub-dataset, and reverts to that specific optimal checkpoint before continuing. Extensive evaluations demonstrate that mSFT consistently outperforms 4 baselines across 10 benchmarks and 6 base models. Further analysis confirms mSFT maintains robust gains across diverse dataset sizes, task granularities, and is insensitive to its single new hyperparameter (compute budget). Notably, at low compute budget, mSFT can improve performance while lowering training FLOPs. Ultimately, mSFT establishes a practical overfitting-aware algorithm for multi-task SFT that maximizes the potential of models across diverse data mixtures.

📄 PDF Abstract BibTeX arXiv:2603.21606

Code (0)

등록된 구현이 없습니다.

Similar Papers 제목 키워드 기반

Multi-Scale Finetuning for Encoder-based Time Series Foundation Models

2025-06-17 · Zhongzheng Qiao, Chenghao Liu, Yiming Zhang, Ming Jin 외

Time series foundation models (TSFMs) demonstrate impressive zero-shot performance for time series forecasting. However, an important yet underexplored challenge is how to effectively finetune TSFMs on specific downstrea…

Time SeriesTime Series Forecasting

Which Tokens Should SFT Actually Learn? A Token-Trimming Perspective on Mathematical Reasoning

2026-09-09 · Yaning Jia, Chunhui Zhang, Wenxuan Xu, Xingjian Diao 외 arxiv

Supervised fine-tuning (SFT) applies a uniform cross-entropy loss to all target tokens, even though different tokens provide unequal learning signals for mathematical reasoning. This uniform treatment can over-sharpen al…

Mathematical Reasoning

Learning transformer-based heterogeneously salient graph representation for multimodal remote sensing image classification

2023-11-17 · Jiaqi Yang, Bo Du, Liangpei Zhang

Data collected by different modalities can provide a wealth of complementary information, such as hyperspectral image (HSI) to offer rich spectral-spatial properties, synthetic aperture radar (SAR) to provide structural …

image-classificationImage ClassificationRemote Sensing Image Classification

MemSFT: Mitigating Alignment Tax with an External Parametric Memory

2026-07-28 · Jiarui Wang, Xiang Shi, Jiaqi Cao, Rubin Wei 외 arxiv

Adapting Large Language Models (LLMs) to specialized domains often incurs an alignment tax, as fine-tuning on domain-specific tasks can cause catastrophic forgetting and substantially degrade performance on general tasks…

Risk Bounds for Over-parameterized Maximum Margin Classification on Sub-Gaussian Mixtures

2021-04-28 · NeurIPS 2021 12 · Yuan Cao, Quanquan Gu, Mikhail Belkin

Modern machine learning systems such as deep neural networks are often highly over-parameterized so that they can fit the noisy training data exactly, yet they can still achieve small test errors in practice. In this pap…

ClassificationGeneral Classificationregression