paper-with-me

홈 › Papers

Token-based Decision Criteria Are Suboptimal in In-context Learning

2024-06-24 · Hakaze Cho, Yoshihiro Sakai, Mariko Kato, Kenshiro Tanaka, Akira Ishii, Naoya Inoue

In-Context Learning (ICL) typically utilizes classification criteria from output probabilities of manually selected label tokens. However, we argue that such token-based classification criteria lead to suboptimal decision boundaries, despite delicate calibrations through translation and constrained rotation applied. To address this problem, we propose Hidden Calibration, which renounces token probabilities and uses the nearest centroid classifier on the LM's last hidden states. In detail, we assign the label of the nearest centroid previously estimated from a calibration set to the test sample as the predicted label. Our experiments on 6 models and 10 classification datasets indicate that Hidden Calibration consistently outperforms current token-based baselines by about 20%~50%, achieving a strong state-of-the-art in ICL. Our further analysis demonstrates that Hidden Calibration finds better classification criteria with less inter-class overlap, and LMs provide linearly separable intra-class clusters with the help of demonstrations, which supports Hidden Calibration and gives new insights into the principle of ICL.

📄 PDF Abstract BibTeX arXiv:2406.16535

Code (1)

hc495/Hidden_Calibration 공식 구현 pytorch

Tasks

ClassificationIn-Context Learning

Methods 이 논문이 사용한 방법론

SET Dynamic Sparse Training method where weight mask is updated randomly periodically

Similar Papers 제목 키워드 기반

Probe and Skip: Self-Predictive Token Skipping for Efficient Long-Context LLM Inference

2026-01-19 · Zimeng Wu, Donghao Wang, Chaozhe Jin, Jiaxin Chen 외 arxiv

Long-context inference enhances the reasoning capability of Large Language Models (LLMs), but incurs significant computational overhead. Token-oriented methods, such as pruning and skipping, have shown great promise in r…

Pessimistic Risk-Aware Policy Learning in Contextual Bandits

2026-05-15 · Yilong Wan, Yuqiang Li, Xianyi Wu arxiv

We study risk-aware offline policy learning, aiming to learn a decision rule from logged data that is optimal under general risk criteria. This problem is crucial in high-stakes domains where online interaction is infeas…

CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

2026-07-28 · Bo-Wen Zhang, Junwei He, Wen Wang, Song-Lin Lv 외 arxiv

Rubric-based reinforcement learning enriches language model training by evaluating model outputs against explicit criteria. Yet in GRPO-style pipelines, these structured judgments are reduced to a scalar response-level r…

Reinforcement Learning

Enhancing Pre-Trained Decision Transformers with Prompt-Tuning Bandits

2025-02-07 · Finn Rietz, Oleg Smirnov, Sara Karimi, Lele Cao

Harnessing large offline datasets is vital for training foundation models that can generalize across diverse tasks. Offline Reinforcement Learning (RL) offers a powerful framework for these scenarios, enabling the deriva…

InformativenessOffline RLReinforcement Learning (RL)

Splitting criteria for ordinal decision trees: an experimental study

2024-12-18 · Rafael Ayllón-Gavilán, Francisco José Martínez-Estudillo, David Guijo-Rubio, César Hervás-Martínez 외

Ordinal Classification (OC) is a machine learning field that addresses classification tasks where the labels exhibit a natural order. Unlike nominal classification, which treats all classes as equally distinct, OC takes …

ClassificationOrdinal Classification