paper-with-me

홈 › Papers

Improving Data and Reward Design for Scientific Reasoning in Large Language Models

2026-02-09 · Zijie Chen, Zhenghao Lin, Xiao Liu, Zhenzhong Lan, Yeyun Gong, Peng Cheng arxiv

Solving open-ended science questions remains challenging for large language models, particularly due to inherently unreliable supervision and evaluation. The bottleneck lies in the data construction and reward design for scientific post-training. We develop a large-scale, systematic data processing pipeline that transforms heterogeneous open-source science data into Dr. SCI dataset, which comprises of 1M questions across eight STEM subjects, with explicit verifiable/open-ended splits, scalable difficulty annotation, and fine-grained rubrics that operationalize evaluation for open-ended answers. Building on this dataset, we propose the Dr. SCI post-training pipeline, which redesigns the standard SFT -> RL workflow through three components: (i) Exploration-Expanding SFT, which broadens the model's reasoning pattern coverage prior to RL; (ii) Dynamic Difficulty Curriculum, which adapts training data to the model's evolving scientific capability; and (iii) SciRubric-Guided RL, which enables stable reinforcement learning on open-ended scientific questions via rubric-based evaluation with explicit answer correctness. Qwen3-4B-Base trained using Dr. SCI pipeline achieves 63.2 on GPQA-diamond and 32.4 on GPQA-general, consistently improves over strong post-trained baselines such as o1-mini and GPT-4o, demonstrating substantial gains in scientific reasoning, especially in open-ended settings.

📄 PDF Abstract BibTeX arXiv:2602.08321

Code (0)

등록된 구현이 없습니다.

Tasks

Reinforcement Learning

Similar Papers 제목 키워드 기반

SCI-PRM: A Tool Aware Process Reward Model for Scientific Reasoning Verification

2026-06-03 · Xiangyu Zhao, Henry Hengyuan Zhao, Yiheng Wang, Wanghan Xu 외 arxiv

While Process Reward Models (PRMs) have achieved remarkable success in mathematical reasoning, their application in complex scientific domains-such as biology, chemistry, and physics remains largely unexplored. Scientifi…

Reinforcement LearningMathematical Reasoning

RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning

2025-10-02 · Sicheng Feng, Kaiwen Tuo, Song Wang, Lingdong Kong 외 arxiv

Fine-grained visual reasoning remains a core challenge for multimodal large language models (MLLMs). The recently introduced ReasonMap highlights this gap by showing that even advanced MLLMs struggle with spatial reasoni…

Visual Question AnsweringReinforcement LearningSpatial ReasoningVisual Reasoning

MeasHalu: Mitigation of Scientific Measurement Hallucinations for Large Language Models with Enhanced Reasoning

2026-04-18 · Ruijun Huang, Zhiqiao Kang, Yuxuan Zhu, Junxiong Li 외 arxiv

The accurate extraction of scientific measurements from literature is a critical yet challenging task in AI4Science, enabling large-scale analysis and integration of quantitative research findings. However, Large Languag…

Reward Modeling for Scientific Writing Evaluation

2026-01-16 · Furkan Şahinuç, Subhabrata Dutta, Iryna Gurevych arxiv

Scientific writing is an expert-domain task that demands deep domain knowledge, task-specific requirements and reasoning capabilities that leverage the domain knowledge to satisfy the task specifications. While scientifi…

Text Generation

ReCrit: Transition-Aware Reinforcement Learning for Scientific Critic Reasoning

2026-05-11 · Wanghan Xu, Yuhao Zhou, Hengyuan Zhao, Shuo Li 외 arxiv

Large language models can fail in critic interaction not only by answering incorrectly, but also by abandoning an initially correct scientific solution after user criticism. This is especially risky in scientific reasoni…

Reinforcement Learning