paper-with-me

Papers Question Generation

“Question Generation” 태그가 달린 논문 773편 · 필터 해제

DiagEvo: Diagnosis-Guided Self-Evolution via Hierarchical Error Memory

2026-09-01 · Xincheng Wei, Yifan Ding, Yoshua Li, Dongsheng Ma 외 hf

Self-play is an effective paradigm for language-model self-evolution, but without guidance, solver performance can plateau or decline across rounds. Unguided methods steer question generation with signals such as difficu…

Mathematical ReasoningQuestion Generation

SPARK: Skeleton-Guided Reasoning Synthesis from Large-Scale Scientific Literature

2026-08-31 · Yu Li, Wei Li, Xin Gao, Mengyuan Sun 외 arxiv

Scientific reasoning remains challenging for open-source models, largely due to the lack of high-quality scientific reasoning data. Existing datasets are often dominated by factual recall or formulaic problem solving, wi…

Question Generation

Behavioral Reprogramming of Open-Weights Models: Cognitive Plasticity and Alignment Bounds

2026-08-13 · Lucia Malíčková arxiv

Large language models (LLMs) are predominantly aligned to function as passive, sycophantic assistants. We challenge this default paradigm by empirically evaluating the cognitive plasticity of open-weight architectures wh…

parameter-efficient fine-tuningQuestion Generation

TeachMateGPT: A Multi-Agent Knowledge-Grounded Framework for Pedagogical Assessment Generation from Science Curriculum Materials

2026-08-13 · Fatema Tuj Johora Faria, Mukaffi Bin Moin, M. F. Mridha, Jubayer Al Mahmud arxiv

Automatically generating textbook-grounded assessment items can reduce science teachers' workload, but existing retrieval-augmented generation (RAG) systems rely on flat retrieval, support only single-question generation…

Question Generation

Exploiting Intrinsic Duality for Multi-Hop Question Generation

2026-08-01 · Maodong Li, Xinyue Kang, Yuanchen Shi, Fang Kong arxiv

Multi hop question generation (MQG) aims to generate questions from multiple given documents and target answers, whereas question answering (QA) focuses on deriving answers from documents given specific questions. Althou…

Contrastive LearningQuestion GenerationQuestion Answering

MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos

2026-07-30 · Jinpeng Hu, Erqiang Wang, Shan Wang, Zhuo Li 외 arxiv

Mental health understanding in long-form videos requires nuanced reasoning over observable behavior, interpersonal context, and latent psychological states. Existing benchmarks largely reduce this task to coarse-grained …

Question Generation

ChronoQG: Towards a Temporally Expressive and Hop-Bounded Benchmark for Temporal Knowledge Graph Question Generation

2026-07-16 · Xuemeng Liu, Zhengpin Li, Wanpeng Tang, Haotong Xie 외 arxiv

Knowledge graph question generation (KGQG) aims to generate natural-language questions from structured graph evidence. Existing KGQG benchmarks, however, are mostly built on static knowledge graphs and do not encode the …

Question GenerationKnowledge Graphs

Self-Study Reconsidered: The Hidden Fragility of Learning from Self-Generated QA

2026-06-30 · Ekaterina Alimaskina, Denis Shveykin, Gleb Molodtsov, Igor Shalygin 외 arxiv

Language models are increasingly taught from synthetic question--answer (QA) supervision: a model generates questions about a document, answers them from the same text, and the resulting pairs are used to fine-tune, dist…

Question Generation

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models

2026-06-25 · Henry Shaowu Yuchi, Michal Kucer, Benjamin H. Sims, Selma Peterson 외 arxiv

Large language models (LLMs) have demonstrated strong performance across a wide range of tasks, but ensuring their reliability in highly technical domains remains a significant challenge. In nuclear engineering, problem …

Question Generation

LLM-as-Judge in Education: A Curriculum-Grounded Marking Pipeline

2026-06-16 · Xiwei Xu, Chen Wang, Jacky Jiang, Phil Yang 외 arxiv

Generative AI and large language models (LLMs) are increasingly applied to question generation and automated assessment. However, deploying LLMs in preparation for high-stakes exams requires more than prompt engineering;…

Question GenerationPrompt Engineering

ERQA-Plus: A Diagnostic Benchmark for Reasoning in Embodied AI

2026-06-16 · Hong Yang, Basura Fernando arxiv

Generalist embodied agents require more than object recognition: they must reason about spatial relations, actions, procedures, human intentions, environmental constraints, and commonsense consequences from situated visu…

Question GenerationObject RecognitionQuestion AnsweringSpatial Reasoning

VeriGeo: Controllable Geometry Question Generation with Numerical and Analytical Verification

2026-06-12 · Xiaoxian Duan, Zequn Liu, Yingce Xia arxiv

Geometry problem generation is useful for AI-assisted education and multimodal mathematical reasoning, but reliable synthesis remains difficult because the problem statement, diagram, constraints, and solution should be …

Mathematical ReasoningQuestion Generation

Constructing Evaluation Datasets for Procedural Reasoning: Balancing Naturalness, Grounding, and Multi-Hop Coverage

2026-06-11 · Sarah Elshabrawy, Rahul K. Dass, Ashok K. Goel arxiv

Evaluating procedural reasoning in AI-supported learning systems requires question-answer datasets that are both learner-like and grounded in the instructional knowledge the system is expected to use. We study how TMK-ba…

Question Generation

How Fine-Grained Should a RAG Benchmark Be? A Hierarchical Framework for Synthetic Question Generation

2026-06-11 · Chase M. Fensore, Kaustubh Dhole, Jason Fan, Eugene Agichtein 외 arxiv

Evaluating retrieval-augmented generation (RAG) systems requires benchmarks that capture diverse question characteristics, yet practitioners lack empirical guidance on which dimensions to vary and at what granularity. We…

Question Generation

Self-Evolving Visual Questioner

2026-06-11 · Yijun Liang, Hengguang Zhou, Ming Li, Lichen Li 외 arxiv

Vision-language models (VLMs) are typically trained as passive answerers, while their ability to actively ask diverse, non-trivial, visual-centric and grounded questions remains underexplored. Existing visual questioners…

Question Generation

What Am I Missing? Question-Answering as Hidden State Probing

2026-05-29 · Chu Fei Luo, Samuel Dahan, Xiaodan Zhu arxiv

Test-time reasoning has become a significant field of study since the introduction of chain-of-thought reasoning in large language models (LLMs). However, the mechanisms of this reasoning process are still under-explored…

Question Generation

Slide Deck Q&A Quality Assurance App: A Multi-Stage Pipeline for Pedagogical Question Generation

2026-05-26 · Jim Salsman arxiv

Generating high-quality, pedagogically useful questions from lecture slide decks is difficult because important instructional content is distributed across both text and visual elements, and because useful questions must…

Question Generation

TS-Skill: A Benchmark for Evaluating Analytical Skills in Time-Series Question Answering

2026-05-23 · Liying Han, Kang Yang, Oliver Wang, Jason Wu 외 arxiv

Large language models (LLMs) and time-series language models (TSLMs) are increasingly applied to time-series question answering (TSQA). Unlike text-only QA, TSQA requires models to ground answers in temporal signals whos…

Question GenerationQuestion Answering

EvoVid: Temporal-Centric Self-Evolution for Video Large Language Models

2026-05-21 · Shiqi Huang, Ziyue Wang, Zhongrong Zuo, Han Qiu 외 arxiv

Recent Video Large Language Models (Video-LLMs) have demonstrated strong capabilities in video reasoning through reinforcement learning (RL). However, existing RL pipelines rely heavily on human-annotated tasks and solut…

Reinforcement LearningQuestion Generation

RISE: Reliable Improvement in Self-Evolving Vision-Language Models

2026-05-20 · Chaoran Xu, Yingmao Miao, Pengfei Zhang, Hao Dou 외 arxiv

Vision-language models (VLMs) have achieved strong multimodal reasoning capabilities, but further improving them still relies heavily on large-scale human-constructed supervision for post-training. Such supervision is co…

Multimodal ReasoningQuestion Generation
1–20 / 773 다음 →