paper-with-me

Papers

WritingBench: A Comprehensive Benchmark for Generative Writing

2025-03-07 · Yuning Wu, Jiahao Mei, Ming Yan, Chenliang Li, Shaopeng Lai, Yuran Ren, Zijia Wang, Ji Zhang, Mengyue Wu, Qin Jin, Fei Huang

Recent advancements in large language models (LLMs) have significantly enhanced text generation capabilities, yet evaluating their performance in generative writing remains a challenge. Existing benchmarks primarily focus on generic text generation or limited in writing tasks, failing to capture the diverse requirements of high-quality written contents across various domains. To bridge this gap, we present WritingBench, a comprehensive benchmark designed to evaluate LLMs across 6 core writing domains and 100 subdomains, encompassing creative, persuasive, informative, and technical writing. We further propose a query-dependent evaluation framework that empowers LLMs to dynamically generate instance-specific assessment criteria. This framework is complemented by a fine-tuned critic model for criteria-aware scoring, enabling evaluations in style, format and length. The framework's validity is further demonstrated by its data curation capability, which enables 7B-parameter models to approach state-of-the-art (SOTA) performance. We open-source the benchmark, along with evaluation tools and modular framework components, to advance the development of LLMs in writing.

📄 PDF Abstract BibTeX arXiv:2503.05244

Code (1)

X-PLUG/WritingBench 공식 구현

Tasks

Text Generation

Methods 이 논문이 사용한 방법론

Focus 설명 없음

Similar Papers 제목 키워드 기반

PaperOrchestra: A Multi-Agent Framework for Automated AI Research Paper Writing

2026-04-06 · Yiwen Song, Yale Song, Tomas Pfister, Jinsung Yoon arxiv

Synthesizing unstructured research materials into manuscripts is an essential yet under-explored challenge in AI-driven scientific discovery. Existing autonomous writers are rigidly coupled to specific experimental pipel…

IntelliAsk: Learning to Ask High-Quality Research Questions via RLVR

2026-01-23 · Karun Sharma, Vidushee Vats, Shengzhi Li, Yuxiang Wang 외 arxiv

Peer review relies on substantive, evidence-based questions, yet current LLMs generate surface-level queries that perform worse than human reviewer questions in expert evaluation. To address this gap, we curate a high-qu…

LongWriter-Zero: Mastering Ultra-Long Text Generation via Reinforcement Learning

2025-06-23 · Yuhao Wu, Yushi Bai, Zhiqiang Hu, Roy Ka-Wei Lee 외

Ultra-long generation by large language models (LLMs) is a widely demanded scenario, yet it remains a significant challenge due to their maximum generation length limit and overall quality degradation as sequence length …

Reinforcement Learning (RL)Text Generation

MUSE: A Theory-Harnessed Story Engine for Vibe Narrativizing

2026-09-14 · Jianxiang Ma, Xiaocui Yang, Daling Wang, Yuesong Hou 외 arxiv

LLMs can generate fluent prose. Turning this capability into high-quality stories requires coordinating decisions about plot, character, and language across planning, drafting, and revision. Guiding these decisions prese…

ACE-RL: Adaptive Constraint-Enhanced Reward for Long-form Generation Reinforcement Learning

2025-09-05 · Jianghao Chen, Wei Sun, Qixiang Yin, Zhixing Tan 외 arxiv

Long-form generation has become a critical and challenging application for Large Language Models (LLMs). Existing studies are limited by their reliance on scarce, high-quality long-form response data and their focus on c…

Reinforcement Learning