paper-with-me

Papers

Structured Preference Optimization for Vision-Language Long-Horizon Task Planning

2025-02-28 · Xiwen Liang, Min Lin, Weiqi Ruan, Rongtao Xu, Yuecheng Liu, Jiaqi Chen, Bingqian Lin, Yuzheng Zhuang, Xiaodan Liang

Existing methods for vision-language task planning excel in short-horizon tasks but often fall short in complex, long-horizon planning within dynamic environments. These challenges primarily arise from the difficulty of effectively training models to produce high-quality reasoning processes for long-horizon tasks. To address this, we propose Structured Preference Optimization (SPO), which aims to enhance reasoning and action selection in long-horizon task planning through structured preference evaluation and optimized training strategies. Specifically, SPO introduces: 1) Preference-Based Scoring and Optimization, which systematically evaluates reasoning chains based on task relevance, visual grounding, and historical consistency; and 2) Curriculum-Guided Training, where the model progressively adapts from simple to complex tasks, improving its generalization ability in long-horizon scenarios and enhancing reasoning robustness. To advance research in vision-language long-horizon task planning, we introduce ExtendaBench, a comprehensive benchmark covering 1,509 tasks across VirtualHome and Habitat 2.0, categorized into ultra-short, short, medium, and long tasks. Experimental results demonstrate that SPO significantly improves reasoning quality and final decision accuracy, outperforming prior methods on long-horizon tasks and underscoring the effectiveness of preference-driven optimization in vision-language task planning. Specifically, SPO achieves a +5.98% GCR and +4.68% SR improvement in VirtualHome and a +3.30% GCR and +2.11% SR improvement in Habitat over the best-performing baselines.

📄 PDF Abstract BibTeX arXiv:2502.20742

Code (0)

등록된 구현이 없습니다.

Tasks

Task PlanningVisual Grounding

Similar Papers 제목 키워드 기반

Learning How and What to Memorize: Cognition-Inspired Two-Stage Optimization for Evolving Memory

2026-05-01 · Derong Xu, Shuochen Liu, Pengfei Luo, Pengyue Jia 외 arxiv

Large language model (LLM) agents require long-term user memory for consistent personalization, but limited context windows hinder tracking evolving preferences over long interactions. Existing memory systems mainly rely…

Reinforcement Learning

Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph

2026-05-08 · Ning Liu, Chuanneng Sun, Kristina Klinkner, Shervin Malmasi arxiv

Direct Preference Optimization (DPO) aligns language models using pairwise preference comparisons, offering a simple and effective alternative to Reinforcement Learning (RL) from human feedback. However, in many practica…

Reinforcement LearningProgram Synthesis

Rethinking Sales Lead Scoring with LLM-based Hierarchical Preference Ranking

2026-06-03 · Chenyu Zhang, Yiwen Liu, Yin Sun, Xinyuan Zhang 외 arxiv

Sales lead conversion in high-stakes domains (e.g., automotive, real estate) differs fundamentally from e-commerce recommendation due to prolonged decision cycles and multi-stage funnels. Traditional lead scoring methods…

LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization

2026-02-02 · Zhenpeng Huang, Jiaqi Li, Zihan Jia, Xinhao Li 외 arxiv

We present LongVPO, a novel two-stage Direct Preference Optimization framework that enables short-context vision-language models to robustly understand ultra-long videos without any long-video annotations. In Stage 1, we…

POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency

2025-10-01 · Ashim Dahal, Ankit Ghimire, Saydul Akbar Murad, Nick Rahimi arxiv

Long-video multimodal question answering requires structured reasoning over visual evidence and dialogue, but Large Vision-Language Models (LVLMs) are constrained by context-window and compute limits. We propose POVQA, w…

Video Question AnsweringMultimodal Reasoning