paper-with-me

visual instruction following

1개 벤치마크 · 논문 29편 · 이 태스크의 논문 보기 →

Benchmarks

LLaVA-Bench

결과 8개

Most implemented

Visual Instruction Tuning

2023-04-17 · 구현 13개

Papers

FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching

2026-04-08 · Junchao Yi, Rui Zhao, Jiahao Tang, Weixian Lei 외 arxiv

Multimodal generation has long been dominated by text-driven pipelines where language dictates vision but cannot reason or create within it. We challenge this paradigm by asking whether all modalities, including textual …

visual instruction followingText-to-Image GenerationTrajectory Predictionmultimodal generation

Data Organization Matters in Multimodal Instruction Tuning: A Controlled Study of Capability Trade-offs

2026-03-29 · Guowei Tang arxiv

Recent multimodal large language models (MLLMs) perform strongly on general visual understanding, diagram and chart reasoning, and document-centric perception. However, these abilities are learned from heterogeneous supe…

visual instruction followingQuestion Answering

FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants

2026-03-27 · Mahesh Bhosale, Abdul Wasi, Shantam Srivastava, Shifa Latif 외 arxiv

While powerful in image-conditioned generation, multimodal large language models (MLLMs) can display uneven performance across demographic groups, highlighting fairness risks. In safety-critical clinical settings, such d…

parameter-efficient fine-tuningvisual instruction followingVisual Question Answering

How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing

2026-02-02 · Huanyu Zhang, Xuehai Bai, Chengzu Li, Chen Liang 외 arxiv

Recent generative models have achieved remarkable progress in image editing. However, existing systems and benchmarks remain largely text-guided. In contrast, human communication is inherently multimodal, where visual in…

visual instruction followingImage Editing

M3PO: Multimodal-Model-Guided Preference Optimization for Visual Instruction Following

2025-08-17 · Ruirui Gao, Emily Johnson, Bowen Tan, Yanfei Qian arxiv

Large Vision-Language Models (LVLMs) hold immense potential for complex multimodal instruction following, yet their development is often hindered by the high cost and inconsistency of human annotation required for effect…

visual instruction following

Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models

2025-02-17 · Zikang Liu, Kun Zhou, Wayne Xin Zhao, Dawei Gao 외

Visual instruction tuning has become the predominant technology in eliciting the multimodal task-solving capabilities of large vision-language models (LVLMs). Despite the success, as visual instructions require images as…

Instruction Followingvisual instruction followingVisual Reasoning

전체 29편 보기 →