paper-with-me

홈 › Papers

Visual Document Understanding and Reasoning: A Multi-Agent Collaboration Framework with Agent-Wise Adaptive Test-Time Scaling

2025-08-05 · Xinlei Yu, Chengming Xu, Zhangquan Chen, Yudong Zhang, Shilin Lu, Cheng Yang, Jiangning Zhang, Shuicheng Yan, Xiaobin Hu arxiv

The dominant paradigm of monolithic scaling in Vision-Language Models (VLMs) is failing for understanding and reasoning in documents, yielding diminishing returns as it struggles with the inherent need of this domain for document-based procedural reasoning, cognitive complexity, and factual accuracy. To this end, we introduce MACT, a Multi-Agent Collaboration framework with agent-wise adaptive Test-time scaling that pioneers a paradigm shift to procedural scaling, adapting dynamically to the functional entities of visual documents understanding and reasoning. MACT decomposes the visual document processing flow into four specialized agents, i.e., planning, execution, judgment, and answer, to resolve cognitive overload and introduce a critical self-correction loop for factual grounding. This collaborative architecture is amplified by an agent-wise adaptive test-time scaling strategy that intelligently allocates computational resources based on the complexity and redundancy of each functionality. Evaluated on multiple visual document understanding benchmarks, MACT achieves superior performance with a smaller parameter scale, adapting effectively to various document scenarios without compromising its general or mathematical reasoning capabilities. The three variants of MACT consistently attain top-three average performance rankings, with average performance enhancements of 9.9-11.5% over the base models. The source code will be released publicly.

📄 PDF Abstract BibTeX arXiv:2508.03404

Code (0)

등록된 구현이 없습니다.

Tasks

Mathematical Reasoning

Similar Papers 제목 키워드 기반

SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding

2025-10-30 · Yiqiao Jin, Rachneet Kaur, Zhen Zeng, Sumitra Ganesh 외 arxiv

Multi-page visual documents such as manuals, brochures, presentations, and posters convey key information through layout, colors, icons, and cross-slide references. While multimodal large language models (MLLMs) offer op…

ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering

2026-03-02 · Aymen Lassoued, Mohamed Ali Souibgui, Yousri Kessentini arxiv

Document Visual Question Answering (DocVQA) remains challenging for existing Vision-Language Models (VLMs), especially under complex reasoning and multi-step workflows. Current approaches struggle to decompose intricate …

Visual Question Answering

MDocAgent: A Multi-Modal Multi-Agent Framework for Document Understanding

2025-03-18 · Siwei Han, Peng Xia, Ruiyi Zhang, Tong Sun 외

Document Question Answering (DocQA) is a very common task. Existing methods using Large Language Models (LLMs) or Large Vision Language Models (LVLMs) and Retrieval Augmented Generation (RAG) often prioritize information…

document understandingQuestion AnsweringRAGRetrieval+1

ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents

2025-02-25 · Qiuchen Wang, Ruixue Ding, Zehui Chen, Weiqi Wu 외

Understanding information from visually rich documents remains a significant challenge for traditional Retrieval-Augmented Generation (RAG) methods. Existing benchmarks predominantly focus on image-based question answeri…

Question AnsweringRAGRetrievalRetrieval-augmented Generation

InSight-doc: Agentic Visual Perception for Long-Document Understanding

2026-08-11 · Kaican Li, Weiyan Xie, Lewei Yao, Jiannan Wu 외 hf

Long-document understanding often requires reasoning over many visually rich pages, making inference costly and prone to context rot. In this work, we propose InSight-doc, an agentic visual perception framework that trea…