paper-with-me

홈 › Papers

FITRep: Attention-Guided Item Representation via MLLMs

2025-11-26 · Guoxiao Zhang, Ao Li, Tan Qu, Qianlong Xie, Xingxing Wang arxiv

Online platforms usually suffer from user experience degradation due to near-duplicate items with similar visuals and text. While Multimodal Large Language Models (MLLMs) enable multimodal embedding, existing methods treat representations as black boxes, ignoring structural relationships (e.g., primary vs. auxiliary elements), leading to local structural collapse problem. To address this, inspired by Feature Integration Theory (FIT), we propose FITRep, the first attention-guided, white-box item representation framework for fine-grained item deduplication. FITRep consists of: (1) Concept Hierarchical Information Extraction (CHIE), using MLLMs to extract hierarchical semantic concepts; (2) Structure-Preserving Dimensionality Reduction (SPDR), an adaptive UMAP-based method for efficient information compression; and (3) FAISS-Based Clustering (FBC), a FAISS-based clustering that assigns each item a unique cluster id using FAISS. Deployed on Meituan's advertising system, FITRep achieves +3.60% CTR and +4.25% CPM gains in online A/B tests, demonstrating both effectiveness and real-world impact.

📄 PDF Abstract BibTeX arXiv:2511.21389

Code (0)

등록된 구현이 없습니다.

Tasks

Dimensionality ReductionInformation Extraction

Similar Papers 제목 키워드 기반

Attention-guided Multi-step Fusion: A Hierarchical Fusion Network for Multimodal Recommendation

2023-04-24 · Yan Zhou, Jie Guo, Hao Sun, Bin Song 외

The main idea of multimodal recommendation is the rational utilization of the item's multimodal information to improve the recommendation performance. Previous works directly integrate item multimodal features with item …

Contrastive LearningMultimodal Recommendation

Unveiling the Cognitive Compass: Theory-of-Mind-Guided Multimodal Emotion Reasoning

2026-02-01 · Meng Luo, Bobo Li, Shanqing Xu, Shize Zhang 외 arxiv

Despite rapid progress in multimodal large language models (MLLMs), their capability for deep emotional understanding remains limited. We argue that genuine affective intelligence requires explicit modeling of Theory of …

Reinforcement Learning

Tell Model Where to Look: Mitigating Hallucinations in MLLMs by Vision-Guided Attention

2025-11-25 · Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng 외 arxiv

Visual attention serves as the primary mechanism through which MLLMs interpret visual information; however, its limited localization capability often leads to hallucinations. We observe that although MLLMs can accurately…

Image CaptioningVisual Grounding

Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping

2025-10-10 · Dwip Dalal, Gautam Vashishtha, Utkarsh Mishra, Jeonghwan Kim 외 arxiv

Multimodal large language models (MLLMs) often miss small details and spatial relations in cluttered scenes, leading to errors in fine-grained perceptual grounding. We introduce AttWarp, a lightweight method that allocat…

ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs

2026-06-30 · Yuhao Wang, Mu Qiao, Haiwen Diao, Yunzhi Zhuge 외 arxiv

Multimodal Large Language Models (MLLMs) incur prohibitive inference costs due to long visual token sequences. Training-free visual token reduction provides an efficient solution. However, existing methods distort attent…