paper-with-me

Papers Referring Audio-Visual Segmentation

“Referring Audio-Visual Segmentation” 태그가 달린 논문 2편 · 필터 해제

Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration

2025-05-26 · Hao Zhong, Muzhi Zhu, Zongze Du, Zheng Huang 외

Long-horizon video-audio reasoning and fine-grained pixel understanding impose conflicting requirements on omnimodal models: dense temporal coverage demands many low-resolution frames, whereas precise grounding calls for…

Domain GeneralizationHallucinationReasoning Video Object SegmentationReferring Audio-Visual Segmentation+4

TSAM: Temporal SAM Augmented with Multimodal Prompts for Referring Audio-Visual Segmentation

2025-01-01 · CVPR 2025 1 · Abduljalil Radman, Jorma Laaksonen

Referring audio-visual segmentation (Ref-AVS) aims to segment objects within audio-visual scenes using multimodal cues embedded in text expressions. While the Segment Anything Model (SAM) has revolutionized visual se…

Referring Audio-Visual Segmentation
1–2 / 2