Papers Referring Audio-Visual Segmentation
“Referring Audio-Visual Segmentation” 태그가 달린 논문 2편 · 필터 해제
Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration
2025-05-26
· Hao Zhong, Muzhi Zhu, Zongze Du, Zheng Huang 외
Long-horizon video-audio reasoning and fine-grained pixel understanding impose conflicting requirements on omnimodal models: dense temporal coverage demands many low-resolution frames, whereas precise grounding calls for…
Domain GeneralizationHallucinationReasoning Video Object SegmentationReferring Audio-Visual Segmentation+4TSAM: Temporal SAM Augmented with Multimodal Prompts for Referring Audio-Visual Segmentation
2025-01-01 · CVPR 2025 1
· Abduljalil Radman, Jorma Laaksonen
Referring audio-visual segmentation (Ref-AVS) aims to segment objects within audio-visual scenes using multimodal cues embedded in text expressions. While the Segment Anything Model (SAM) has revolutionized visual se…
Referring Audio-Visual Segmentation
1–2 / 2