[논문 리뷰] Leveraging Foundation models for Unsupervised Audio-Visual Segmentation
이 논문은 비용이 많이 드는 픽셀 수준의 음성 마스크 주석이 필요 없도록 사전 훈련된 기초 모델을 활용하여 훈련 없이도 비지도 학습 방식의 음성-시각 분할을 제안한다. 음성 태깅과 오픈 월드 검출을 활용한 교차 모odal 의미 필터링(CMSF)을 통해, 특히 겹치는 객체에서 강력한 성능을 달성하며, 특별한 미세조정이나 명시적 음성-시각 융합 없이도 복잡한 시나리오에서 지도 학습 기반 모델을 능가한다.
Audio-Visual Segmentation (AVS) aims to precisely outline audible objects in a visual scene at the pixel level. Existing AVS methods require fine-grained annotations of audio-mask pairs in supervised learning fashion. This limits their scalability since it is time consuming and tedious to acquire such cross-modality pixel level labels. To overcome this obstacle, in this work we introduce unsupervised audio-visual segmentation with no need for task-specific data annotations and model training. For tackling this newly proposed problem, we formulate a novel Cross-Modality Semantic Filtering (CMSF) approach to accurately associate the underlying audio-mask pairs by leveraging the off-the-shelf multi-modal foundation models (e.g., detection [1], open-world segmentation [2] and multi-modal alignment [3]). Guiding the proposal generation by either audio or visual cues, we design two training-free variants: AT-GDINO-SAM and OWOD-BIND. Extensive experiments on the AVS-Bench dataset show that our unsupervised approach can perform well in comparison to prior art supervised counterparts across complex scenarios with multiple auditory objects. Particularly, in situations where existing supervised AVS methods struggle with overlapping foreground objects, our models still excel in accurately segmenting overlapped auditory objects. Our code will be publicly released.
연구 동기 및 목표
- 비용이 많이 드는 세밀한 픽셀 수준의 음성 마스크 주석이 필요한 지도 학습 기반 음성-시각 분할의 확장성 한계를 해결하기 위해.
- 특수 작업용 미세조정이나 주석 데이터 없이도 비지도 학습 기반 음성-시각 분할을 가능하게 하기 위해.
- 사전 훈련된 기초 모델(예: 음성 태깅, 객체 검출, 다중 모달 정렬용)을 활용하여, 훈련 없이도 제로샷 방식으로 정확한 분할 마스크를 생성하기 위해.
- 겹치는 听각 객체가 존재하는 복잡한 시나리오에서 지도 학습 기반 방법이 종종 실패하는 상황에서의 성능 향상.
- 오픈 월드 및 다중 모달 기초 모델을 효과적으로 융합하여 명시적 음성-시각 융합 없이도 강건하고 일반화 가능한 AVS를 달성할 수 있음을 보여주기 위해.
제안 방법
- 교차 모달 의미 필터링(CMSF)을 제안하며, 이는 음성과 시각 모달을 번갈아가며 분할 제안을 생성하고 필터링하는 기초 모델의 계열이다.
- AT-GDINO-SAM을 구현: 음성 태깅(ASP) 모델을 사용해 음성 태그를 생성한 후, DINO와 SAM을 통해 이를 기반으로 객체 검출 및 분할을 유도한다.
- OWOD-BIND을 구현: 오픈 월드 객체 검출기(OWOD)를 사용해 바운딩 박스 제안을 생성한 후, ImageBIND에서 추출한 음성 임베딩과 코사인 유사도를 활용해 필터링한다.
- DINO(객체 검출용), ImageBIND(교차 모달 정렬용) 등 사전 훈련된 모델을 사용하며, 어떠한 미세조정도 수행하지 않는다.
- SAM의 이미지 인코더와 프롬프트 인코더를 활용해 음성 또는 시각적 신호를 기반으로 제로샷 분할을 수행한다.
- 시각적 제안과 음성 임베딩을 공통 잠재 공간에 투영함으로써 의미 일관성을 확보하는 필터링 메커니즘을 적용한다.
실험 결과
연구 질문
- RQ1사전 훈련된 기초 모델을 활용하여, 어떤 미세조정이나 주석 데이터 없이도 비지도 학습 기반 음성-시각 분할을 수행할 수 있는가?
- RQ2사전 구매 모델 기반의 훈련 없이도 지도 학습 기반 AVS 방법과 비교해 복잡한 시나리오, 특히 겹치는 객체가 존재하는 경우에서의 성능은 어떠한가?
- RQ3오픈 월드 검출 및 다중 모달 정렬 모델이 제로샷, 오픈 세트 설정에서 분할 정확도를 향상시킬 수 있는가?
- RQ4SAM과 ImageBIND 같은 기초 모델에 의존할 때 비지도 AVS의 주요 실패 유형은 무엇인가?
- RQ5음성 유도 또는 시각 유도 제안 생성 방식이 정렬 및 겹침 처리 측면에서 종단 간 지도 학습 기반 방법을 얼마나 뛰어넘을 수 있는가?
주요 결과
- OWOD-BIND는 AVSBench의 MS3 설정에서 M_IOU 0.58, F_score 0.67를 기록하며, 미세조정 없이도 AV-SAM(M_IOU: 0.40, F_score: 0.56)과 같은 지도 학습 기반 방법을 능가한다.
- S4 설정에서 SAM-BIND 대비 M_IOU와 F_score 모두 0.16 향상되어, 오픈 월드 검출과 음성-시각 필터링의 유용성을 입증한다.
- 명시적 음성-시각 융합 없이도 겹치는 听각 객체(예: 피아노와 사람)를 성공적으로 분할하며, 연속적이고 정밀한 마스크를 생성한다.
- AVSBench 평균 성능(0.78)보다는 낮지만, OWOD-BIND는 더 세밀한 세부 사항을 생성하고, 사람과 같은 비입체형 객체를 더 잘 처리한다.
- 실패 케이스로는 SAM의 과다 분할(예: 피아노 키를 분리), 정확한 국소화 실패(예: 피아노 키만 분리하지 못함), 시간적 모델링 부족으로 말하는 사람과 말하지 않는 사람을 구분하지 못함이 있다.
- 기초 모델을 계열적으로 조합함으로써 강력한 제로샷 AVS 성능을 달성할 수 있음을 보여주며, 특히 오픈 세트 및 복잡한 시나리오에서 뛰어난 성능을 발휘한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.