[논문 리뷰] UVOSAM: A Mask-free Paradigm for Unsupervised Video Object Segmentation via Segment Anything Model
UVOSAM는 비디오 명확도 객체 추적(VSOT) 네트워크에서 유도하는 궤적을 프롬프트로 사용하여 Segment Anything Model(SAM)을 활용하는 마스크 없음 비지도 비디오 객체 분할 프레임워크를 제안한다. DAVIS2017에서 최신 기술 수준을 달성하며, 수동 마스크 애너테이션 없이도 마스크 지도 학습 방법보다 크게 뛰어난 성능을 보인다.
The current state-of-the-art methods for unsupervised video object segmentation (UVOS) require extensive training on video datasets with mask annotations, limiting their effectiveness in handling challenging scenarios. However, the Segment Anything Model (SAM) introduces a new prompt-driven paradigm for image segmentation, offering new possibilities. In this study, we investigate SAM's potential for UVOS through different prompt strategies. We then propose UVOSAM, a mask-free paradigm for UVOS that utilizes the STD-Net tracker. STD-Net incorporates a spatial-temporal decoupled deformable attention mechanism to establish an effective correlation between intra- and inter-frame features, remarkably enhancing the quality of box prompts in complex video scenes. Extensive experiments on the DAVIS2017-unsupervised and YoutubeVIS19\&21 datasets demonstrate the superior performance of UVOSAM without mask supervision compared to existing mask-supervised methods, as well as its ability to generalize to weakly-annotated video datasets. Code can be found at https://github.com/alibaba/UVOSAM.
연구 동기 및 목표
- 비지도 비디오 객체 분할(VOS)을 위한 수동 마스크 애너테이션 데이터셋의 높은 비용과 확장성 한계를 해결한다.
- SAM의 인스턴스 발견 및 아이덴티티 연동 능력 부족 문제를 극복하여 SAM을 비지도 VOS에 적용할 수 있도록 한다.
- 수동 마스크 애너테이션 없이도 안정적인 객체 궤적을 생성하는 완전 자동화된 파이프라인을 개발한다.
- 전용 비디오 명확도 객체 추적 네트워크를 통해 공간-시간 상관관계를 활용하여 복잡한 시나리오에서의 분할 정확도를 향상시킨다.
제안 방법
- 두 단계 프레임워크를 도입한다: 첫 번째 단계에서 비디오 명확도 객체 추적(VSOT) 모델이 명확도 객체를 탐지하고 프레임 간 완전한 객체 궤적을 생성한다.
- 예측된 궤적(박스 형태)을 프롬프트로 사용하여 SAM을 통해 프레임 단위 마스크 생성을 수행하며, 수동 마스크 애너테이션을 대체한다.
- IDOL 아키텍처를 기반으로 한 VSOT 네트워크를 설계하지만, 마스크 예측 브랜치를 제거하여 분류 가능한 특징 학습과 시간적 일관성에 집중한다.
- 박스 및 점 프롬프트를 사용하며, 아블레이션 연구 결과 복수의 점(예: 3–5개)과 박스를 조합할 경우 최적의 성능을 얻는다.
- VSOT의 공간적 및 시간적 대응 관계를 활용하여 비디오 시퀀스 전반에 걸쳐 안정적이고 정확한 객체 연동을 보장한다.
- 프롬프트 조합 전략(예: 박스 + 3–5개 점)을 적용하여 복잡한 시나리오에서 모호성을 줄이고 마스크 정밀도를 향상시킨다.

실험 결과
연구 질문
- RQ1수동 마스크 애너테이션 없이 Segment Anything Model(SAM)을 비지도 비디오 객체 분할에 효과적으로 적용할 수 있는가?
- RQ2비디오 환경에서 SAM의 인스턴스 발견 및 아이덴티티 연동 능력 부족 문제는 어떻게 극복할 수 있는가?
- RQ3비디오 환경에서 SAM을 프롬프트링할 때 어떤 프롬프트 구성(예: 박스, 점, 또는 조합)이 최고의 분할 성능을 낳는가?
- RQ4비디오 명확도 객체 추적 네트워크가 복잡한 시나리오에서 신뢰할 수 있고 장기적인 궤적을 생성하여 SAM에 효과적인 프롬프트로 활용할 수 있는가?
- RQ5SAM과 궤적 프롬프트를 활용한 마스크 없음 파라다임이 기존의 마스크 지도 학습 비지도 VOS 방법보다 우수한 성능을 낼 수 있는가?
주요 결과
- UVOSAM는 DAVIS2017 검증 세트에서 J&F 점수 88.3을 기록하여 현재의 마스크 지도 학습 최신 기술 수준 방법보다 뚜렷이 뛰어난 성능을 보였다.
- 박스와 5점 프롬프트 조합이 가장 높은 성능(J&F = 88.3)을 기록하여, 구조적 및 고밀도 공간적 신호가 SAM의 분할 정확도를 향상시킨다는 것을 입증했다.
- 점 프롬프트에 3개의 점을 사용할 경우 단일 점 대비 J&F 점수 29.6점 향상되었으며, 이는 더 많은 점이 의미 모호성을 감소시킨다는 것을 보여준다.
- VSOT 모델 자체만으로도 J&F 점수 78.9를 기록하여 명확도 객체 탐지 및 궤적 생성 능력이 뛰어나다는 것을 시사한다.
- DAVIS2017에서 모든 메트릭에서 모든 베이스라인 방법(예: MOT(61.1 J&F), VSOT(78.9 J&F))을 초월하여 성능이 뛰어나다는 것을 입증했다.
- 미세한 물체 탐지나 가림 현상 처리에 한계가 있음에도 불구하고, UVOSAM는 공간-시간 상관관계를 효과적으로 활용하여 복잡한 시나리오에서도 견고한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.