[논문 리뷰] Multi-Source Fusion and Automatic Predictor Selection for Zero-Shot Video Object Segmentation
이 논문은 RGB, 깊이, 광학 흐름, 정적 시각적 주목 특징을 상호내재적 공간 주의 모듈(ISAM)과 특징 정제 모듈(FPM)을 통해 다중 소스 융합 및 자동 예측자 선택 프레임워크를 제안하여 제로샷 비디오 객체 분할을 향상시킨다. 자동 예측자 선택(APS) 네트워크는 낮은 품질의 광학 흐름으로 인한 오류를 완화하기 위해 정적 시각적 주목과 움직이는 객체 예측 간에 동적으로 선택한다. 이는 DAVIS 16, Youtube-Objects, FBMS 벤치마크에서 최신 기술 수준의 성능을 달성한다.
Location and appearance are the key cues for video object segmentation. Many sources such as RGB, depth, optical flow and static saliency can provide useful information about the objects. However, existing approaches only utilize the RGB or RGB and optical flow. In this paper, we propose a novel multi-source fusion network for zero-shot video object segmentation. With the help of interoceptive spatial attention module (ISAM), spatial importance of each source is highlighted. Furthermore, we design a feature purification module (FPM) to filter the inter-source incompatible features. By the ISAM and FPM, the multi-source features are effectively fused. In addition, we put forward an automatic predictor selection network (APS) to select the better prediction of either the static saliency predictor or the moving object predictor in order to prevent over-reliance on the failed results caused by low-quality optical flow maps. Extensive experiments on three challenging public benchmarks (i.e. DAVIS$_{16}$, Youtube-Objects and FBMS) show that the proposed model achieves compelling performance against the state-of-the-arts. The source code will be publicly available at extcolor{red}{\url{https://github.com/Xiaoqi-Zhao-DLUT/Multi-Source-APS-ZVOS}}.
연구 동기 및 목표
- 기존 제로샷 비디오 객체 분할(ZVOS) 방법이 RGB 또는 RGB와 광학 흐름에만 의존하는 한계를 해결하기 위해, 상호보완적인 다양한 정보 소스를 통합한다.
- 상호내재적 공간 주의 모듈(ISAM)을 통해 각 소스의 특징 맵에 대한 공간적 중요도를 적응적으로 강조하여 특징 융합을 향상시킨다.
- 특징 정제 모듈(FPM)을 사용해 상호 간의 불일치하는 특징을 걸러내어 소스 간 간섭을 줄인다.
- 낮은 품질의 광학 흐름으로 인한 성능 저하를 줄이기 위해 예측자 선택 네트워크(APS)를 통해 정적 시각적 주목 예측자와 움직이는 객체 예측자 간에 자동으로 선택한다.
- 다중 소스 특징 융합과 지능적인 예측자 선택을 통합하여 표준 ZVOS 벤치마크에서 최신 기술 수준의 성능을 달성한다.
제안 방법
- RGB 입력에서 깊이 및 정적 시각적 주목 맵을 예측하기 위해 공유 인코더와 두 개의 디코더를 가진 다중 작업 네트워크를 사용하며, FPN 아키텍처를 활용한다.
- 상호내재적 공간 주의 모듈(ISAM)은 공간적 맥락을 기반으로 각 소스 특징 맵에 대한 주의 가중치를 적응적으로 계산하여 더 정보가 풍부한 특징을 강조한다.
- 특징 정제 모듈(FPM)은 융합된 특징 맵을 공통 및 독립적 구성 요소로 분해하고, 독립적 부분을 빼내어 배경 노이즈를 억제하고 움직이는 객체 신호를 유지한다.
- 자동 예측자 선택(APS) 네트워크는 광학 흐름 기반 예측의 신뢰도를 평가하고, 신뢰도 점수에 따라 정적 시각적 주목 예측자 또는 움직이는 객체 예측자 중 하나를 선택한다.
- 최종 예측은 선택된 예측자에 의해 생성되어 낮은 품질의 광학 흐름에 대해 강건성을 확보한다.
- 이 프레임워크는 DAVIS 16, Youtube-Objects, FBMS에서 엔드 투 엔드로 훈련되며, 깊이, 시각적 주목, 분할 감독을 위한 손실 함수가 사용된다.
실험 결과
연구 질문
- RQ1RGB, 깊이, 광학 흐름, 정적 시각적 주목과 같은 다수의 시각적 소스를 효과적으로 융합하여 제로샷 비디오 객체 분할 성능을 향상시킬 수 있는가?
- RQ2소스 간 공간적 관계를 고려하는 주의 메커니즘이 다중 소스 융합에서 특징 표현을 향상시킬 수 있는가?
- RQ3소스 간에 불일치하거나 노이즈가 많은 특징을 어떻게 걸러내어 분할 정확도를 향상시킬 수 있는가?
- RQ4자동 예측자 선택 메커니즘이 신뢰할 수 없는 광학 흐름에 대한 의존도를 줄이고 강건성을 향상시킬 수 있는가?
- RQ5다중 소스 특징 융합과 지능적인 예측자 선택의 통합이 표준 ZVOS 벤치마크에서 최신 기술 수준의 성능을 달성하는가?
주요 결과
- 제안된 방법은 DAVIS 16 벤치마크에서 평균 교차율(mIoU) 83.4와 평균 F-측정치 82.3을 기록하여 이전 최신 기술 수준의 방법들을 능가한다.
- Youtube-Objects 데이터셋에서 이 방법은 mIoU 74.9와 평균 F-측정치 83.3을 달성하여 낮은 품질의 광학 흐름 조건에서도 강력한 일반화 능력을 보여준다.
- ISAM 모듈은 단순한 다중 소스 특징 연결에 비해 mIoU를 2.1% 향상시키고 평균 F-측정치를 1.6% 향상시켰다.
- FPM은 mIoU에서 1.1% 향상되고 평균 F-측정치에서도 1.1% 향상되어 불일치하는 특징을 걸러내는 데 효과적임을 확인했다.
- APS 네트워크는 광학 흐름 품질에 따라 SOS 또는 MOS 중 더 나은 예측자를 선택함으로써 우수한 성능을 달성했으며, Youtube-Objects에서 단독 SOS(72.7 mIoU)와 MOS(70.2 mIoU)보다 뛰어난 성능을 보였다.
- 시각화 결과는 APS가 낮은 품질의 광학 흐름을 가진 영상에는 낮은 점수를, 높은 품질의 흐름을 가진 영상에는 높은 점수를 할당함으로써 그 적응적 선택 메커니즘이 타당함을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.