Skip to main content
QUICK REVIEW

[논문 리뷰] Motion-Attentive Transition for Zero-Shot Video Object Segmentation

Tianfei Zhou, Shunzhou Wang|arXiv (Cornell University)|2020. 03. 09.
Visual Attention and Saliency Detection참고 문헌 41인용 수 10
한 줄 요약

이 논문은 운동 및 외관 특징을 계층적으로 통합하기 위해 운동-주의 전환(Motion-Attentive Transition, MAT) 블록을 사용하는 새로운 이중 스트림 인코더-디코더 프레임워크인 MATNet을 제안한다. 각 잔차 레이어에서 운동과 외관 처리를 번갈아가며 수행함으로써 MATNet은 시공간 표현 학습을 향상시키며, DAVIS-16, FBMS, Youtube-Objects 벤치마크에서 각각 평균 JIoU 점수 76.1%, 76.1%, 69.0%로 최신 기술 수준을 달성한다.

ABSTRACT

In this paper, we present a novel Motion-Attentive Transition Network (MATNet) for zero-shot video object segmentation, which provides a new way of leveraging motion information to reinforce spatio-temporal object representation. An asymmetric attention block, called Motion-Attentive Transition (MAT), is designed within a two-stream encoder, which transforms appearance features into motion-attentive representations at each convolutional stage. In this way, the encoder becomes deeply interleaved, allowing for closely hierarchical interactions between object motion and appearance. This is superior to the typical two-stream architecture, which treats motion and appearance separately in each stream and often suffers from overfitting to appearance information. Additionally, a bridge network is proposed to obtain a compact, discriminative and scale-sensitive representation for multi-level encoder features, which is further fed into a decoder to achieve segmentation results. Extensive experiments on three challenging public benchmarks (i.e. DAVIS-16, FBMS and Youtube-Objects) show that our model achieves compelling performance against the state-of-the-arts.

연구 동기 및 목표

  • 학습 데이터에 포함된 적재되지 않은 객체에 대해 일반화할 수 있는 능력이 요구되는 제로샷 비디오 객체 분할 문제를 해결하기 위해.
  • 기존의 이중 스트림 네트워크가 운동과 외관을 별도로 처리함으로써 외관 신호에 과적합되는 문제를 해결하기 위해.
  • 운동과 외관 간의 계층적이고 생물학적으로 영감을 얻은 상호작용을 모델링하여 인간의 시각 시스템의 주의 메커니즘을 모방하기 위해.
  • 운동 블러, 변형, 배경 혼잡성과 같은 도전적인 조건에서도 분할 정확도를 향상시키기 위해.

제안 방법

  • 각 컨볼루션 스테이지에서 광학 흐름을 이용해 외관 특징을 선택적으로 개선하는 비대칭 주의 메커니즘을 구현한 새로운 운동-주의 전환(MAT) 블록을 도입한다.
  • 모든 잔차 블록에서 운동 및 외관 특징을 융합하는 깊이 있는 번갈아가는 이중 스트림 인코더를 설계하여 지속적인 다중 모odal 상호작용을 가능하게 한다.
  • 다양한 수준의 인코더 특징을 적응적으로 선택하고 변환하여 분류 가능성과 스케일 민감도를 향상시키기 위해 스케일 민감 주의(Scale-Sensitive Attention, SSA)를 활용한 브리지 네트워크를 사용한다.
  • 다중 스케일 특징을 활용하고 객체 경계를 명시적으로 예측함으로써 분할 정확도를 향상시키기 위해 캐스케이딩된 경계-주의 보완(Boundary-Aware Refinement, BAR) 블록을 갖춘 디코더를 활용한다.
  • 디코더에서 스케일 간 인코더와 디코더 특징을 정렬하기 위해 SSA를 사용하는 상향식, 점진적 개선 전략을 적용한다.
  • 학습 비디오의 진짜 마스크와 프레임 쌍으로부터 추정된 광학 흐름을 사용하여 모델을 엔드 투 엔드로 훈련시킨다.

실험 결과

연구 질문

  • RQ1운동 신호가 계층적이고 다중 스케일 방식으로 외관 기반 표현 학습에 효과적으로 통합될 수 있는가, 이를 통해 제로샷 비디오 객체 분할 성능이 향상되는가?
  • RQ2모델의 각 스테이지에서 운동-외관 상호작용을 번갈아가며 처리하는 것이 기존의 독립적 처리 방식과 비교해 어떤가?
  • RQ3운동 유도 주의가 배경 혼잡성이나 시각적 유사성으로 인한 외관 특징의 모호성을 어느 정도 줄일 수 있는가?
  • RQ4제안된 MAT 블록이 비디오 시퀀스에서 운동 블러, 변형, 스케일 변화에 대해 얼마나 강건한가?
  • RQ5스케일 민감 주의를 갖춘 브리지 네트워크가 인코더와 디코더 간의 특징 전달을 향상시켜 더 정밀한 경계 정의에 기여하는가?

주요 결과

  • FBMS 벤치마크에서 MATNet은 평균 JIoU 76.1%를 기록하여 두 번째로 우수한 성능을 보인 PDB 보다 2.1%p 높게 기록했다.
  • DAVIS-16에서 MATNet은 평균 JIoU 76.1%를 달성하여 두 번째로 높은 성능을 보인 AGNN 보다 1.7%p 높았다.
  • Youtube-Objects에서 MATNet은 평균 JIoU 69.0%를 기록하여 AGS에 이어 두 번째로 높은 성능을 보였으며, 대부분의 객체 카테고리에서 일관된 향상이 있었다.
  • 제거 또는 대체했을 경우 성능이 크게 떨어지는 것을 확인한 제거 실험 결과, MAT 블록이 가장 핵심적인 구성 요소임을 입증했다.
  • DAVIS-16 및 Youtube-Objects에서의 정성적 결과를 통해 운동 블러, 물체 변형, 배경 혼잡성과 같은 도전적인 요소에 대해 강력한 내성성을 보였다.
  • 스케일 민감 주의를 갖춘 제안된 브리지 네트워크가 인코더와 디코더 간의 특징 정렬을 크게 향상시켜 더 정밀한 경계 예측에 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.