Skip to main content
QUICK REVIEW

[논문 리뷰] Spatial Feature Calibration and Temporal Fusion for Effective One-stage Video Instance Segmentation

Minghan Li, Shuai Li|arXiv (Cornell University)|2021. 04. 06.
Advanced Image Processing Techniques참고 문헌 27인용 수 7
한 줄 요약

이 논문은 공간적 특징 캘리브레이션을 위해 회귀된 바운딩 박스 특징 추출을 통해 개선하고, 시간적 융합 모듈을 통해 시간적 일관성을 향상시키는 일단계(video instance segmentation) 프레임워크인 STMask를 제안한다. 진짜 바운딩 박스에 특징을 캘리브레이션하고 인접 프레임의 정보를 활용함으로써, STMask는 ResNet-50를 사용할 경우 33.5%의 마스크 AP를 달성하고 ResNet-101을 사용할 경우 36.8%를 달성하며, 28.6 FPS에서 실시간 추론을 유지한다.

ABSTRACT

Modern one-stage video instance segmentation networks suffer from two limitations. First, convolutional features are neither aligned with anchor boxes nor with ground-truth bounding boxes, reducing the mask sensitivity to spatial location. Second, a video is directly divided into individual frames for frame-level instance segmentation, ignoring the temporal correlation between adjacent frames. To address these issues, we propose a simple yet effective one-stage video instance segmentation framework by spatial calibration and temporal fusion, namely STMask. To ensure spatial feature calibration with ground-truth bounding boxes, we first predict regressed bounding boxes around ground-truth bounding boxes, and extract features from them for frame-level instance segmentation. To further explore temporal correlation among video frames, we aggregate a temporal fusion module to infer instance masks from each frame to its adjacent frames, which helps our framework to handle challenging videos such as motion blur, partial occlusion and unusual object-to-camera poses. Experiments on the YouTube-VIS valid set show that the proposed STMask with ResNet-50/-101 backbone obtains 33.5 % / 36.8 % mask AP, while achieving 28.6 / 23.4 FPS on video instance segmentation. The code is released online https://github.com/MinghanLi/STMask.

연구 동기 및 목표

  • 일단계 비디오 인스턴스 세그멘테이션에서 공간적 특징 캘리브레이션의 부족을 해결하기 위해, 특징이 진짜 바운딩 박스와 정렬되지 않는 문제를 해결한다.
  • 프레임 단위 세그멘테이션에서 시간적 상관관계가 손실되는 것을 방지하기 위해, 프레임 간 의존성을 통합한다.
  • 운동 블러, 가림, 비정상 자세 등의 어려운 비디오에서 성능을 향상시키면서도 실시간 추론 속도를 유지한다.
  • 정확도와 속도를 균형 잡은 일단계 대안을 제공함으로써 이중단계 방법에 대한 단순하면서도 효과적인 대체 방법을 제시한다.

제안 방법

  • 공간적 정렬을 향상시키기 위해, 진짜 바운딩 박스 주변에 회귀된 바운딩 박스를 예측하는 회귀 브랜치를 사용한다.
  • 더 나은 특징 표현을 위해, 적응형(1×1 컨볼루션) 또는 정렬된(수학적 유도) 전략을 사용하여 이러한 회귀된 박스에서 특징을 추출한다.
  • 인접 프레임 간의 마스크를 추론함으로써 추적의 강건성을 향상시키기 위해 시간적 융합 모듈을 도입한다.
  • 캘리브레이션된 특징을 사용하여 엔드 투 엔드 비디오 인스턴스 세그멘테이션을 위한 완전 컨볼루션의 일단계 네트워크를 사용한다.
  • 공간적 위치별로 특징을 생성하기 위해, 각 공간 위치에 대해 다수의 컨볼루션 커널을 설계함으로써 앵커 수준에서 특징 캘리브레이션을 적용한다.
  • 마스크 예측을 프레임 간에 전파하기 위해 시간적 융합 모듈을 통합함으로써, 운동 블러 및 가림 상황에서의 일관성을 향상시킨다.

실험 결과

연구 질문

  • RQ1회귀된 바운딩 박스를 통한 공간적 특징 캘리브레이션은 일단계 비디오 인스턴스 세그멘테이션에서 마스크 AP를 향상시키는가?
  • RQ2인접 프레임 간의 시간적 융합을 통합하면 어려운 비디오 시퀀스에서 빠진 검출을 줄이는가?
  • RQ3일단계 프레임워크는 실시간 추론 속도를 유지하면서도 경쟁적인 정확도를 달성할 수 있는가?
  • RQ4적응형 대비 정렬된 특징 추출 전략은 공간적 캘리브레이션에서 어떻게 비교되는가?

주요 결과

  • ResNet-50 백본을 사용한 STMask는 YouTube-VIS 검증 세트에서 33.5%의 마스크 AP를 달성하여 이전의 일단계 방법들을 능가한다.
  • ResNet-101 백본을 사용할 경우 STMask는 36.8%의 마스크 AP를 달성하여, 추가적인 트릭 없이도 뛰어난 성능을 보인다.
  • 시간적 융합 모듈은 기준 모델 대비 성능을 5.2%포인트 향상시켜, 가림 및 운동 블러 상황에서의 빠진 검출을 크게 줄였다.
  • ResNet-50를 사용할 경우 STMask는 28.6 FPS로 실시간 추론 속도를 유지하고, ResNet-101을 사용할 경우 23.4 FPS를 기록한다.
  • 제거 실험 결과, 공간적 캘리브레이션과 시간적 융합 모두 성능 향상에 기여한다는 것이 확인되었다.
  • 시각적 비교 결과, 시간적 융합이 포함된 STMask는 프레임 간 일관성을 감소시키고, 작은 객체 및 가려진 인스턴스의 마스크 품질을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.