Skip to main content
QUICK REVIEW

[논문 리뷰] Making a Case for 3D Convolutions for Object Segmentation in Videos

Sabarinath Mahadevan, Ali Athar|arXiv (Cornell University)|2020. 08. 26.
Visual Attention and Saliency Detection참고 문헌 26인용 수 4
한 줄 요약

이 논문은 시공간 특징 학습을 활용하여 최신 2D 방법을 능가하는 영상 객체 분할을 위한 완전 3D 컨볼루션 인코더-디코더 네트워크인 3DC-Seg를 제안한다. 경량 3D ResNet 백본과 디코더에 새로운 3D 글로벌 컨볼루션 및 정밀화 모듈을 사용함으로써, DAVIS’16, FBMS, ViSal 벤치마크에서 더 높은 정확도와 빠른 추론(4.5 fps)을 달성한다.

ABSTRACT

The task of object segmentation in videos is usually accomplished by processing appearance and motion information separately using standard 2D convolutional networks, followed by a learned fusion of the two sources of information. On the other hand, 3D convolutional networks have been successfully applied for video classification tasks, but have not been leveraged as effectively to problems involving dense per-pixel interpretation of videos compared to their 2D convolutional counterparts and lag behind the aforementioned networks in terms of performance. In this work, we show that 3D CNNs can be effectively applied to dense video prediction tasks such as salient object segmentation. We propose a simple yet effective encoder-decoder network architecture consisting entirely of 3D convolutions that can be trained end-to-end using a standard cross-entropy loss. To this end, we leverage an efficient 3D encoder, and propose a 3D decoder architecture, that comprises novel 3D Global Convolution layers and 3D Refinement modules. Our approach outperforms existing state-of-the-arts by a large margin on the DAVIS'16 Unsupervised, FBMS and ViSal dataset benchmarks in addition to being faster, thus showing that our architecture can efficiently learn expressive spatio-temporal features and produce high quality video segmentation masks. We have made our code and trained models publicly available at https://github.com/sabarim/3DC-Seg.

연구 동기 및 목표

  • 3D 컨볼루션을 밀도 있는 영상 예측 작업(예: 주목할 만한 객체 분할)에 효과적으로 적용할 수 있음을 보여주기 위해.
  • 기존 3D CNN의 영상 분할에서의 한계, 즉 높은 계산 비용과 큰 메모리 사용량을 해결하기 위해.
  • 경량 3D 인코더와 명시적 3D 디코더를 사용할 경우 2D 기반 최신 기술을 능가할 수 있음을 보여주기 위해.
  • 개선된 시공간 특징 학습을 통해 픽셀 수준의 영상 분할을 위한 완전 3D 네트워크의 엔드 투 엔드 학습을 가능하게 하기 위해.
  • 미래의 영상 이해 작업을 위한 강력한 기초 모델로 일반화 능력이 뛰어나고 빠르며 정확한 3D CNN 아키텍처를 확립하기 위해.

제안 방법

  • 메모리와 계산량을 줄이기 위해 노멀 스트라이드를 사용하는 사전 훈련된 계산 효율적인 3D ResNet(영상 행동 분류에서 유래)을 경량 인코더로 사용한다.
  • 디코더에서 공간적 및 시간적 차원을 모두 고려한 전역적 맥락을 집계하기 위해 새로운 3D 글로벌 컨볼루션 레이어를 도입한다.
  • 특징 맵을 점진적으로 정밀화하고 예측의 공간적·시간적 일致성을 향상시키기 위해 3D 정밀화 모듈을 활용한다.
  • 이진 분할 마스크에 표준 교차 엔트로피 손실을 사용하는 엔드 투 엔드 훈련 체계를 적용한다.
  • 완전한 영상 순환을 요구하지 않으면서도 시간적 일관성을 유지하기 위해 프레임 오버랩 전략(T_o = 3)을 활용한다.
  • 확대 컨볼루션과 깊은 특징 전파를 피함으로써 메모리 사용량을 줄이면서도 넓은 수신장 유지

실험 결과

연구 질문

  • RQ13D 컨볼루션 네트워크는 주목할 만한 객체 분할과 같은 밀도 있는 영상 분할 작업에 효과적으로 적용될 수 있는가?
  • RQ2경량 인코더와 강화된 3D 디코더를 갖춘 완전 3D 아키텍처가 기존 2D 기반 최신 기술을 능가할 수 있는가?
  • RQ33D 네트워크는 일반화 능력이 유지되거나 향상된 상태에서 2D 네트워크보다 더 높은 정확도와 더 빠른 추론을 달성할 수 있는가?
  • RQ4노멀 스트라이드와 효율적인 인코더의 설계 선택이 3D 영상 분할에서 성능과 계산 효율성에 어떤 영향을 미치는가?
  • RQ53D 글로벌 컨볼루션 및 정밀화 모듈의 설계 선택이 영상 분할에서 시공간 특징 학습에 얼마나 기여하는가?

주요 결과

  • DAVIS’16에서 3DC-Seg는 F-측정 91.8%와 MAE 0.015를 기록하여 두 번째로 좋은 성능을 낸 AD-Net보다 F-측정에서 11.0%포인트 높게 기록한다.
  • FBMS에서 84.5%의 F-측정과 0.048의 MAE를 기록하여 이전 최신 기술(STem-Seg)을 F-측정에서 7.3%포인트 뛰어넘는다.
  • ViSal에서 92.2%의 F-측정과 0.019의 MAE를 기록하여 데이터셋 특화 미세조정 없이도 강력한 일반화 능력을 보여준다.
  • NVIDIA GTX-1080Ti에서 0.22초/프레임(4.5 fps)으로 실행되어 다음으로 빠른 방법인 AD-Net(2.6 fps)보다 42% 더 빠르다.
  • 제거 실험 결과, 제안된 3D 디코더 구성요소(글로벌 컨볼루션 및 정밀화)가 필수적임을 확인하였으며, 이를 제거하면 F&F에서 4.7% 감소한다.
  • DAVIS에서만 미세조정을 수행했음에도 불구하고, DAVIS’16에서 이전 3D CNN 접근 방식(Hou 등, 2019)보다 F&F에서 5.0%포인트 높은 성능을 기록한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.