Skip to main content
QUICK REVIEW

[논문 리뷰] Semantic Video Segmentation by Gated Recurrent Flow Propagation

David Nilsson, Cristian Sminchisescu|arXiv (Cornell University)|2016. 12. 28.
Advanced Neural Network Applications참고 문헌 31인용 수 13
한 줄 요약

이 논문은 비정형 영상 프레임을 활용하여 시공간 게이팅 순환 단위(STGRU)를 통해 광학 흐름을 통해 의미적 레이블을 전파하는 딥, 엔드 투 엔드 학습 가능한 프레임워크를 제안한다. 이는 국소적 흐름 불확실성에 의해 적응적으로 게이팅된다. 이 방법은 추가적인 계산 비용을 최소화하면서 CityScapes와 CamVid에서 분류 정확도와 시간적 일관성을 향상시키며, 추가 애너테이션 비용 없이 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Semantic video segmentation is challenging due to the sheer amount of data that needs to be processed and labeled in order to construct accurate models. In this paper we present a deep, end-to-end trainable methodology to video segmentation that is capable of leveraging information present in unlabeled data in order to improve semantic estimates. Our model combines a convolutional architecture and a spatio-temporal transformer recurrent layer that are able to temporally propagate labeling information by means of optical flow, adaptively gated based on its locally estimated uncertainty. The flow, the recognition and the gated temporal propagation modules can be trained jointly, end-to-end. The temporal, gated recurrent flow propagation component of our model can be plugged into any static semantic segmentation architecture and turn it into a weakly supervised video processing one. Our extensive experiments in the challenging CityScapes and Camvid datasets, and based on multiple deep architectures, indicate that the resulting model can leverage unlabeled temporal frames, next to a labeled one, in order to improve both the video segmentation accuracy and the consistency of its temporal labeling, at no additional annotation cost and with little extra computation.

연구 동기 및 목표

  • 비정형 영상 분할에서 높은 애너테이션 비용 문제를 해결하기 위해 비정형 영상 프레임을 활용하여 모델 성능을 향상시키는 것.
  • 인식, 광학 흐름, 시간적 전파 모듈을 동시에 엔드 투 엔드로 학습할 수 있는 방법을 개발하는 것.
  • 흐름 기반 워핑과 불확실성 인식 게이팅을 활용하여 의미적 레이블을 적응적으로 전파하여 영상 분할의 시간적 일관성을 향상시키는 것.
  • 기존 정적 의미적 분할 모델에 최소한의 아키텍처 변경으로 통합할 수 있도록 하는 것.

제안 방법

  • 모델는 공간 변환망을 통한 광학 흐름 워핑과 시간적 융합을 위한 게이팅 순환 단위를 결합한 시공간 트랜스포머 게이팅 순환 단위(STGRU)를 사용한다.
  • 광학 흐름을 사용하여 인접 프레임의 특징을 워핑함으로써 영상 프레임 간 시공간 특징 전파를 가능하게 한다.
  • 게이팅 메커니즘은 국소적으로 추정된 광학 흐름 불확실성에 기반하여 레이블 전파를 적응적으로 제어하여 신뢰할 수 없는 흐름 추정으로 인한 노이즈를 줄인다.
  • 전체 시스템은 미분 가능하며 엔드 투 엔드로 학습되어 분류, 흐름 추정, 시간적 전파를 동시에 최적화한다.
  • STGRU 구성 요소는 기존에 훈련된 정적 의미적 분할 네트워크에 삽입될 수 있으며, 이를 약한 감독 기반 영상 분할 모델로 전환할 수 있다.
  • 밀도 있는 예측을 위해 다이레이티드 컨볼루션과 컨텍스트 모듈을 사용하며, 추론은 크롭된 512×512 이미지 패치에서 수행된다.

실험 결과

연구 질문

  • RQ1비정형 영상 프레임을 추가 애너테이션 없이 의미적 분할 정확도 향상에 효과적으로 활용할 수 있는가?
  • RQ2흐름 기반 특징 전파를 통해 영상 분할의 시간적 일관성을 어떻게 향상시킬 수 있는가?
  • RQ3미분 가능하고 엔드 투 엔드 학습 가능한 아키텍처가 흐름 추정, 인식, 시간적 전파를 동시에 최적화할 수 있는가?
  • RQ4불확실성 인식 게이팅이 영상 분할에서 노이즈가 많은 광학 흐름에 대해 얼마나 강건성을 향상시키는가?

주요 결과

  • CityScapes 테스트 세트에서 제안된 GRFP 방법은 평균 IoU 84.6%를 달성하여 베이스라인 Dilation8 모델(83.1%)과 FSO [24](91.3%)를 초월했다.
  • CamVid 데이터셋에서 GRFP는 평균 IoU 66.1%를 기록하여 Dilation8 베이스라인(65.3%)과 FSO [24](66.1%)를 초월했다.
  • 세 개의 긴 CityScapes 영상에서 평균 4.35%p의 시간적 일관성 향상을 기록하여 분할 트랙젝터리의 번짐과 노이즈를 감소시켰다.
  • Flownet1을 사용할 경우 프레임당 추가로 75ms(총 350ms 추론)가 소요되었고, Flownet2를 사용할 경우 프레임당 335ms로 낮은 계산 오버헤드를 보였다.
  • 정성적 결과는 기둥과 보도와 같은 도전적인 객체의 분할 향상과 연속 프레임 간 임의의 예측 감소를 보여주었다.
  • STGRU 모듈은 Dilation10 베이스라인에서 일시적인 아티팩트를 성공적으로 억제하여 향상된 시간적 안정성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.