Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Optical Flow via Dilated Networks and Occlusion Reasoning

Yi Zhu, Shawn Newsam|arXiv (Cornell University)|2018. 05. 07.
Advanced Vision and Imaging참고 문헌 14인용 수 3
한 줄 요약

이 논문은 다중 척도 처리와 격자 무늬 잡음 감소를 위해 확장된 컨볼루션과 막힘 추론을 사용하는 비지도형 광학 흐름 추정 방법을 제안한다. 디컨볼루션을 확장된 컨볼루션으로 대체하고 밀집(skip) 연결을 통합함으로써 고해상도 특징을 유지하며, KITTI 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다. F1-all 오차는 2.35%이며, 동작 인식 정확도는 82.5%이다.

ABSTRACT

Despite the significant progress that has been made on estimating optical flow recently, most estimation methods, including classical and deep learning approaches, still have difficulty with multi-scale estimation, real-time computation, and/or occlusion reasoning. In this paper, we introduce dilated convolution and occlusion reasoning into unsupervised optical flow estimation to address these issues. The dilated convolution allows our network to avoid upsampling via deconvolution and the resulting gridding artifacts. Dilated convolution also results in a smaller memory footprint which speeds up interference. The occlusion reasoning prevents our network from learning incorrect deformations due to occluded image regions during training. Our proposed method outperforms state-of-the-art unsupervised approaches on the KITTI benchmark. We also demonstrate its generalization capability by applying it to action recognition in video.

연구 동기 및 목표

  • 다중 척도 처리, 격자 무늬 잡음, 막힘 추론 등의 비지도형 광학 흐름 추정의 한계를 해결한다.
  • 해상도 손실과 격자 무늬 잡음을 방지하기 위해 디컨볼루션에 대한 의존도를 줄이고 고해상도 특징 맵을 유지한다.
  • 전진-후진 일致성(consistency)을 명시적으로 모델링함으로써 훈련의 안정성과 정확도를 향상시킨다.
  • 실제 광학 흐름 레이블이 필요 없이도 후속 작업(예: 동작 인식)에 대한 모델 일반화 능력을 향상시킨다.
  • 실시간 추론 속도를 유지하면서도 실제 벤치마크에서 높은 정확도를 달성한다.

제안 방법

  • 최종 레이어에서 디컨볼루션 업샘플링을 확장된 컨볼루션으로 대체하여 공간 해상도를 유지하고 격자 무늬 잡음을 방지한다.
  • 후기 컨볼루션 블록들(예: conv3_1, conv4_1, conv5_1)에 확장률(dilation rate)이 2와 4인 확장된 컨볼루션을 적용하여 샘플링 없이 수용영역을 확장한다.
  • 레이어 간에 밀집(skip) 연결을 통합하여 특징 전파를 향상시키고, 특히 작은 물체에 대해 세밀한 운동을 포착한다.
  • 광학 일致성과 밝기 일정성 기반의 비지도형 훈련 목표함수를 사용하며, 음영 영역(occluded regions)을 제외한 영역에서만 기울기 역전파를 수행한다.
  • 전진-후진 흐름 일치를 통한 막힘 추론을 통합: 전진 및 후진 흐름이 일치하는 영역에서만 기울기 업데이트를 수행한다.
  • 실제 광학 흐름 레이블이 없이도 이미지 재구성 손실을 기반으로 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1디컨볼루션 업샘플링 없이도 확장된 컨볼루션은 다중 척도 광학 흐름 추정에 어떻게 기여하는가?
  • RQ2전진-후진 일치를 통한 막힘 추론은 비지도형 광학 흐름 추정에 어떻게 향상되는가?
  • RQ3확장된 컨볼루션과 밀집 연결을 통해 고해상도 특징을 유지함으로써 흐름 정확도는 어느 정도 향상되는가?
  • RQ4실제 광학 흐름 레이블 없이 훈련된 비지도형 광학 흐름 모델이 동작 인식과 같은 후속 작업에 강력한 일반화 능력을 가지는가?
  • RQ5제안된 방법은 KITTI 2012 및 2015와 같은 실제 벤치마크에서 기존 비지도형 기반 모델을 초월하는가?

주요 결과

  • 제안된 방법은 KITTI 2015 벤치마크에서 F1-all 오차 2.35%를 기록하여 최신 기술 수준의 비지도형 방법을 초월한다.
  • KITTI 2012에서는 F1-all 오차 1.56%를 기록하여 이전 비지도형 접근 방식보다 뚜렷이 향상되었다.
  • 비지도형 모델이지만 UCF101 동작 인식 벤치마크에서 상위-1 정확도 82.5%를 기록하여 FlowNet2와 FlowFields를 뛰어넘었다.
  • 모델은 33.3 fps로 실행되어 실시간 추론이 가능하며, FlowNet2(8 fps)와 FlowFields(0.06 fps)를 모두 능가한다.
  • 확장된 컨볼루션의 사용은 메모리 사용량을 줄이고, 디컨볼루션 기반 방법 대비 격자 무늬 잡음을 완전히 제거한다.
  • 막힘 추론 통합으로 인해 막힘 영역 및 비막힘 영역 모두에서 오차율이 50% 이상 감소하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.