Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Online Video Stabilization

Miao Wang, Guo-Ye Yang|arXiv (Cornell University)|2018. 02. 22.
Image and Video Stabilization참고 문헌 34인용 수 9
한 줄 요약

이 논문은 StabNet을 제안하며, 깊이 학습 기반의 온라인 영상 안정화 방법으로, 각 불안정한 프레임에 대해 이전에 안정화된 프레임들만을 사용하여 실시간으로 점진적인 변환을 예측하는 컨볼루션 신경망을 사용한다. 이 방법은 93.3 FPS의 실시간 성능를 달성하며, 속도에서 오프라인 방법보다 30배 빠르며, 전통적인 방법이 실패하는 야간 및 흐린 영상과 같은 저품질 영상에서도 성능을 발휘한다.

ABSTRACT

Video stabilization technique is essential for most hand-held captured videos due to high-frequency shakes. Several 2D-, 2.5D- and 3D-based stabilization techniques are well studied, but to our knowledge, no solutions based on deep neural networks had been proposed. The reason for this is mostly the shortage of training data, as well as the challenge of modeling the problem using neural networks. In this paper, we solve the video stabilization problem using a convolutional neural network (ConvNet). Instead of dealing with offline holistic camera path smoothing based on feature matching, we focus on low-latency real-time camera path smoothing without explicitly representing the camera path. Our network, called StabNet, learns a transformation for each input unsteady frame progressively along the time-line, while creating a more stable latent camera path. To train the network, we create a dataset of synchronized steady/unsteady video pairs via a well designed hand-held hardware. Experimental results shows that the proposed online method (without using future frames) performs comparatively to traditional offline video stabilization methods, while running about 30 times faster. Further, the proposed StabNet is able to handle night-time and blurry videos, where existing methods fail in robust feature matching.

연구 동기 및 목표

  • 데이터 부족과 문제 정식화 과제로 인해 딥러닝 기반 영상 안정화 방법이 부족한 문제를 해결하기 위해.
  • 명시적인 카메라 경로 모델링을 피하면서도 실시간으로 동작하는 온라인 영상 안정화 시스템을 개발하기 위해.
  • 딥러닝 모델을 훈련하기 위한 동기화된 안정/불안정 영상 쌍으로 구성된 실용적인 데이터셋을 구축하기 위해.
  • 특징 매칭이 실패하는 저품질 영상, 예를 들어 야간 및 흐린 영상에서도 안정화를 강력하게 수행할 수 있도록 하기 위해.
  • 이전 프레임의 맥락을 활용한 엔드 투 엔드 학습이 오프라인 방법과 비교해 유사한 성능을 달성할 수 있음을 보여주기 위해.

제안 방법

  • StabNet은 경량 컨볼루션 신경망을 사용하여 이전에 안정화된 프레임 시퀀스를 기반으로 각 도착하는 불안정한 프레임에 대한 호모지어티 변환을 예측한다.
  • 신경망은 온라인 방식으로 점진적으로 프레임을 처리하며, 전체 카메라 경로를 명시적으로 모델링하지 않고도 잠재적인 카메라 경로를 업데이트한다.
  • 훈련을 위해 이중 카메라를 사용한 고유한 하드웨어 설정을 구축하여 동기화된 안정 및 불안정 영상 쌍을 촬영함으로써 동일한 콘텐츠와 운동을 보장한다.
  • 모델은 지도 학습 방식으로 훈련되며, 타겟으로 진짜 안정화된 프레임을 사용하고, 각 프레임의 변환 예측을 최소화하는 손실 함수를 적용한다.
  • 미래의 프레임에 의존하지 않기 때문에 오직 과거 프레임들만을 기반으로 하여 지연 시간이 0인 실시간 배포가 가능하다.
  • 미래 프레임 의존성을 피하기 때문에 라이브 영상 처리에 적합하다.

실험 결과

연구 질문

  • RQ1미래의 프레임에 의존하지 않고도 딥 네트워크를 효과적으로 실시간 영상 안정화에 훈련시킬 수 있는가?
  • RQ2훈련을 위한 대규모 고품질의 동기화된 안정/불안정 영상 쌍으로 구성된 데이터셋을 어떻게 구축할 수 있는가?
  • RQ3학습 기반 접근 방식이 특징 매칭 방법이 실패하는 저품질 영상, 예를 들어 흐린 영상이나 야간 영상에서 전통적 방법을 능가할 수 있는가?
  • RQ4이전 안정화된 프레임의 맥락을 기반으로 훈련된 모델이 오프라인 경로 스무딩 방법과 비교해 어느 정도 유사한 성능을 달성할 수 있는가?
  • RQ5명시적인 카메라 경로 추정을 생략하고 직접 프레임 단위 안정화 변환을 학습하는 것이 가능한가?

주요 결과

  • StabNet은 실시간 추론에서 93.3 FPS를 달성하였으며, Adobe Premiere CS6 및 MeshFlow와 같은 오프라인 안정화 방법보다 약 30배 빠르다.
  • 시각적 품질 면에서 오프라인 방법과 유사한 성능을 보이며, 사용자 연구 결과에서 일반 및 달리기 영상 카테고리에서 StabNet 결과가 선호되었다.
  • 특징 매칭이 실패하는 저품질 영상, 예를 들어 야간 및 운동 흐림 영상 처리에서 전통적 방법보다 StabNet이 뛰어난 성능을 보였다.
  • 사용자 연구 결과, StabNet이 6개 영상 카테고리 중 5개에서 Adobe Premiere CS6와 동일하거나 구분이 어려운 것으로 평가되었다.
  • 제안된 DeepStab 데이터셋은 동기화된 안정/불안정 영상 쌍으로 구성되어 있으며, 딥러닝 기반 영상 안정화를 위한 최초의 공개 훈련 데이터셋이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.