Skip to main content
QUICK REVIEW

[논문 리뷰] StableNet: Semi-Online, Multi-Scale Deep Video Stabilization

Chia-Hung Huang, Hang Yin|arXiv (Cornell University)|2019. 07. 24.
Image and Video Stabilization참고 문헌 26인용 수 9
한 줄 요약

StableNet는 명시적인 운동 추정 없이 흔들리는 영상을 안정화하는 반온라인, 다중 해상도 딥러닝 접근법을 제안한다. 이는 프레임을 저해상도에서 고해상도로 점진적으로 처리하며, 아핀 변환을 학습함으로써 영상 안정화를 달성한다. 합성 데이터에서 단순한 진동 패턴으로 훈련되었음에도 불구하고, 복잡한 시나리오인 줌인/아웃 및 파라락세이 등에서도 뛰어난 성능을 보이며, 흔들리는 영상에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Video stabilization algorithms are of greater importance nowadays with the prevalence of hand-held devices which unavoidably produce videos with undesirable shaky motions. In this paper we propose a data-driven online video stabilization method along with a paired dataset for deep learning. The network processes each unsteady frame progressively in a multi-scale manner, from low resolution to high resolution, and then outputs an affine transformation to stabilize the frame. Different from conventional methods which require explicit feature tracking or optical flow estimation, the underlying stabilization process is learned implicitly from the training data, and the stabilization process can be done online. Since there are limited public video stabilization datasets available, we synthesized unstable videos with different extent of shake that simulate real-life camera movement. Experiments show that our method is able to outperform other stabilization methods in several unstable samples while remaining comparable in general. Also, our method is tested on complex contents and found robust enough to dampen these samples to some extent even it was not explicitly trained in the contents.

연구 동기 및 목표

  • 명시적인 카메라 경로 추정 또는 옵티컬 플로우 계산 없이 종단 간(end-to-end), 온라인 영상 안정화 방법을 개발한다.
  • 영상 안정화를 위한 대규모 쌍체 훈련 데이터의 부족 문제를 해결하기 위해 정확한 진짜값(ground truth)을 갖춘 현실적인 흔들리는 영상을 합성한다.
  • 다양한 훈련 데이터의 변동성과 다중 해상도 정밀화를 통해 줌인/아웃 및 파라락세이 시나리오와 같은 복잡한 영상 콘텐츠에서의 안정화 성능을 향상시킨다.
  • 다중 해상도 아키텍처에서 과거 영상 프레임의 시간적 맥락을 활용하여 실시간 온라인 처리를 가능하게 한다.

제안 방법

  • 네트워크는 시아미즈 유사 다중 해상도 아키텍처를 사용하며, 입력 프레임을 저, 중, 고해상도 세 수준에서 처리한다. 각 수준은 서로 다른 시간 샘플링 간격을 가진다.
  • 입력은 각 해상도 수준에서 과거의 안정된 프레임 스택과 하나의 불안정한 프레임으로 구성되며, 이는 짧은 기간과 긴 기간의 운동 패턴을 모두 포착할 수 있도록 한다.
  • 모델은 각 해상도 수준에 대해 아핀 변환을 출력하며, 이를 융합하여 현재 불안정한 프레임을 안정화한다.
  • 반온라인 전략이 도입되었으며, 영상 청크를 먼저 안정화한 후 통합함으로써 오차 전파를 줄이고 저주파 운동 처리를 향상시킨다.
  • 실제로는 약 420개의 흔들리는 영상(17만 개 이상의 프레임)으로 구성된 합성 데이터셋에서 종단 간으로 훈련된다. 이는 안정된 원본 클립에 현실적인 진동 패턴을 적용하여 생성된다.
  • 손실 함수는 각 스케일에서 별도로 계산되며, 공유된 네트워크를 통해 역전파되어 다중 해상도 특징의 공동 최적화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1명시적인 카메라 경로 추정 또는 옵티컬 플로우 없이도 데이터 기반 종단 간 딥러닝 모델이 경쟁력 있는 영상 안정화 성능을 달성할 수 있는가?
  • RQ2통제된 진동 패턴을 가진 합성 쌍체 데이터셋은 강건한 영상 안정화 모델 훈련에 얼마나 효과적인가?
  • RQ3간단한 2차원 진동 패턴으로 훈련된 모델이 줌인/아웃 및 파라락세이 시나리오와 같은 복잡한 영상 콘텐츠로의 일반화 능력은 어느 정도인가?
  • RQ4순수 온라인 방법에 비해 반온라인 다중 해상도 접근법이 안정화 성능을 향상시킬 수 있는가? 특히 저주파 운동 처리 측면에서 어떻게 성능을 높이는가?
  • RQ5정밀도와 안정성 측면에서, 모델의 성능은 온라인 및 오프라인 안정화 기준선과 비교해 어떻게 측정되는가?

주요 결과

  • StableNet는 도전적인 불안정한 영상 샘플에서 다른 온라인 안정화 방법보다 정밀도와 안정성 측면에서 뛰어난 성능을 보이며, 특정 경우에서는 오프라인 방법과 비교해도 유사한 성능을 달성한다.
  • 특정 테스트 클립에서 안정성 지표(회전, 수평, 수직 이동 에너지 비율의 최소값)가 최신 기술 수준의 오프라인 방법과 맞먹거나 초월한다.
  • 줌인/아웃 및 파라락세이 영상에서는, 해당 콘텐츠로 특별히 훈련되지 않았음에도 불구하고 [16]과 유사한 정량적 성능을 유지하며, 다양한 합성 데이터에서의 일반화 능력을 입증한다.
  • 높은 변동성을 가진 합성 훈련 데이터 덕분에, 줌인/아웃 및 파라락세이와 같은 복잡한 운동에 대해 강건한 성능을 보인다.
  • 고주파 진동에는 효과적이지만, 저주파 진동과 대규모 운동의 안정화에는 한계를 보이며, 더 다양한 훈련 패턴이 필요로 함을 시사한다.
  • 반온라인 전략은 오차 전파를 효과적으로 줄이며, 저주파 기울임 처리 능력을 향상시켜 전체 안정화 품질을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.