[논문 리뷰] Deep Motion Blind Video Stabilization
이 논문은 명시적인 운동 추정에 의존하지 않고 직접 안정화 프레임을 합성하는 최초의 운동 무관(_motion-blind_) 딥러닝 기반 영상 안정화 방법을 제안한다. 반복적 프레임 보간 기반의 새로운 비지도 데이터셋 생성 파이pline을 통해, 기존 최고 수준의 방법보다 약 3배 빠른 속도로 전체 화면 안정화를 달성하며, 왜곡 및 자르기 지표에서 운동 인식 기반 베이스라인을 능가하면서 해상도와 콘텐츠를 유지한다.
Despite the advances in the field of generative models in computer vision, video stabilization still lacks a pure regressive deep-learning-based formulation. Deep video stabilization is generally formulated with the help of explicit motion estimation modules due to the lack of a dataset containing pairs of videos with similar perspective but different motion. Therefore, the deep learning approaches for this task have difficulties in the pixel-level synthesis of latent stabilized frames, and resort to motion estimation modules for indirect transformations of the unstable frames to stabilized frames, leading to the loss of visual content near the frame boundaries. In this work, we aim to declutter this over-complicated formulation of video stabilization with the help of a novel dataset that contains pairs of training videos with similar perspective but different motion, and verify its effectiveness by successfully learning motion blind full-frame video stabilization through employing strictly conventional generative techniques and further improve the stability through a curriculum-learning inspired adversarial training strategy. Through extensive experimentation, we show the quantitative and qualitative advantages of the proposed approach to the state-of-the-art video stabilization approaches. Moreover, our method achieves $\sim3 imes$ speed-up over the currently available fastest video stabilization methods.
연구 동기 및 목표
- 유사한 시점이지만 다른 운동을 가진 풍부한 쌍체 훈련 데이터가 부족하여 영상 안정화를 위한 순수 회귀적 딥러닝 공식화가 부족한 문제를 해결하기 위해.
- 명시적인 운동 추정 모듈에 의존하지 않도록 하여, 직접 픽셀 수준의 안정화 프레임 합성을 가능하게 하기 위해.
- 손실 촬영 장치에서 기록된 불안정한 영상에서 균일 투영 안정 영상으로 변환하는 확장 가능한 비지도 데이터셋 생성 파이pline을 개발하기 위해.
- 과정 학습 기반의 적대적 훈련 전략을 통해 시간적 일관성과 시각적 품질을 향상시키기 위해.
- 기존 생성 네트워크를 활용한 적절한 데이터 및 훈련 설계로 운동 무관 안정화가 가능하고 효과적인지 입증하기 위해.
제안 방법
- 불안정한 손으로 촬영한 영상에서 반복적 프레임 보간을 사용하여 고품질의 균일 투영 안정 영상으로의 고해상도 합성 데이터셋 생성 파이pline(DGP)을 제안한다.
- 광범용 U-Net 기반 생성 네트워크를 활용하여, 광학 흐름이나 왜곡 모듈을 생략하고 직접 불안정한 입력에서 안정화된 프레임을 예측한다.
- 시간적 일관성을 증진하고 안정화 출력의 진동을 감소시키기 위해 대비 운동 손실을 도입한다.
- 훈련 복잡성을 점진적으로 증가시키는 과정 학습 전략을 적용하여, 네트워크가 단계적으로 안정화를 학습할 수 있도록 한다.
- 안정화 영상 시퀀스의 시각적 현실감과 시간적 일관성을 향상시키기 위해 시간적 적대적 훈련 전략을 적용한다.
- 생성된 데이터셋을 활용하여 전체 화면 해상도와 시각적 콘텐츠를 유지하는 운동 무관 안정화 네트워크를 훈련시킨다.
실험 결과
연구 질문
- RQ1명시적인 운동 추정에 의존하지 않고, 단지 엔드 투 엔드 픽셀 수준의 합성에만 기반하여 전체 화면 영상 안정화를 달성할 수 있는가?
- RQ2운동 무관 딥러닝 모델이 운동 인식 기반 최고 수준의 방법보다 시각적 품질과 안정성에서 뛰어나게 성능을 냈는가?
- RQ3불안정한 영상과 안정된 영상 쌍 간에 일관된 시점이 보장되는 데이터셋이 영상 안정화 성능 향상과 일반화 능력 향상에 기여하는가?
- RQ4과정 학습과 적대적 훈련이 운동 무관 안정화에서 시간적 일관성과 시각적 정확도를 향상시키는가?
- RQ5품질이나 콘텐츠 유지 성능을 희생시키지 않고도 영상 안정화 속도를 크게 향상시킬 수 있는가?
주요 결과
- 제안된 방법은 현재 가장 빠른 영상 안정화 방법보다 약 3배 빠른 속도를 달성하여 추론 효율성을 크게 향상시켰다.
- NUS 데이터셋에서, 왜곡 및 자르기 지표에서 최고 수준의 접근 방식을 능가하여, 더 나은 시각적 콘텐츠 유지와 해상도 보존을 나타낸다.
- 훈련 데이터의 운동 프로파일과 유사한 영상(예: Crowd, Parallax, Quick Rotation)에서는 안정성 지표에서 경쟁력 있는 성능을 보였으며, 다른 카테고리에서는 데이터셋 편향으로 인해 다소 성능이 떨어졌다.
- 시각적 비교 결과, Adobe Premiere 2018 CC, Robust L1, DIFRINT, 반복 CAIN과 비교해 제안된 방법이 척도와 콘텐츠 유지 능력에서 뛰어나며, 더 적은 잡음과 더 높은 해상도를 보였다.
- 사용자 연구 및 보조 결과는 제안된 방법이 더 시각적으로 일관되고 자연스러운 안정화 영상을 생성함을 확인한다.
- 제거 실험 결과, 대비 운동 손실과 과정 학습 전략이 출력의 시간적 일관성을 크게 향상시키고 플리커 및 진동을 감소시킨다는 것이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.