Skip to main content
QUICK REVIEW

[論文レビュー] StableNet: Semi-Online, Multi-Scale Deep Video Stabilization

Chia-Hung Huang, Hang Yin|arXiv (Cornell University)|Jul 24, 2019
Image and Video Stabilization参考文献 26被引用数 9
ひとこと要約

StableNetは、低解像度から高解像度へと段階的にフレームを処理する半オンラインでマルチスケールな深層学習手法を提案する。この手法は、明示的な動き推定を伴わず、アフィン変換を学習することで、ゆらぎのある動画を安定化させる。合成データで学習されているにもかかわらず、ズームやパララックスを含む複雑なシーンに対しても頑健であり、ゆらぎのある動画において最先端の性能を達成している。

ABSTRACT

Video stabilization algorithms are of greater importance nowadays with the prevalence of hand-held devices which unavoidably produce videos with undesirable shaky motions. In this paper we propose a data-driven online video stabilization method along with a paired dataset for deep learning. The network processes each unsteady frame progressively in a multi-scale manner, from low resolution to high resolution, and then outputs an affine transformation to stabilize the frame. Different from conventional methods which require explicit feature tracking or optical flow estimation, the underlying stabilization process is learned implicitly from the training data, and the stabilization process can be done online. Since there are limited public video stabilization datasets available, we synthesized unstable videos with different extent of shake that simulate real-life camera movement. Experiments show that our method is able to outperform other stabilization methods in several unstable samples while remaining comparable in general. Also, our method is tested on complex contents and found robust enough to dampen these samples to some extent even it was not explicitly trained in the contents.

研究の動機と目的

  • 明示的なカメラパス推定やオプティカルフロー計算を回避するエンドツーエンドでオンラインな動画安定化手法の開発。
  • 動画安定化のための大規模でペア化された訓練データの不足を補うために、正確な真値を伴う現実的なゆらぎを付加した合成されたゆらぎのある動画の生成。
  • ズームやパララックスシーンのような複雑な動画コンテンツにおける安定化性能の向上を、データのばらつきとマルチスケールの最適化によって実現。
  • 履歴フレームからの時間的文脈をマルチスケールアーキテクチャで活用することで、リアルタイムでオンライン処理を可能にする。

提案手法

  • ネットワークは、シアンズ型のマルチスケールアーキテクチャを採用し、入力フレームを低・中・高の3つの解像度レベルで処理する。各レベルでは異なる時間サンプリング間隔が使用される。
  • 入力は、各解像度レベルで履歴の安定フレームのスタックと1つの不安定フレームから構成され、短期的および長期的な運動パターンを捉えることができる。
  • モデルは各解像度レベルごとにアフィン変換を出力し、それらを統合して現在の不安定フレームを安定化させる。
  • 半オンライン戦略が導入されており、動画のチャンクをまず別々に安定化させた後、統合することで誤差の拡大を低減し、低周波数の動きの処理を改善している。
  • 実際のゆらぎパターンを適用して生成された約420本のゆらぎのある動画(17万フレーム以上)からなる合成データセット上でエンドツーエンドに学習されている。
  • 損失関数は各スケールで独立して計算され、共有ネットワークを介して逆伝播され、マルチスケール特徴の共同最適化が可能になっている。

実験結果

リサーチクエスチョン

  • RQ1明示的なカメラパス推定やオプティカルフローを伴わないデータ駆動型でエンドツーエンドの深層学習モデルが、競争力のある動画安定化性能を達成できるか。
  • RQ2制御されたゆらぎパターンを有する合成ペアデータセットは、頑健な動画安定化モデルの学習にどの程度有効か。
  • RQ32次元の単純なゆらぎパターンで学習されたモデルが、ズームやパララックスシーンのような複雑な動画コンテンツにどの程度一般化できるか。
  • RQ4完全にオンラインな手法と比較して、半オンラインでマルチスケールなアプローチが、低周波数の動きの処理において安定化性能を向上させられるか。
  • RQ5忠実度と安定性の観点から、定量的にオンラインおよびオフラインのベースライン手法と比較して、モデルの性能はどの程度か。

主な発見

  • StableNetは、挑戦的なゆらぎのある動画サンプルにおいて、他のオンライン安定化手法を上回る忠実度と安定性を達成しており、特定のケースではオフライン手法と同等の結果を示している。
  • 特定のテストクリップにおいて、回転・水平方向・垂直方向の変位エネルギー比の最小値という安定性指標が、最先端のオフライン手法と同等またはそれを上回っている。
  • ズームやパララックス動画においても、[16]と同等の定量的性能を維持しており、このようなコンテンツで明示的に学習していないにもかかわらず、多様な合成データからの一般化能力が強いことが示された。
  • 高ばらつきを持つ合成トレーニングデータのおかげで、ズームやパララックスのような複雑な運動に対してもモデルは頑健である。
  • 高周波数のゆらぎには効果的であるが、低周波数のゆらぎや大規模な動きの安定化には限界があり、より多様なトレーニングパターンの導入による改善の余地がある。
  • 半オンライン戦略は誤差の拡大を効果的に低減し、低周波数の傾きの処理を改善することで、全体の安定化品質を向上させている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。