Skip to main content
QUICK REVIEW

[論文レビュー] Frame-Recurrent Video Inpainting by Robust Optical Flow Inference

Yifan Ding, Chuan Wang|arXiv (Cornell University)|May 8, 2019
Advanced Vision and Imaging参考文献 34被引用数 14
ひとこと要約

本稿では、高品質で時間的に一貫性のある動画修復を実現するため、ConvLSTMと頑健なオプティカルフロー生成モジュールを組み合わせたフレーム再帰型動画インpaintingフレームワークを提案する。入力された破損したフレームと補間されたフレームからのオプティカルフローを学習可能なブレンドネットワークで統合することで、正確な動きモデリングと任意の長さ・解像度の動画に対するリアルタイム処理を可能にし、品質および効率の両面で最先端の手法を上回る性能を発揮する。

ABSTRACT

In this paper, we present a new inpainting framework for recovering missing regions of video frames. Compared with image inpainting, performing this task on video presents new challenges such as how to preserving temporal consistency and spatial details, as well as how to handle arbitrary input video size and length fast and efficiently. Towards this end, we propose a novel deep learning architecture which incorporates ConvLSTM and optical flow for modeling the spatial-temporal consistency in videos. It also saves much computational resource such that our method can handle videos with larger frame size and arbitrary length streamingly in real-time. Furthermore, to generate an accurate optical flow from corrupted frames, we propose a robust flow generation module, where two sources of flows are fed and a flow blending network is trained to fuse them. We conduct extensive experiments to evaluate our method in various scenarios and different datasets, both qualitatively and quantitatively. The experimental results demonstrate the superior of our method compared with the state-of-the-art inpainting approaches.

研究の動機と目的

  • 動画インpaintingにおける時間的一致性と空間的詳細の維持、特に任意の長さ・フレームサイズの動画に対して課題となる点を解決すること。
  • 3D CNNが大規模な動きを処理する際の限界と高い計算コストを克服すること。
  • 欠損領域(ホール)を含むフレームに対しても効果的に機能する頑健なオプティカルフロー推定手法の開発。
  • 固定サイズや長さ制約のないリアルタイムのストリーミング動画インpaintingを可能にすること。
  • 画像インpaintingによる空間的モデリングとConvLSTMによる時間的モデリングを統合し、優れた再構成品質を達成すること。

提案手法

  • 時間的依存性をモデル化するために、動きの一貫性を保つためにオプティカルフローを中間表現として用いるConvLSTMベースのアーキテクチャを採用する。
  • 2つのフロー源(補間済みフレームからのものと元の破損フレームからのもの)を、学習可能なブレンドネットワークを用いて統合する、頑健なオプティカルフロー生成モジュールを導入する。
  • ブレンドネットワークは、フローを適応的に組み合わせることで、ホール領域における誤差を低減し、動き推定の正確性を向上させる。
  • 空間ネットワーク(例:PartialConv)を用いてフレーム単位で画像インpaintingを実行し、時間的精緻化の前にフレーム内容を初期化する。
  • 空間的・時間的一致性をバランスさせるための共同損失関数を採用し、ちらつきを低減し、視覚的品質を向上させる。
  • フレームワークはストリーミング形式で処理可能であり、任意の長さ・高解像度の動画に対してリアルタイム推論を実現する。

実験結果

リサーチクエスチョン

  • RQ13D CNNを用いないフレーム再帰型アーキテクチャ(ConvLSTMを用いる)は、長距離の時間的依存性を効果的にモデル化できるか?
  • RQ2欠損領域を含むフレームにおいて、正確なオプティカルフローをどのように推定し、時間的再構成を支援できるか?
  • RQ3学習可能なフロー統合メカニズムは、単一のフロー源を使用する場合と比較して、動き推定のロバスト性を向上させられるか?
  • RQ4提案手法は、多様なマスクとデータセットにおいて、視覚的品質と時間的一致性の両面で優れた性能を達成できるか?
  • RQ5従来の3D-CNNベースの手法とは異なり、本フレームワークは任意長・高解像度の動画をリアルタイムで処理できるか?

主な発見

  • 提案手法は、固定長矩形、ランダム矩形、ランダムウォーカーマスクのすべてのマスクタイプにおいて、FaceForensicsおよびDAVIS+VIDEVOデータセットで最先端の性能を達成した。
  • アブレーションスタディの結果、ConvLSTMモジュールがフレーム単位のインpaintingと比較してちらつきアーチファクトを顕著に低減し、時間的一致性を著しく向上させた。
  • フロー統合ネットワークによりオプティカルフローの誤差が低減され、特に大規模な動きに対してより正確な動きモデリングと優れた再構成が可能になった。
  • PartialConvのみ、またはConvLSTMのみのベースラインと比較して、本手法は空間的および時間的モデリングの相補的利点を示した。
  • 定量的評価では、先行手法と比較してL1損失が低く抑えられ、FID/SSIMスコアが高く、すべての評価設定で一貫した向上が得られた。
  • フレームワークは、任意長・高解像度の動画に対してリアルタイムでストリーミング推論を可能にし、従来の3D-CNNベースの手法の主な制限を克服した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。