Skip to main content
QUICK REVIEW

[論文レビュー] ReCoNet: Real-time Coherent Video Style Transfer Network

Chang Gao, Derun Gu|arXiv (Cornell University)|Jul 3, 2018
Generative Adversarial Networks and Image Synthesis参考文献 25被引用数 10
ひとこと要約

ReCoNet は、出力レベルの時間的損失における輝度ワープ制約と特徴マップレベルの時間的損失を導入することで、高い時間的整合性と知覚的スタイル品質を達成するリアルタイムでフォワードプロパゲーション型の動画スタイル転送ネットワークです。1枚のGPUで200 FPSを超える速度でスタイル化された動画生成が可能であり、動きのある物体や照明変化におけるフレイクイングや色の不一致を顕著に低減します。

ABSTRACT

Image style transfer models based on convolutional neural networks usually suffer from high temporal inconsistency when applied to videos. Some video style transfer models have been proposed to improve temporal consistency, yet they fail to guarantee fast processing speed, nice perceptual style quality and high temporal consistency at the same time. In this paper, we propose a novel real-time video style transfer model, ReCoNet, which can generate temporally coherent style transfer videos while maintaining favorable perceptual styles. A novel luminance warping constraint is added to the temporal loss at the output level to capture luminance changes between consecutive frames and increase stylization stability under illumination effects. We also propose a novel feature-map-level temporal loss to further enhance temporal consistency on traceable objects. Experimental results indicate that our model exhibits outstanding performance both qualitatively and quantitatively.

研究の動機と目的

  • 動画スタイル転送における高い時間的不整合、特に動きのある物体や照明変化におけるフレイクイングや色の不安定性を解消すること。
  • 24 FPSを超えるリアルタイム処理速度を実現しながら、知覚的スタイル品質や時間的整合性を損なわないこと。
  • フレーム間の輝度変化をモデル化することで、動的照明条件下でもスタイリングの安定性を向上させること。
  • 同一オブジェクトの高次特徴マップにおける特徴変化をペナルティ化することで、フレーム間の追跡可能なオブジェクトの一貫性を向上させること。

提案手法

  • 連続するフレーム間の輝度変化をモデル化するため、出力レベルの時間的損失に輝度ワープ制約を導入し、照明効果下でも安定性を向上させます。
  • 同じオブジェクトの連続するフレーム間での特徴変化をペナルティ化するため、特徴マップレベルの時間的損失を適用し、高次表現における一貫性を強化します。
  • コンテンツとスタイルの保持のため、VGGベースの知覚的損失を用いたフォワードプロパゲーション型エンコーダ・デコーダアーキテクチャを採用します。
  • 時間的損失において、オプティカルフローとオクルージョンマスクをガイドとして用い、スタイル化されたフレームが入力の動きと整合するようにします。
  • 出力レベルと特徴マップレベルの両方の制約を組み合わせたマルチレベル時間的損失を採用し、視覚的整合性と知覚的品質の共同最適化を実現します。
  • 軽量でエンドツーエンドのネットワークを設計し、最新のGPUで200 FPSを超える推論速度を達成します。

実験結果

リサーチクエスチョン

  • RQ1フォワードプロパゲーション型ネットワークは、高い知覚的スタイル品質と時間的整合性を維持したまま、リアルタイムでの動画スタイル転送を達成できるか?
  • RQ2連続するフレーム間の輝度変化をどのようにモデル化することで、照明変動下でのスタイリング安定性が向上するか?
  • RQ3高次特徴マップにおける特徴の一貫性を強制することで、追跡可能なオブジェクトの時間的不整合はどの程度低減されるか?
  • RQ4出力レベルと特徴マップレベルの時間的損失の相対的寄与度は、全体の時間的整合性にどのように寄与するか?

主な発見

  • ReCoNet は、1枚の最新のGPUで200 FPSを超える推論速度を達成し、これはリアルタイム基準を著しく上回ります。
  • 出力レベルの時間的損失に輝度ワープ制約を導入したことで、輝度モデル化を行わないベースライン手法と比較して、平均で10.4%の時間的誤差低減が達成されました。
  • 特徴マップレベルの時間的損失を適用したことで、出力レベルの時間的損失のみを用いたモデルと比較して、平均で12.5%の時間的誤差低減が達成されました。
  • 両方の時間的損失(出力レベルおよび特徴マップレベル)を併用することで、MPI Sintel データセットで平均時間的誤差が最も低く、0.0804にまで低下しました。
  • ユーザースタディーの結果、ReCoNet は、特に照明変化や動きのあるシーンにおいて、先行手法よりもより知覚的に安定した、視覚的に整合性のあるスタイル化動画を生成することが確認されました。
  • 定性的な結果から、ReCoNet は、動きのある物体の囲まれた領域におけるフレイクイングや色の不一致を効果的に抑制しており、Chen et al. [4] などのベースライン手法を上回る視覚的安定性を示しました。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。