Skip to main content
QUICK REVIEW

[論文レビュー] Arbitrary Video Style Transfer via Multi-Channel Correlation

Yingying Deng, Fan Tang|arXiv (Cornell University)|Sep 17, 2020
Generative Adversarial Networks and Image Synthesis被引用数 8
ひとこと要約

本稿では、光流を用いず時間的に一貫性のあるスタイル化を実現するため、コンテンツ特徴量とスタイル特徴量の間のマルチチャネル相関を用いるフレームベースの動画スタイル転送手法MCCNetを提案する。入力コンテンツに特徴量をアライメントさせるとともに、照度損失を導入することで、MCCNetは安定的で高品質なスタイル化動画を生成し、鮮やかなテクスチャと内容構造の保持を実現する。定量的指標およびユーザースタディーの両面で、先行手法を上回る性能を発揮する。

ABSTRACT

Video style transfer is getting more attention in AI community for its numerous applications such as augmented reality and animation productions. Compared with traditional image style transfer, performing this task on video presents new challenges: how to effectively generate satisfactory stylized results for any specified style, and maintain temporal coherence across frames at the same time. Towards this end, we propose Multi-Channel Correction network (MCCNet), which can be trained to fuse the exemplar style features and input content features for efficient style transfer while naturally maintaining the coherence of input videos. Specifically, MCCNet works directly on the feature space of style and content domain where it learns to rearrange and fuse style features based on their similarity with content features. The outputs generated by MCC are features containing the desired style patterns which can further be decoded into images with vivid style textures. Moreover, MCCNet is also designed to explicitly align the features to input which ensures the output maintains the content structures as well as the temporal continuity. To further improve the performance of MCCNet under complex light conditions, we also introduce the illumination loss during training. Qualitative and quantitative evaluations demonstrate that MCCNet performs well in both arbitrary video and image style transfer tasks.

研究の動機と目的

  • フレーム間の時間的不一致によって引き起こされるちらつきや不安定性を解消すること。
  • 光流に依存せず、任意のコンテンツ動画とスタイル画像に対してスタイル転送を可能にすること。
  • 時間的整合性を確保しつつ、コンテンツ構造を強固に保持し、鮮やかなスタイルパターンをフレーム間で維持すること。
  • 照度変動に強い性能を実現するため、新規の照度損失を導入すること。
  • 光流ベースやエンドツーエンドの動画モデルの複雑さを回避する、軽量なフレームベースのアプローチを開発すること。

提案手法

  • MCCNetは、コンテンツ画像およびスタイル画像の特徴マップに直接作用し、コンテンツ構造にスタイル特徴量をアライメントするためのマルチチャネル相関を計算する。
  • ネットワークは、コンテンツ特徴量との類似度に基づいてスタイル特徴量を再配置・融合し、コンテンツレイアウトを保持するスタイル化特徴量を生成する。
  • 小さなコンテンツ変化が出力にちらつきを引き起こさないよう、特徴量アライメントを明示的に強制することで、時間的整合性を確保する。
  • 訓練中にコンテンツ特徴量にランダムなガウスノイズを追加することで、照度変動をシミュレートし、耐障害性を向上させる照度損失を導入する。
  • デコーダーは十分な深さを持つように設計されており、豊かなスタイル化パターンを生成しながらも、時間的整合性を維持する。
  • 光流やマスク推定を必要とせず、知覚的損失および再構成損失を用いてエンドツーエンドで訓練される。

実験結果

リサーチクエスチョン

  • RQ1コンテンツ特徴量とスタイル特徴量の間のマルチチャネル相関は、光流を用いずとも動画スタイル転送における時間的整合性を向上させ得るか?
  • RQ2入力コンテンツに特徴量をアライメントさせることで、スタイル化動画シーケンスにおけるちらつきと安定性にどのような影響を与えるか?
  • RQ3照度損失は、動画スタイル転送において照明条件の変化に伴う耐障害性をどの程度向上させるか?
  • RQ4フレームベースのアプローチは、光流ベースやエンドツーエンドの動画モデルと同等のスタイル化品質および整合性を達成可能か?
  • RQ5デコーダーの深さは、スタイル化パターンの豊かさと時間的整合性にどのように影響を与えるか?

主な発見

  • MCCNetは、スタイル化動画の隣接フレーム間で最小の平均差(0.0189)と分散(0.0007)を達成し、時間的整合性においてSOTA手法を上回る。
  • アブレーションスタディにより、マルチチャネル相関が不可欠であることが確認された—これなしでは、重要なスタイルパターンが消失し、元の色分布が残存する。
  • 照度損失を削除すると、フレーム間の平均差は0.0317に上昇し、照明変動への耐障害性においてその重要性が明確に示された。
  • デコーダーを深く(relu4-1まで)することで、髪の毛や円形要素などの複雑なテクスチャにおいて、浅いもの(relu3-1まで)よりも鮮やかなスタイル化パターンが生成された。
  • 50名の参加者と700票のユーザースタディーにおいて、MCCNetはSOTA手法よりもスタイル化品質および動画安定性の両面で好まれた。
  • 本手法は、Sintelの動画シーケンスや多様な画像スタイルを含む、多様なスタイルとコンテンツドメインにおいても高い性能を維持し、フレーム間で一貫した結果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。