Skip to main content
QUICK REVIEW

[論文レビュー] Geometric Style Transfer

Xiao-Chang Liu, Xuanyi Li|arXiv (Cornell University)|Jul 10, 2020
Generative Adversarial Networks and Image Synthesis参考文献 58被引用数 7
ひとこと要約

本稿では、コンテンツ画像、テクスチャスタイル画像、および別個の幾何スタイル画像を用いて、テクスチャと幾何スタイル(物体の形状、ポーズ、空間的構成など)を同時に転送する、幾何スタイル転送(GST)と呼ばれる新しいニューラルアーキテクチャを提案する。本手法は、テクスチャ転送の前にコンテンツ画像をスタイル画像の幾何構造にあわせるワープ処理を施すことにより、従来のテクスチャ中心の手法と比較して、より現実的で知覚的に正確なスタイル化出力を実現する。

ABSTRACT

Neural style transfer (NST), where an input image is rendered in the style of another image, has been a topic of considerable progress in recent years. Research over that time has been dominated by transferring aspects of color and texture, yet these factors are only one component of style. Other factors of style include composition, the projection system used, and the way in which artists warp and bend objects. Our contribution is to introduce a neural architecture that supports transfer of geometric style. Unlike recent work in this area, we are unique in being general in that we are not restricted by semantic content. This new architecture runs prior to a network that transfers texture style, enabling us to transfer texture to a warped image. This form of network supports a second novelty: we extend the NST input paradigm. Users can input content/style pair as is common, or they can chose to input a content/texture-style/geometry-style triple. This three image input paradigm divides style into two parts and so provides significantly greater versatility to the output we can produce. We provide user studies that show the quality of our output, and quantify the importance of geometric style transfer to style recognition by humans.

研究の動機と目的

  • 従来のニューラルスタイル転送(NST)手法がテクスチャと色にのみ焦点を当てているという限界を是正するため、芸術的構図や形状変形をよりよく捉えるために幾何スタイル転送(GST)を組み込むこと。
  • 意味的事前知識やコンテンツ固有のモデルを必要としない汎用的なGSTフレームワークを開発し、多様な画像コンテンツに広く適用可能にする。
  • 標準的なNSTパラダイムを2画像入力(コンテンツ、スタイル)から3画像入力(コンテンツ、幾何スタイル、テクスチャスタイル)に拡張することで、スタイル化における制御性と表現力の向上を図ること。
  • 人間による評価を通じて、幾何スタイル転送がターゲット芸術的スタイルとの知覚的類似性を向上させることを実証的に検証すること。

提案手法

  • 本手法は、NSTパイプラインに並列処理パスを導入し、別個の幾何スタイル画像から幾何ワープ関数を計算する。この関数はテクスチャ転送の前にコンテンツ画像に適用される。
  • 幾何ワープは、コンテンツ画像と幾何スタイル画像間の高レベル特徴を一致させる深層ニューラルネットワークによって学習され、連続的かつグローバルな画像変形を可能にする。
  • マルチスケール特徴一致を用いることで、ワープ中の幾何的整合性を保ち、画像品質の劣化を抑える。
  • テクスチャ転送は、変形済みコンテンツ画像に対して標準的なNSTアーキテクチャ(例:Gatysら)を用い、高精度なテクスチャ合成を実現する。
  • 3画像入力パラダイムにより、幾何スタイルとテクスチャスタイルを独立して指定可能となり、より洗練された表現力のあるスタイル化が可能になる。
  • フレームワークはエンドツーエンド微分可能であり、バックプロパゲーションによる幾何的・テクスチャ的転送の共同最適化が可能である。

実験結果

リサーチクエスチョン

  • RQ1幾何スタイル転送を導入することで、テクスチャ中心の転送と比較して、スタイル化画像の知覚的類似性が顕著に向上するか?
  • RQ2幾何スタイル転送の導入が、人間によるスタイル化画像の品質およびスタイル正確性の知覚に与える影響は何か?
  • RQ3意味的事前知識やコンテンツ固有のモデルを必要としない汎用的GST手法が、多様なコンテンツカテゴリにどの程度適用可能か?
  • RQ43画像入力パラダイム(コンテンツ、幾何スタイル、テクスチャスタイル)は、従来の2画像NSTと比較して、より表現力があり制御可能なスタイル化を実現できるか?
  • RQ5グローバルワープでは、立体的スタイル(例:キュビズム、多点透視法)のような複雑な芸術的スタイルをどの程度正確に捉えることができるか?

主な発見

  • ユーザースタディーの結果、本手法の出力は、テクスチャ中心の転送結果と比較して一貫して好まれており、知覚的品質およびスタイル正確性の向上が示された。
  • 人間評価および知覚的メトリクスによる測定で、本手法はベースラインNST手法と比較して、ターゲットスタイル画像との類似性が顕著に高いことが確認された。
  • 幾何スタイル転送の追加により、エル・グレコの伸びた人物像やビザンティン逆透視法など、意図的な形状変形を含むスタイルにおいて、より自然で芸術的に整合性のある結果が得られた。
  • 3画像入力パラダイムにより、スタイリングの制御性が向上しており、図12で示されるように、異なる幾何スタイルおよびテクスチャスタイル画像が、意図した異なる出力を生成している。
  • 主な限界として、局所的な幾何的変化(例:顔の特徴、ポーズの変化)の処理が不十分であり、破片的または局所的マッピング(例:キュビズム)に対しても、グローバルワープではうまくモデル化できないことが判明した。
  • コンテンツ画像と幾何スタイル画像の間に意味的類似性がない場合、特徴一致が失敗し、性能が低下する。これは、本手法の主要な制約を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。