Skip to main content
QUICK REVIEW

[論文レビュー] Transposer: Universal Texture Synthesis Using Feature Maps as Transposed Convolution Filter

Guilin Liu, Rohan Taori|arXiv (Cornell University)|Jul 14, 2020
Generative Adversarial Networks and Image Synthesis参考文献 48被引用数 6
ひとこと要約

この論文では、テクスチャの符号化特徴マップを転置畳み込みフィルタとして、その自己類似性マップを入力として使用する、普遍的なテクスチャ合成手法であるTransposerを提案する。転置畳み込みを用いてグローバルで構造に配慮した合成を実現することで、再トレーニングを必要とせず、未学習のテクスチャに対しても1回の順伝搬で最先端の結果を達成し、再トレーニングなしに高速で多様性がありスケーラブルな生成を可能にする。

ABSTRACT

Conventional CNNs for texture synthesis consist of a sequence of (de)-convolution and up/down-sampling layers, where each layer operates locally and lacks the ability to capture the long-term structural dependency required by texture synthesis. Thus, they often simply enlarge the input texture, rather than perform reasonable synthesis. As a compromise, many recent methods sacrifice generalizability by training and testing on the same single (or fixed set of) texture image(s), resulting in huge re-training time costs for unseen images. In this work, based on the discovery that the assembling/stitching operation in traditional texture synthesis is analogous to a transposed convolution operation, we propose a novel way of using transposed convolution operation. Specifically, we directly treat the whole encoded feature map of the input texture as transposed convolution filters and the features' self-similarity map, which captures the auto-correlation information, as input to the transposed convolution. Such a design allows our framework, once trained, to be generalizable to perform synthesis of unseen textures with a single forward pass in nearly real-time. Our method achieves state-of-the-art texture synthesis quality based on various metrics. While self-similarity helps preserve the input textures' regular structural patterns, our framework can also take random noise maps for irregular input textures instead of self-similarity maps as transposed convolution inputs. It allows to get more diverse results as well as generate arbitrarily large texture outputs by directly sampling large noise maps in a single pass as well.

研究の動機と目的

  • 既存のディープラーニングベースのテクスチャ合成手法に見られる一般化性の欠如に起因する、各新しいテクスチャに対して再トレーニングを要する問題を解決すること。
  • 従来のCNNにおける局所的演算の制限を克服し、テクスチャ合成に不可欠な長距離の構造的依存関係を捉えること。
  • 再トレーニングなしに、任意の未学習テクスチャに対して高速で1回の順伝搬による推論を可能にし、リアルタイム性能を達成すること。
  • 自己類似性マップを用いた構造的忠実度とランダムノイズマップを用いた出力の多様性の間のトレードオフを調査すること。
  • 規則的・不規則な両方のテクスチャに一般化できる統一されたフレームワークを提供し、任意の出力サイズをサポートすること。

提案手法

  • 入力テクスチャの符号化特徴マップを転置畳み込みフィルタとして使用し、学習可能なフィルタの代わりに固定でコンテンツに特化したフィルタを採用する。
  • 符号化された特徴から自己類似性マップを計算し、テクスチャ全体における自己相関性と空間的関係を捉える。
  • 自己類似性マップを転置畳み込みの入力として用いることで、グローバルで構造に配慮した特徴伝搬を実現する。
  • 多様な出力を得るため、自己類似性マップの代わりにランダムノイズマップを入力として使用し、確率的生成を可能にする。
  • 1回の順方向伝搬で大きなノイズマップを直接サンプリングすることで、任意の出力サイズをサポートする。
  • 複数スケールの特徴空間で動作させることで、マルチスケールのテクスチャアセンブリを可能にする。

実験結果

リサーチクエスチョン

  • RQ1ディープラーニングベースのテクスチャ合成手法は、再トレーニングなしに未学習のテクスチャに一般化可能か?
  • RQ2特徴マップをフィルタとして用いることで、転置畳み込みをグローバルで構造に配慮したテクスチャ合成に再利用可能か?
  • RQ3自己類似性マップを入力として使用する場合とランダムノイズマップを入力として使用する場合とを比較した場合、構造的忠実度と出力の多様性の観点でどのように異なるか?
  • RQ41回の順方向伝搬で任意に大きなテクスチャ出力を生成可能か?
  • RQ5本手法は、スパarsな構造や非常に非定常的なテクスチャを処理する際にどのような制限を有するか?

主な発見

  • Transposerは、標準的および独自に設計されたメトリクスを含む複数のメトリクスで、最先端のテクスチャ合成品質を達成している。
  • 1回の順方向伝搬で入力サイズの4倍まで大きなテクスチャを数10〜数100ミリ秒で合成可能であり、最適化ベースの手法と比較して顕著に高速である。
  • 自己類似性マップを使用することで規則的な構造的パターンが保持される一方、ランダムノイズマップを使用することで多様な結果が得られ、任意の大きさの出力生成が可能になる。
  • アブレーションスタディの結果、学習可能なフィルタを有する従来の転置畳み込み層は一般化に失敗し、単に入力を拡大するにとどまることを確認した。これに対して、Transposerは構造に配慮した合成を実現している。
  • pix2pixHD、WCT、SinGAN、DeepTextureといった既存手法と比較して、速度および品質の両面で優れている。推論時間は桁違いに速い。
  • スパarsな構造や細い構造を含むテクスチャでは失敗ケースが発生し、方向性や非定常パターンの捉え込みに限界があることが示唆され、今後の改善の余地がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。