Skip to main content
QUICK REVIEW

[論文レビュー] PixelNN: Example-based Image Synthesis

Aayush Bansal, Yaser Sheikh|arXiv (Cornell University)|Aug 17, 2017
Generative Adversarial Networks and Image Synthesis参考文献 43被引用数 6
ひとこと要約

PixelNNは、畳み込みニューラルネットワーク(CNN)ベースの回帰器とピクセル単位の最近傍探索を組み合わせることで、不完全な入力(低解像度画像、エッジ、法線マップなど)から多様で高周波数の、写真と見紛うような画像を生成する2段階の画像合成手法を提案する。深層特徴記述子を用いた局所的なピクセルマッチングにより、GANにおけるモード崩壊を克服し、複数の妥当な出力が得られる制御可能で解釈可能な合成を実現する。

ABSTRACT

We present a simple nearest-neighbor (NN) approach that synthesizes high-frequency photorealistic images from an "incomplete" signal such as a low-resolution image, a surface normal map, or edges. Current state-of-the-art deep generative models designed for such conditional image synthesis lack two important things: (1) they are unable to generate a large set of diverse outputs, due to the mode collapse problem. (2) they are not interpretable, making it difficult to control the synthesized output. We demonstrate that NN approaches potentially address such limitations, but suffer in accuracy on small datasets. We design a simple pipeline that combines the best of both worlds: the first stage uses a convolutional neural network (CNN) to maps the input to a (overly-smoothed) image, and the second stage uses a pixel-wise nearest neighbor method to map the smoothed output to multiple high-quality, high-frequency outputs in a controllable manner. We demonstrate our approach for various input modalities, and for various domains ranging from human faces to cats-and-dogs to shoes and handbags.

研究の動機と目的

  • 生成出力の多様性が制限される条件付きGANにおけるモード崩壊問題に対処すること。
  • 即時のトレーニングセットの絞り込みにより、合成プロセスの解釈可能性を高め、ユーザーによる制御を可能にすること。
  • 非パラメトリックな最近傍探索を用いることで、深層生成モデルにおける解釈可能性の欠如を克服すること。
  • グローバルな画像マッチングではなく、局所的なピクセル構成を用いることで、小規模データセットにおける一般化性能を向上させること。
  • エッジ、低解像度画像、法線マップなどの不完全な信号から、高周波数で写真と見紛うような出力を生成すること。

提案手法

  • 入力が不完全な場合(例:低解像度画像やエッジマップ)に、1つの滑らかな出力をCNNで回帰する。
  • 多スケールの記述子を用いて、CNNの出力から深層特徴を抽出し、局所的な文脈を捉え、ピクセル単位のマッチングを可能にする。
  • 深層特徴記述子を用いて、トレーニングセット内でピクセル単位の最近傍探索を実行し、最も類似したパッチを特定する。
  • 最近傍のトレーニング例から対応するピクセルをコピー&ペーストすることで、最終的な高周波数出力を合成する。
  • ユーザーが指定した基準(例:特定のネコの種類)に一致する例のみを含むトレーニングセットにフィルタリングすることで、制御可能な合成を可能にする。
  • トレーニング画像と合成出力の間で、密なピクセルレベルの対応関係を活用し、ラベル転送や解析への応用を可能にする。

実験結果

リサーチクエスチョン

  • RQ1非パラメトリックな最近傍探索アプローチは、モード崩壊を起こさずに、不完全な入力から多様で高周波数で写真と見紛うような画像を生成できるか?
  • RQ2深層特徴を用いたピクセル単位の構成は、グローバルな画像マッチングと比較して、一般化性能と表現力の向上に寄与するか?
  • RQ3エンドツーエンドの深層生成モデルと比較して、最近傍探索は画像合成における解釈可能性とユーザー制御性をどの程度向上させるか?
  • RQ4エッジ推定と法線推定の忠実度という観点から、最近傍ベースの合成は、最先端のGANベース手法と定量的に比較してどの程度の性能を示すか?
  • RQ5本手法が生成する密なピクセルレベルの対応関係は、セマンティックラベル転送などの後続タスクを支援できるか?

主な発見

  • PixelNNは1つの入力に対して複数の多様で高品質な出力を生成でき、72回のランダム選択からオラクル選択に至るまでの性能向上が明確に示され、GANベースのベースラインを大きく上回る多様性を実現した。
  • 表面法線推定に関する定量的評価では、PixelNNは平均角誤差12.3°、中央値9.1°を達成し、30°以内の誤差を示すピクセルの割合が87.5%にのぼり、ベースラインのPix-to-Pixモデルを上回った。
  • エッジ検出に関しては、PixelNNは平均精度(AP)0.89を達成し、実画像の性能と同等であり、ベースラインモデルを著しく上回った。
  • 本手法は制御可能な合成を実現している:ユーザーはトレーニングセットを特定の基準(例:特定のネコの種類)でフィルタリングすることで、出力を特定のスタイルに誘導できる。これは直感的なユーザー制御を示している。
  • 適切な最近傍が存在しない場合に失敗ケースが発生するため、効率的な検索最適化の必要性が浮き彫りになった。これはScannerのようなシステムで解決可能である。
  • 本手法は自然にトレーニング画像と合成出力の間で密なピクセルレベルの対応関係を生成でき、ラベル転送や画像解析への応用が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。