Skip to main content
QUICK REVIEW

[論文レビュー] CoCosNet v2: Full-Resolution Correspondence Learning for Image Translation

Xingran Zhou, Bo Zhang|arXiv (Cornell University)|Dec 3, 2020
Generative Adversarial Networks and Image Synthesis参考文献 57被引用数 5
ひとこと要約

CoCosNet v2 は、画像変換におけるフル解像度のクロスドメイン対応学習を実現する階層的で微分可能かつ GRU 拡張型 PatchMatch フレームワークを提案する。エンドツーエンドの教師なし学習により、局所的エキジンプレの詳細を活用することで、512×512 および 1024×1024 解像度で高精細で写真のような結果を達成する。

ABSTRACT

We present the full-resolution correspondence learning for cross-domain images, which aids image translation. We adopt a hierarchical strategy that uses the correspondence from coarse level to guide the fine levels. At each hierarchy, the correspondence can be efficiently computed via PatchMatch that iteratively leverages the matchings from the neighborhood. Within each PatchMatch iteration, the ConvGRU module is employed to refine the current correspondence considering not only the matchings of larger context but also the historic estimates. The proposed CoCosNet v2, a GRU-assisted PatchMatch approach, is fully differentiable and highly efficient. When jointly trained with image translation, full-resolution semantic correspondence can be established in an unsupervised manner, which in turn facilitates the exemplar-based image translation. Experiments on diverse translation tasks show that CoCosNet v2 performs considerably better than state-of-the-art literature on producing high-resolution images.

研究の動機と目的

  • 高解像度画像変換における微細なテクスチャの保持を目的とし、ソース画像とエキジンプレ画像間のフル解像度の意味的対応を学習すること。
  • 深層ネットワークへの直接的な PatchMatch の適用における非効率性と不安定性を克服するため、GRU を用いた精錬を組み込んだ階層的戦略を導入すること。
  • 教師あり対応情報が不要な状態で、エンドツーエンドの教師なし学習により対応と変換ネットワークを同時に最適化できるようにすること。
  • 対応推定時により大きなコンテキストを介した勾配伝搬を可能にすることで、特徴量学習を向上させ、初期学習段階の混沌としたダイナミクスを低減すること。

提案手法

  • 粗いスケール(例:64×64)で対応を初期化し、徐々に細かいスケール(128×128、256×256、512×512)に移行する階層的戦略を採用。粗いマッチング結果を細かいスケールの探索をガイドする。
  • GRU を用いた PatchMatch モジュールを導入。各イテレーション内で隣接するパッチおよび歴史的推定値からの情報を集約することで、文脈認識能力と収束性を向上させる。
  • K=16 個の最近傍点の平均化によるソフトマッチングを用い、微分可能にすることで、対応モジュールを介した逆誤差伝搬を可能にする。
  • 幾何的データ拡張(反転、ランダムクロップ、ピecewise アフィン変換)を適用して仮想エキジンプレを生成し、教師なし学習における一般化性能を向上させる。
  • 学習された対応を翻訳ネットワークに統合。複数スケールでエキジンプレ特徴量をワープし、それらを連結・アダプティブ正規化によりモodulate してスタイル変換を実現する。
  • 対応と画像変換ネットワークを、 adversarial 損失とサイクル整合性損失を用いて、教師なしでエンドツーエンドに同時に最適化する。

実験結果

リサーチクエスチョン

  • RQ1高解像度画像変換の文脈で、エンドツーエンドで微分可能かつ効率的なフル解像度のクロスドメイン対応を学習できるか?
  • RQ2深層ネットワークにおける標準的な PatchMatch と比較して、階層的で GRU 拡張型の PatchMatch 戦略が、対応品質と学習安定性にどのように寄与するか?
  • RQ3フル解像度の対応学習は、512×512 および 1024×1024 解像度におけるエキジンプレベース画像変換において、テクスチャの忠実性と視覚的リアリズムをどの程度向上させるか?
  • RQ4教師あり対応情報が存在しない状況でも、微分可能な PatchMatch を用いた教師なし対応学習が、特徴量のモodulate を効果的にガイドできるか?
  • RQ5GRU で精錬された対応と複数スケールのワープされたエキジンプレ特徴量を統合することで、局所的詳細を保持しつつ、スタイル変換の性能がどのように向上するか?

主な発見

  • CoCosNet v2 はエキジンプレベース画像変換において最先端の性能を達成し、512×512 および 1024×1024 解像度で写真のような結果を生成する。
  • フル解像度の対応により、エキジンプレからの局所的詳細の正確な転送が可能となり、従来手法と比較して顕著に洗練されたテクスチャを実現する。
  • 階層的で GRU 拡張型の PatchMatch 戦略により、局所的近傍および歴史的対応推定値を活用することで、学習の不安定性が低減され、収束性が向上する。
  • 本手法は完全に微分可能かつ教師なしであり、教師あり対応情報が不要な状態で、対応と変換ネットワークを同時に最適化可能である。
  • 1枚あたりの推論時間は約 0.6 秒(512×512 解像度)であり、高解像度であるにもかかわらず実用的な効率性を示している。
  • 定量的指標および定性的な評価において、従来の最先端手法を上回り、特に微細なテクスチャと構造的詳細の保持において顕著な優位性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。