Skip to main content
QUICK REVIEW

[論文レビュー] Bi-level Feature Alignment for Versatile Image Translation and Manipulation

Fangneng Zhan, Yingchen Yu|arXiv (Cornell University)|Jul 7, 2021
Generative Adversarial Networks and Image Synthesis参考文献 92被引用数 5
ひとこと要約

本稿では、高精細でスタイルに忠実な画像生成を実現するため、計算コストを低減するために微分可能top-k順序付けと密なアテンションを組み合わせた、新しい二段階特徴整合フレームワークRABITを提案する。特徴の構造的保存のための意味的位置符号化と、意味的不一致に対応するための信頼度特徴統合モジュールを導入し、定量的指標およびユーザースタディーの両面でSOTA手法を上回る性能を達成した。

ABSTRACT

Generative adversarial networks (GANs) have achieved great success in image translation and manipulation. However, high-fidelity image generation with faithful style control remains a grand challenge in computer vision. This paper presents a versatile image translation and manipulation framework that achieves accurate semantic and style guidance in image generation by explicitly building a correspondence. To handle the quadratic complexity incurred by building the dense correspondences, we introduce a bi-level feature alignment strategy that adopts a top-$k$ operation to rank block-wise features followed by dense attention between block features which reduces memory cost substantially. As the top-$k$ operation involves index swapping which precludes the gradient propagation, we approximate the non-differentiable top-$k$ operation with a regularized earth mover's problem so that its gradient can be effectively back-propagated. In addition, we design a novel semantic position encoding mechanism that builds up coordinate for each individual semantic region to preserve texture structures while building correspondences. Further, we design a novel confidence feature injection module which mitigates mismatch problem by fusing features adaptively according to the reliability of built correspondences. Extensive experiments show that our method achieves superior performance qualitatively and quantitatively as compared with the state-of-the-art.

研究の動機と目的

  • 画像翻訳および編集における高精細な画像生成と、忠実なスタイル制御の課題に対処すること。
  • 条件付き入力と例示画像間の密な特徴対応構築に伴う2次関数的メモリコストを低減すること。
  • 意味的類似性を超えた空間的整合性を組み込むことで、例示画像のワープ時にテクスチャ構造を保存すること。
  • 条件付き入力と例示画像間の意味的不一致に起因する誤りを、適応的特徴統合により軽減すること。
  • 一貫性のある意味的整合性と忠実なスタイルを備えた、多様で高解像度の画像翻訳および編集を可能にすること。

提案手法

  • 関連する特徴ブロックを選択するtop-k順序付け操作を用いた二段階特徴整合戦略を提案し、それらの間で密なアテンションを適用することで、メモリコストをO(L²)からO(N² + b²)に低減する。
  • 勾配逆伝播を可能にするために、非微分可能なtop-k操作の正則化された地球移動者問題を用いた微分可能近似を導入する。
  • 特徴整合中にテクスチャパターンを保存できるように、領域固有の座標を割り当てる意味的位置符号化(SPE)機構を設計する。
  • 構築された対応の信頼性に基づいて、条件付き入力と変形された例示画像からの特徴を適応的に統合する、信頼度特徴統合(CONFI)モジュールを開発する。
  • 条件付き入力と例示画像間で高解像度かつ効率的な特徴マッチングを実現する、順序付けとアテンションのスキーム(RAS)を採用する。
  • 写真的リアリズムと高精細な生成を保証するため、GANベースの生成器に adversarial および perceptual 損失を適用する。

実験結果

リサーチクエスチョン

  • RQ1条件付き入力と例示画像間の密な特徴対応を、2次関数的メモリコストを負担せずに効率的に構築するにはどうすればよいか?
  • RQ2特徴マッチングにおけるtop-k操作を微分可能にするにはどうすればよいか?
  • RQ3意味的類似性のみに依存する場合、例示画像のワープ時に細粒度のテクスチャ構造をどのように保存できるか?
  • RQ4条件付き入力と例示画像間の意味的不一致をどのように処理し、誤ったスタイル転送を防げるか?
  • RQ5提案手法は、SOTA手法と比較して、視覚的品質およびスタイルの一貫性をどの程度向上させるか?

主な発見

  • ADE20Kデータセットにおいて、RABITはFID 26.61を達成し、すべてのSOTA手法を上回った。
  • CelebA-HQデータセットでは、RABITはFID 60.87およびIS 21.07を達成し、MaskGAN(FID: 80.89、IS: 23.86)を顕著に上回った。
  • Amazon Mechanical Turkを用いたユーザースタディーにおいて、複数のデータセットでRABITは画像品質およびスタイルの一貫性の両面で最高の平均スコアを獲得した。
  • ADE20Kでは、RABITがIS 0.823を達成し、次に良い手法(0.744)を大きく上回った。
  • 定性的な結果から、RABITはSOTA手法と比較して、よりシャープなテクスチャ、より良い意味的整合性、より忠実なスタイル転送を実現していることが示された。
  • アブレーションスタディーにより、SPE、CONFI、および微分可能top-kの各モジュールが性能向上に顕著な寄与をしていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。