Skip to main content
QUICK REVIEW

[論文レビュー] Bridging Global Context Interactions for High-Fidelity Image Completion

Chuanxia Zheng, Tat‐Jen Cham|arXiv (Cornell University)|Apr 2, 2021
Generative Adversarial Networks and Image Synthesis参考文献 54被引用数 4
ひとこと要約

本論文では、局所的バイアスを避け、長距離のグローバルコンテキストを明示的にモデル化するため、画像補完をシーケンス・ツー・シーケンスタスクとして扱うトランスフォーマー基盤の画像補完手法TFillを提案する。非重複で小規模な受容 field を持つ制限付きCNNを用いてトークン表現を生成することで、遠く離れた可視領域に対しても均等な注目を確保する。また、注目度に応じた特徴選択を行う注目度-aware レイヤー(AAL)を導入し、外観の一貫性を向上させ、複数のベンチマークで最先端の性能を達成し、FIDとLPIPSスコアが低くなった。

ABSTRACT

Bridging global context interactions correctly is important for high-fidelity image completion with large masks. Previous methods attempting this via deep or large receptive field (RF) convolutions cannot escape from the dominance of nearby interactions, which may be inferior. In this paper, we propose to treat image completion as a directionless sequence-to-sequence prediction task, and deploy a transformer to directly capture long-range dependence in the encoder. Crucially, we employ a restrictive CNN with small and non-overlapping RF for weighted token representation, which allows the transformer to explicitly model the long-range visible context relations with equal importance in all layers, without implicitly confounding neighboring tokens when larger RFs are used. To improve appearance consistency between visible and generated regions, a novel attention-aware layer (AAL) is introduced to better exploit distantly related high-frequency features. Overall, extensive experiments demonstrate superior performance compared to state-of-the-art methods on several datasets.

研究の動機と目的

  • 大規模で不規則なマスクを伴う高精細画像補完における長距離コンテキストモデリングの課題に対処すること。
  • 深層畳み込みネットワークが近隣の可視領域を優先するという局所的バイアスを克服すること。
  • トランスフォーマーのエンコーダーにおいて、すべての可視トークンに対して明示的かつ等重みでグローバルな依存関係をモデル化すること。
  • 注目度スコアに基づく動的特徴選択により、生成領域と可視領域間の外観の一貫性を向上させること。
  • 任意の画像解像度にスケーリング可能な柔軟な、完全畳み込み型フレームワークを設計すること。

提案手法

  • トランスフォーマーのエンコーダーを用いて、方向性のないシーケンス・ツー・シーケンス予測タスクとして画像補完を扱う。
  • 小規模で非重複な受容 field を持つ制限付きCNNを用いてトークン表現を生成し、局所的相関から可視コンテキストを分離する。
  • トランスフォーマーの自己注意機構により、すべての可視トークン間で長距離依存関係を均等にモデル化し、近接性の優位性を回避する。
  • 注目度スコアに基づき高周波成分を動的に選択する注目度-aware レイヤー(AAL)を導入し、外観の一貫性を向上させる。
  • 2段階の精錬フレームワークを採用:まずTFill-Coarseで粗いコンテンツ生成を行い、その後AALを用いて外観を精錬する。
  • 完全畳み込み型設計を採用することで、標準的な位置埋め込みの固定シーケンス長の制限を克服し、任意の画像サイズでの推論を可能にする。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマー基盤のアーキテクチャは、局所的特徴に偏らないように、画像補完において長距離グローバルコンテキストを効果的にモデル化できるか?
  • RQ2トークンエンコーダーの受容 field を制限することで、画像補完におけるグローバル依存関係のモデル化にどのような影響を与えるか?
  • RQ3注目度-aware レイヤーは、可視領域および生成領域からの特徴を適応的に選択することで、外観の一貫性を向上させられるか?
  • RQ4本手法は、既存の2段階アプローチと比較して、多様なマスクタイプにおける忠実度と一般化性能の面で優れているか?
  • RQ5本モデルは、高解像度画像にスケーリング可能でありながら、性能と効率を維持できるか?

主な発見

  • TFillは複数のデータセットで最先端の性能を達成し、先行手法と比較して平均でFIDを2.8%低下、LPIPSを6.0%低下させた。
  • 制限付きCNNによるトークン化により、16×16の受容 field を使用した場合、FIDは3.63、LPIPSは0.057にまで低下し、より大きな受容 field よりも優れた性能を示した。
  • AALモジュールは、次善のベースラインと比較してFIDを0.11、LPIPSを0.004低下させ、外観の一貫性が向上していることを示した。
  • FFHQデータセットでは、TFill-AALはランダムマスク条件下でLPIPS 0.0412、FID 2.57を達成し、SA、CA、SLTAを上回った。
  • 大きな受容 field を使用しても、メモリ使用量(1.15 GB)と推論時間(0.180 s)が低く抑えられ、効率性を維持した。
  • 定性的な結果では、CA や PIC のように色の不一致を生じるのではなく、生成領域にアーティファクトが見られなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。