Skip to main content
QUICK REVIEW

[論文レビュー] Diverse Image Inpainting with Bidirectional and Autoregressive Transformers

Yingchen Yu, Fangneng Zhan|arXiv (Cornell University)|Apr 26, 2021
Generative Adversarial Networks and Image Synthesis参考文献 61被引用数 15
ひとこと要約

本稿では、長距離依存関係と双方向的文脈を両方モデル化できる双方向自己回帰型トランスフォーマー(BAT)を用いた、多様で高精細な画像補完を実現する新規な画像インpaintingフレームワーク、BAT-Fillを提案する。順列を適用したシーケンスにおける自己回帰モデリングとマスク言語モデリング(MLM)を組み合わせることで、欠損領域の整合的かつ多様な補完を実現し、CelebA-HQ、Places2、Paris StreetViewの各データセットにおいて、忠実度と多様性の両面で最先端の手法を上回る性能を発揮する。

ABSTRACT

Image inpainting is an underdetermined inverse problem, which naturally allows diverse contents to fill up the missing or corrupted regions realistically. Prevalent approaches using convolutional neural networks (CNNs) can synthesize visually pleasant contents, but CNNs suffer from limited perception fields for capturing global features. With image-level attention, transformers enable to model long-range dependencies and generate diverse contents with autoregressive modeling of pixel-sequence distributions. However, the unidirectional attention in autoregressive transformers is suboptimal as corrupted image regions may have arbitrary shapes with contexts from any direction. We propose BAT-Fill, an innovative image inpainting framework that introduces a novel bidirectional autoregressive transformer (BAT) for image inpainting. BAT utilizes the transformers to learn autoregressive distributions, which naturally allows the diverse generation of missing contents. In addition, it incorporates the masked language model like BERT, which enables bidirectionally modeling of contextual information of missing regions for better image completion. Extensive experiments over multiple datasets show that BAT-Fill achieves superior diversity and fidelity in image inpainting qualitatively and quantitatively.

研究の動機と目的

  • 大きな不規則な形状の欠損領域が存在する中で、多様かつ現実的な画像補完を生成する課題に取り組む。
  • 自己回帰型トランスフォーマーにおける一方向的アテンションの制限およびMLMベースのモデルにおける独立的予測の限界を克服する。
  • 出力依存性を統合した双方向的文脈と組み合わせることで、画像インpaintingにおけるグローバルな文脈モデリングと構造的一致性を向上させる。
  • まずBATを用いて一貫性のある構造を生成し、次にCNNベースのジェネレータでテクスチャを精緻化する二段階のフレームワークを開発する。

提案手法

  • 欠損ピクセルの両方の文脈(過去および未来)をモデル化できるように、入力シーケンスを順列変更する双方向自己回帰型トランスフォーマー(BAT)を提案する。
  • 二段階の訓練手順を採用する:まずBATが自己回帰モデリングにより多様で一貫性のある画像構造を生成し、次にCNNベースのテクスチャジェネレータが高周波数の詳細を精緻化する。
  • BERTと同様にマスク言語モデリング(MLM)を適用し、双方向的文脈を用いて欠損トークンを再構築することで、文脈認識を向上させる。
  • 有効なピクセルと欠損ピクセルを分類し、順列を整える戦略を採用することで、自己回帰生成を最初の欠損トークンから開始しつつ、すべての利用可能な文脈に条件づけられるようにする。
  • 出力依存性を強制する自己回帰モデリングを統合することで、予測トークン間の一貫性を確保する。
  • 再構築損失および adversarial 損失を用いてモデルを訓練することで、現実性と構造的一致性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1自己回帰的生成と双方向的文脈モデリングを統合したトランスフォーマー型アーキテクチャは、一方向的自己回帰モデルに比べ、より多様で一貫性のある画像インpainting結果を生成できるか?
  • RQ2自己回帰モデリングとマスク言語モデリング(MLM)を統合することで、画像インpaintingの品質と多様性はどのように向上するか?
  • RQ3提案されたBAT-Fillフレームワークは、画像の忠実度と構造的多様性の両面で、既存の最先端手法をどの程度上回るか?
  • RQ4構造生成からテクスチャ精緻化までの二段階設計は、エンドツーエンドアプローチに比べ、全体のインpainting品質を向上させるか?

主な発見

  • BAT-Fillは、CelebA-HQ、Places2、Paris StreetViewで最先端の性能を達成し、20-40%マスク時でFIDスコア36.19、40-60%マスク時で64.20、ランダムマスク時で48.19を記録し、決定的および多様な手法をすべて上回る。
  • アブレーションスタディにより、BATは再構築品質(FID: 40.91)を著しく向上させるとともに、高い多様性(LPIPS: 0.0301)を維持しており、双方向的文脈なし(FID: 59.60)または自己回帰モデリングなし(FID: 49.62)のモデルを上回ることが確認された。
  • 20-40%マスク時におけるParis StreetViewでのPSNRは26.52、SSIMは0.864を達成し、忠実度は高く、多様性も維持されている。
  • LPIPSスコアが20-40%で0.076、40-60%で0.147、ランダムで0.106であることを踏まえると、BAT-Fillは強力な多様なインpaintingベースラインであるPICよりもより知覚的に多様な結果を生成している。
  • 二段階設計により、より優れたテクスチャ合成が実現されており、PICと比較してℓ₁損失が低く(2.70% vs. 3.43%)、PSNRが高くなっている(26.52 vs. 24.80)。
  • アブレーションスタディの結果、自己回帰モデリングを削除するとFIDが49.62に低下するが、多様性も減少(LPIPS: 0.0304)する一方、双方向的文脈を削除するとFIDが著しく59.60に上昇し、両者の重要性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。