Skip to main content
QUICK REVIEW

[論文レビュー] Shape-guided Object Inpainting

Yu Zeng, Zhe Lin|arXiv (Cornell University)|Apr 16, 2022
Generative Adversarial Networks and Image Synthesis被引用数 6
ひとこと要約

本稿では、形状と周囲の文脈に基づいて完全で意味的に整合性のあるオブジェクトを生成する、形状誘導型オブジェクト補填という新しいタスクを紹介する。著者らは、予測クラス埋め込みとトップダウン型オブジェクト生成を備えた二重ストリーム生成ネットワーク、CogNetを提案し、Places2ではFIDスコア3.801、COCOでは4.700という最先端の性能を達成した。

ABSTRACT

Previous works on image inpainting mainly focus on inpainting background or partially missing objects, while the problem of inpainting an entire missing object remains unexplored. This work studies a new image inpainting task, i.e. shape-guided object inpainting. Given an incomplete input image, the goal is to fill in the hole by generating an object based on the context and implicit guidance given by the hole shape. Since previous methods for image inpainting are mainly designed for background inpainting, they are not suitable for this task. Therefore, we propose a new data preparation method and a novel Contextual Object Generator (CogNet) for the object inpainting task. On the data side, we incorporate object priors into training data by using object instances as holes. The CogNet has a two-stream architecture that combines the standard bottom-up image completion process with a top-down object generation process. A predictive class embedding module bridges the two streams by predicting the class of the missing object from the bottom-up features, from which a semantic object map is derived as the input of the top-down stream. Experiments demonstrate that the proposed method can generate realistic objects that fit the context in terms of both visual appearance and semantic meanings. Code can be found at the project page \url{https://zengxianyu.github.io/objpaint}

研究の動機と目的

  • 画像補填研究におけるギャップに取り組む。従来の研究は主に背景や部分的なオブジェクトの補填に焦点を当てており、完全なオブジェクトの再生成にはあまり注力されていない。
  • 既存の補填モデルが背景生成に偏りを示すという根本的問題を解消するため、トレーニングデータにオブジェクト事前知識を組み込む。
  • 下流の文脈伝播とトップダウンの意味的オブジェクト生成を統合した深層生成モデルを設計し、視覚的・意味的整合性を向上させる。
  • 周囲のシーンの照明、色調、スタイルと整合する、文脈に適応した意味的意味のあるオブジェクト生成を可能にする。

提案手法

  • トレーニング中にオブジェクトインスタンスを穴として使用する新しいデータ準備法を提案。ランダムマスキングに代えてオブジェクト事前知識を埋め込む。
  • 二重ストリームアーキテクチャを設計:下流ストリームは文脈に基づく画像補填を、トップダウンストリームは意味的オブジェクト生成を担当。
  • 下流特徴から欠落しているオブジェクトのクラスを推定する予測クラス埋め込み(PCE)モジュールを導入し、トップダウン生成をガイド。
  • 予測クラスと穴マスクから導出される意味的オブジェクトマップをトップダウンストリームの入力として使用し、空間的・意味的整合性を強制。
  • 敵対的損失と知覚的損失を用いて、エンド・トゥ・エンドに学習させ、現実的な外観と高レベルの意味的整合性を確保。
  • トップダウンストリームで潜在ノイズベクトルを活用し、同一入力に対して多様で現実的なオブジェクトのバリエーションを生成可能にする。

実験結果

リサーチクエスチョン

  • RQ1画像補填モデルは、単に背景や部分的なオブジェクトを補填するのではなく、完全なオブジェクトの生成に適応可能か?
  • RQ2既存モデルが背景生成に偏る傾向を軽減するため、トレーニングデータをどのように再構築すべきか?
  • RQ3生成オブジェクトの視覚的リアリズムと意味的整合性を保証するために必要なアーキテクチャ的要素は何か?
  • RQ4完全に下流の文脈モデリングに依存するのと比較して、トップダウンの意味的ガイドがオブジェクト補填にどの程度向上効果をもたらすか?
  • RQ5異なる潜在コードを用いることで、同一入力に対して多様で文脈的に整合性のあるオブジェクトを生成できるか?

主な発見

  • 提案手法は、COCO、Places2、Cityscapesの各データセットで最先端の性能を達成し、FIDスコアはそれぞれ4.700、3.801、7.411であった。
  • アブレーションスタディの結果、予測クラス埋め込みやトップダウンストリームを削除するとFIDが1.0点以上上昇し、これらが極めて重要な役割を果たしていることが示された。
  • オブジェクト事前知識を含まないトレーニングデータを使用した場合、モデルはオブジェクトを生成できず、背景に似たテクスチャで穴を埋めてしまう。
  • 複数のランダムな潜在コードを用いた結果、図7に示すように、多様で文脈的に整合性のあるオブジェクトインスタンスが生成された。
  • 定量的評価では、FIDおよびLPIPSの両方の指標において、CoModGAN、DeepFillV2、RFRを上回る性能を示した。
  • 定性的な結果から、生成されたオブジェクトは視覚的に現実的で、意味的に妥当であり、周囲のシーンの照明やスタイルと良好に整合していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。