Skip to main content
QUICK REVIEW

[論文レビュー] Image Inpainting with External-internal Learning and Monochromic Bottleneck

Tengfei Wang, Hao Ouyang|arXiv (Cornell University)|Apr 19, 2021
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

本論文は、構造再構築と色復元を分離するためにモノクロマチックなボトルネックを用いる外部-内部学習フレームワークを提案する。まず大規模データセットでグレースケールで欠損領域を再構築する外部学習を行い、その後、テスト画像の統計のみを用いて段階的に内部色再構成ネットワークを適用することで、色の漏れなどのアーティファクトを低減し、複数のベンチマークで構造的一致性と視覚的品質を向上させる。

ABSTRACT

Although recent inpainting approaches have demonstrated significant improvements with deep neural networks, they still suffer from artifacts such as blunt structures and abrupt colors when filling in the missing regions. To address these issues, we propose an external-internal inpainting scheme with a monochromic bottleneck that helps image inpainting models remove these artifacts. In the external learning stage, we reconstruct missing structures and details in the monochromic space to reduce the learning dimension. In the internal learning stage, we propose a novel internal color propagation method with progressive learning strategies for consistent color restoration. Extensive experiments demonstrate that our proposed scheme helps image inpainting models produce more structure-preserved and visually compelling results.

研究の動機と目的

  • 深層学習ベースの画像インpaintingにおける継続的なアーティファクト、たとえば色の漏れやぼんやりとした構造の問題に対処すること。
  • 大スケールの穴を含むインpainting状況における視覚的品質と構造的一致性を向上させること。
  • 外部事前学習(一般化性能)と内部自己教師付き学習(局所的な色の一貫性)の長所を統合したフレームワークに統合すること。
  • ユーザーが色をガイドできるようにし、マスク比率が高い状況でも頑健性を確保すること。
  • アーキテクチャの大幅な見直しを伴わずに、複数のバックボーンモデルやデータセットに一般化できること。

提案手法

  • 本手法はモノクロマチックなボトルネックを用いる:入力画像はまず、大規模データセットで事前学習された外部学習ネットワークを用いてグレースケールで再構築される。
  • 構造再構築は1次元の色空間(R)で実行され、最適化の複雑さが低減され、構造の正確性が向上する。
  • 独自の内部色伝搬ネットワークが、テスト画像の統計情報のみを用いて色を回復させ、色の漏れを回避する。
  • 段階的な回復戦略により、局所的およびグローバルな色統計が組み合わされ、色の一貫性が向上し、硬い境界が低減される。
  • 色再構成損失は、マスクされていない領域でのみ計算され、元の画像の色分布への忠実度が保証される。
  • このフレームワークは既存のモデルと直交しており、GatedConv、EdgeConnect、HiFill、GMCNNの改善に適用可能である。

実験結果

リサーチクエスチョン

  • RQ1モノクロマチックな空間で学習することで、画像インpaintingにおける構造の保持が向上するか?
  • RQ2テスト画像の統計情報のみを用いた内部色伝搬により、色のアーティファクトが低減され、視覚的調和が向上するか?
  • RQ3局所的およびグローバルな色統計からの段階的色再構成は、視覚的品質とアーティファクト低減にどのように影響するか?
  • RQ4提案手法は、多様なデータセットやマスクタイプにおいて、既存の深層学習ベースのインpaintingモデルをどの程度向上させられるか?
  • RQ5ユーザーが色のヒントを提供することで、内部色再構成プロセスに効果的に統合できるか?

主な発見

  • 提案手法は、Places2、Paris StreetView、CelebA-HQ、DTDの4つの公開データセットにおいて、一貫した視覚的品質の向上を達成した。
  • 挑戦的なPlaces2データセットにおいて、不規則なマスク条件下でPSNRが39.50に達し、最先端の色再構成ベースラインを上回った。
  • 73.4%という高いマスク比率でさえ、内部色再構成ネットワークが顕著なアーティファクトを伴わず調和の取れた結果を生成した。
  • アブレーションスタディにより、段階的回復戦略が不可欠であることが確認された—この戦略がなければ、硬い境界と目立つアーティファクトが生じた。
  • GatedConv、EdgeConnect、HiFill、GMCNNといったベースラインモデルは、定性的および定量的指標の両方で、本手法によって向上した。
  • ユーザーが色をガイドできる:1つの色ヒントを追加するだけで、顔のインpaintingにおける目の色など、生成コンテンツの色を制御可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。