Skip to main content
QUICK REVIEW

[論文レビュー] MISF: Multi-level Interactive Siamese Filtering for High-Fidelity Image Inpainting

Xiaoguang Li, Qing Guo|arXiv (Cornell University)|Mar 12, 2022
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

本稿では、2つの相互に接続されたブランチ(カーネル予測ブランチ:KPB と 語義および画像フィルタリングブランチ:SIFB)を介して、動的で文脈に適応した画像レベルおよび語義レベルのフィルタリングを統合的に行う、マルチレベル相互作用型シameseフィルタリング(MISF)という、画像補完のための新規なフレームワークを提案する。MISFは、適応的で文脈に適応したフィルタリングカーネルとマルチレベル特徴の統合を活用し、敦煌、Places2、CelebAの3つのデータセットにおいて最先端の性能を達成し、多様な欠損領域およびシーンタイプにわたってアーティファクトを顕著に低減し、忠実度を向上させた。

ABSTRACT

Although achieving significant progress, existing deep generative inpainting methods are far from real-world applications due to the low generalization across different scenes. As a result, the generated images usually contain artifacts or the filled pixels differ greatly from the ground truth. Image-level predictive filtering is a widely used image restoration technique, predicting suitable kernels adaptively according to different input scenes. Inspired by this inherent advantage, we explore the possibility of addressing image inpainting as a filtering task. To this end, we first study the advantages and challenges of image-level predictive filtering for image inpainting: the method can preserve local structures and avoid artifacts but fails to fill large missing areas. Then, we propose semantic filtering by conducting filtering on the deep feature level, which fills the missing semantic information but fails to recover the details. To address the issues while adopting the respective advantages, we propose a novel filtering technique, i.e., Multilevel Interactive Siamese Filtering (MISF), which contains two branches: kernel prediction branch (KPB) and semantic & image filtering branch (SIFB). These two branches are interactively linked: SIFB provides multi-level features for KPB while KPB predicts dynamic kernels for SIFB. As a result, the final method takes the advantage of effective semantic & image-level filling for high-fidelity inpainting. We validate our method on three challenging datasets, i.e., Dunhuang, Places2, and CelebA. Our method outperforms state-of-the-art baselines on four metrics, i.e., L1, PSNR, SSIM, and LPIPS. Please try the released code and model at https://github.com/tsingqguo/misf.

研究の動機と目的

  • 既存の深層生成補完手法には、多様なシーンや欠損領域の形状にわたって一般化能力に欠け、アーティファクトを生じやすいという限界があることに対処する。
  • 局所的構造を保持し、アーティファクトを低減するための画像レベル予測フィルタリングの可能性を検討するが、同時に大規模な欠損領域の補完ができないという限界を克服する。
  • 予測フィルタリングを画像の深層特徴レベル(語義フィルタリング)に拡張し、細部の損失を伴いながらも大規模な語義的コンテンツを回復する。
  • 画像レベルと語義レベルのフィルタリングを、相互作用的でマルチレベルのシameseアーキテクチャによって統合し、忠実度と一般化性能を向上させる。
  • 相互作用的フィルタリングによって得られる動的畳み込み演算が、標準的なエンコーダ・デコーダネットワークよりも顕著に性能を向上させることを実証する。

提案手法

  • MISFは、KPB と SIFB という2つの並列で相互に接続されたブランチを採用し、マルチレベル特徴と動的カーネルを交換する。
  • KPB は、SIFB からのマルチレベル特徴と入力画像に基づき、文脈に適応した空間的に変化するフィルタリングカーネルを予測し、文脈に適応したフィルタリングを可能にする。
  • SIFB は、ピクセルレベルおよび深層特徴レベルの両方でフィルタリングを実行する:画像レベルのフィルタリングは細部の回復を、語義レベルのフィルタリングは高レベル表現を用いて大規模な欠損領域の回復を実現する。
  • KPB と SIFB 間の相互作用は双方向的である。SIFB はマルチレベル特徴をカーネル予測をガイドする。一方、KPB は動的カーネルを供給し、特徴およびピクセル再構築を精緻化する。
  • 本フレームワークは、隣接ピクセルおよび特徴間の滑らかさの事前知識を明示的にモデル化しており、生成モデルに依存せず、高忠実度の再構築を可能にする。
  • L1、PSNR、SSIM、LPIPS の指標を用いて、エンド・トゥ・エンドで学習を行い、アブレーションスタディにより各コンポonentの寄与度を検証する。

実験結果

リサーチクエスチョン

  • RQ1画像レベルの予測フィルタリングは、画像補完においてアーティファクトを効果的に低減し、局所的構造を保持できるか。また、大規模な欠損領域の処理においてはどのような限界を示すか。
  • RQ2深層特徴における語義レベルのフィルタリングは、大規模な欠損コンテンツを効果的に回復できるか。一方で、細粒度の詳細忠実度を損なうことはないか。
  • RQ3画像レベルと語義レベルのフィルタリングを効果的に統合することで、高忠実度の詳細回復と強固な語義的補完を両立できるか。
  • RQ4標準的な生成ネットワークと比較して、MISF の相互作用的でマルチレベルの設計が、多様なシーンやマスク形状にわたる一般化性能をどの程度向上させるか。
  • RQ5エンコーダ・デコーダアーキテクチャにおける固定または単一レベルのフィルタリングと比較して、相互作用的フィルタリングによって学習される動的畳み込み演算の寄与度は何か。

主な発見

  • MISF は、敦煌、Places2、CelebA の3つのデータセットにおいて、L1、PSNR、SSIM、LPIPS の4つの指標すべてで最先端の手法を上回った。
  • 敦煌データセットでは、F3特徴レベルで L1 損失が 0.488、PSNR が 1.651、SSIM が 3.895、LPIPS が 0.0343 を達成し、優れた性能を示した。
  • アブレーションスタディにより、MISF が画像レベルと語義レベルのフィルタリングを統合することで、単独の手法(Img-Filter や Sem-Filter)よりも優れた結果が得られることを確認した。MISF は、全指標および全マスクサイズで一貫して優位であった。
  • 類似度解析から、MISF フィルタリング後、特にマスク比が高くなると、特徴が真値特徴に著しく近づくことが示された。これにより、フィルタリング機構の有効性が裏付けられた。
  • En-decoder、En-decoder-Filter、Sem-Filter、MISF のアブレーション比較から、より動的で柔軟な畳み込み演算(すなわち MISF)が優れた性能を発揮することが判明。相互作用的でマルチレベルのフィルタリングの重要性が検証された。
  • 定性的な結果から、MISF は RFRNet や JPGNet と比較して、特に大規模な欠損領域や複雑なシーンにおいて、より自然で高忠実度の画像を生成し、アーティファクトが少なく、詳細が豊富であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。