[論文レビュー] Resolution-robust Large Mask Inpainting with Fourier Convolutions
本稿では、高速フーリエ畳み込み(FFC)を用いて初期のネットワーク層からフル画像の受容 field を実現する、解像度に頑健な単一段階型画像補完手法 LaMa を提案する。FFCに基づくアーキテクチャ、高受容 field の感知損失、および攻撃的な大マスクデータ拡張を組み合わせることで、LaMa は大マスクに対して最先端の性能を達成し、学習時に見られなかった高解像度にも効果的に一般化可能であり、従来手法よりもパラメータ数と推論コストが少ない。
Modern image inpainting systems, despite the significant progress, often struggle with large missing areas, complex geometric structures, and high-resolution images. We find that one of the main reasons for that is the lack of an effective receptive field in both the inpainting network and the loss function. To alleviate this issue, we propose a new method called large mask inpainting (LaMa). LaMa is based on i) a new inpainting network architecture that uses fast Fourier convolutions (FFCs), which have the image-wide receptive field; ii) a high receptive field perceptual loss; iii) large training masks, which unlocks the potential of the first two components. Our inpainting network improves the state-of-the-art across a range of datasets and achieves excellent performance even in challenging scenarios, e.g. completion of periodic structures. Our model generalizes surprisingly well to resolutions that are higher than those seen at train time, and achieves this at lower parameter&time costs than the competitive baselines. The code is available at \url{https://github.com/saic-mdal/lama}.
研究の動機と目的
- 既存の補完モデルが大マスクおよび複雑な構造を扱う際の限界、特に高解像度設定下での課題を解消すること。
- 標準畳み込みネットワークおよび感知損失における有効な受容 field の不足が、グローバルな構造理解を妨げることを克服すること。
- 二段階型や複雑なアーキテクチャに比べて計算コストを低減しつつ、優れた性能を発揮する単一段階型補完フレームワークを開発すること。
- 高解像度のトレーニングデータを必要とせずに、高解像度画像への一般化を可能にすること。
提案手法
- 本手法は、高速フーリエ畳み込み(FFC)に基づく、フィードフォワード型で ResNet に類似した生成器ネットワークを採用しており、初期層からも画像全域の受容 field を提供する。
- 大範囲の文脈を持つセマンティックセグメンテーションバックボーンを用いた、高受容 field の感知損失を採用し、グローバルな形状や構造の一貫性を強制する。
- モデルおよび損失関数の高受容 field を最大限に活用するために、広範囲で大規模かつ多様なトレーニングマスクを生成する攻撃的なマスク生成戦略を採用する。
- 訓練には、r1正則化付きの PatchGAN 判別器を用いた adversarial loss、感知損失、および特徴マッチングを組み合わせたマルチコンポonent損失を用いる。
- 入力は、マスク処理済み画像とバイナリマスクをスタックした4チャンネルテンソルであり、ネットワークが欠損領域に注目できるようにする。
- アーキテクチャは低解像度(256×256)データにのみトレーニングされるが、推論時に高解像度にも効果的に一般化可能である。
実験結果
リサーチクエスチョン
- RQ1中間監視や複雑な設計を一切用いずに、単一段階型画像補完モデルが大マスクに対して最先端の性能を達成できるか?
- RQ2フーリエ畳み込みに基づく高受容 field アーキテクチャは、学習時に見られなかった高解像度画像への一般化をどのように向上させるか?
- RQ3大範囲の文脈を持つ感知損失は、補完におけるグローバルな画像構造のモデリングをどの程度改善するか?
- RQ4攻撃的な大マスクデータ拡張は、高受容 field 要素を活用する能力を顕著に向上させるか?
- RQ5標準畳み込みと比較して、FFCベースのネットワークは周期的・繰り返しパターンの把握・生成をより効果的に行えるか?
主な発見
- LaMa は、大マスクおよび複雑な構造のシナリオを含む複数のベンチマークデータセットで最先端の性能を達成している。
- 256×256 画像でのみトレーニングされたにもかかわらず、4K解像度まで顕著に良好な一般化性能を示しており、解像度に頑健であることが確認された。
- 周期的・繰り返しパターンに対して優れた結果を達成しており、従来手法がしばしば苦手としている分野でも優位性を示している。
- DCT-Net や SIREN といった競合手法と比較して、30〜50%のパラメータ数削減と低い推論時間で実現している。
- アブレーションスタディにより、FFCアーキテクチャ、高受容 field 損失、攻撃的なマスク生成の各要素が性能向上に顕著に寄与していることが確認された。
- 自由形状やオブジェクト形状のマスクに対しても強固な性能を維持しており、マスクの多様性に対する耐性が示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。