Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Opacity Propagation for Image Matting

Yaoyi Li, Qingyao Xu|arXiv (Cornell University)|Apr 7, 2020
Image Enhancement Techniques参考文献 49被引用数 12
ひとこと要約

本論文は、グローバルおよびローカルのアテンションベースの伝達ブロックを用いて、マルチスケール特徴マップを介した不透明度メッセージパッシングを明示的にモデル化する、画像マットイングのための新しい深層学習フレームワーク、階層的不透明度伝達(HOP)を提案する。スケールに依存しない位置エンコーディングとランダム補間増強を統合することで、HOPはComposition-1kおよびalphamatting.comベンチマークの両方で最先端の性能を達成し、精度と耐性の面で先行手法を上回った。

ABSTRACT

Natural image matting is a fundamental problem in computational photography and computer vision. Deep neural networks have seen the surge of successful methods in natural image matting in recent years. In contrast to traditional propagation-based matting methods, some top-tier deep image matting approaches tend to perform propagation in the neural network implicitly. A novel structure for more direct alpha matte propagation between pixels is in demand. To this end, this paper presents a hierarchical opacity propagation (HOP) matting method, where the opacity information is propagated in the neighborhood of each point at different semantic levels. The hierarchical structure is based on one global and multiple local propagation blocks. With the HOP structure, every feature point pair in high-resolution feature maps will be connected based on the appearance of input image. We further propose a scale-insensitive positional encoding tailored for image matting to deal with the unfixed size of input image and introduce the random interpolation augmentation into image matting. Extensive experiments and ablation study show that HOP matting is capable of outperforming state-of-the-art matting methods.

研究の動機と目的

  • 既存の深層学習ベースのマットイング手法における暗黙的不透明度伝達の制限を克服するため、意味的レベル間で明示的かつ構造的な伝達を導入すること。
  • 専用のHOPブロックを介して長距離および局所的文脈に配慮した不透明度転送を可能にすることで、高解像度画像におけるマットイング精度を向上させること。
  • スケールに依存しない位置エンコーディング機構を用いて、さまざまな入力画像サイズを効果的に処理すること。
  • 画像マットイングのための新しいランダム補間データ増強戦略を通じて、一般化性能と耐性を向上させること。
  • 除去実験とベンチマーク評価を通じて、階層的伝達、位置エンコーディング、データ増強の有効性を検証すること。

提案手法

  • 本手法は、アピアランスエンコーダーとHOPデコーダーからなる二重ブランチネットワークを採用し、グローバルおよびローカルのHOPブロックを用いてマルチスケール特徴マップを介した不透明度特徴の伝達を実現する。
  • 各HOPブロックは二重ソースアテンション機構を用いる:クエリはアピアランス特徴から、キー/バリューは不透明度特徴から取得され、アピアランスに配慮した不透明度伝達が可能になる。
  • グローバルHOPブロックは、低解像度で意味的に豊かな特徴から長距離の文脈を集約し、初期のアルファ予測をガイドする。
  • ローカルHOPブロックは、局所的近傍アテンションを用いて不透明度を伝達することで、高解像度特徴を精緻化し、ぼやけたアーティファクトを低減する。
  • 相対的位置エンコーディングに基づくスケールに依存しない位置エンコーディングを導入し、さまざまな入力サイズにおいて性能を維持する。
  • 訓練中にランダム補間増強を適用し、多様な画像スケールをシミュレートし、耐性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1意味的レベル間で明示的な階層的不透明度伝達が、暗黙的または自己アテンションベースの手法と比較して画像マットイング性能を向上させられるか?
  • RQ2スケールに依存しない位置エンコーディングの統合が、可変サイズの入力においてマットイング精度に与える影響はいかほどか?
  • RQ3ランダム補間増強は、深層画像マットイングモデルの一般化性能をどの程度向上させるか?
  • RQ4グローバルおよびローカルHOPブロックは、最終的なアルファマット品質にどのように異なる寄与をしているか?
  • RQ5各コンponent(HOPブロック、位置エンコーディング、増強)の相対的な寄与度は、全体の性能向上にどの程度寄与しているか?

主な発見

  • HOPマットイングは、すべてのコンポーネントを有効にした場合、Composition-1kテストセットでSADが28.12、MSEが5.8 × 10⁻³を達成し、以前の最先端手法を上回った。
  • 除去実験の結果、HOPブロックを1つでも除去すると性能が低下し、グローバル+3つのローカルブロックを備えた完全なHOP構造が、最良のSAD(34.82)とMSE(8.99)を達成した。
  • スケールに依存しない位置エンコーディング、トリマップ埋め込み、ランダム補間増強の組み合わせにより、SADは34.82から28.12に、MSEは9.0から5.8 × 10⁻³に低下した。
  • 勾配マップの可視化により、HOPモデルがグローバルに類似した外観領域に注目しているのに対し、HOPを搭載しないモデルは局所的領域にのみ注目していることが確認され、階層的伝達メカニズムの有効性が裏付けられた。
  • alphamatting.comベンチマークでは、HOPマットイングはすべての指標およびトリマップタイプで最高の平均順位を達成し、その耐性と優位性が確認された。
  • 本手法は11GB未満のGPUメモリで動作し、コンテキストに依存するマットイングやDeep Mattingとは異なり、ダウンサンプリングなしで高解像度画像の推論が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。