Skip to main content
QUICK REVIEW

[論文レビュー] Perceptually Motivated Method for Image Inpainting Comparison

Иван Молодецких, Михаил Ерофеев|arXiv (Cornell University)|Jul 14, 2019
Advanced Image Processing Techniques参考文献 35被引用数 5
ひとこと要約

本稿では、人間の知覚と一致するように設計された、画像補完品質を評価するための知覚的動機付けられた目的的指標を提案する。9つの最先端の補完手法を対象とした主観的評価を通じて、特にスペクトル正規化を施したInception-V4を用いた深層学習ベースの非参照指標が、主観的データに明示的に訓練されていなくても、人間の判断と高い相関を示すことを示している。

ABSTRACT

The field of automatic image inpainting has progressed rapidly in recent years, but no one has yet proposed a standard method of evaluating algorithms. This absence is due to the problem's challenging nature: image-inpainting algorithms strive for realism in the resulting images, but realism is a subjective concept intrinsic to human perception. Existing objective image-quality metrics provide a poor approximation of what humans consider more or less realistic. To improve the situation and to better organize both prior and future research in this field, we conducted a subjective comparison of nine state-of-the-art inpainting algorithms and propose objective quality metrics that exhibit high correlation with the results of our comparison.

研究の動機と目的

  • 画像補完アルゴリズムを評価するための標準的で、知覚的に整合性のある手法の欠如に対処すること。
  • 補完画像の現実性に関する人間の知覚と強く相関する目的的指標を特定すること。
  • 主観的スコアの訓練データを必要とせずに、フルレファレンスおよび非レファレンス指標を評価すること。
  • 人間の知覚をゴールスタンダードとするベンチマークを提供すること。
  • インpaint領域を検出するように訓練されたモデルが、補完品質の推定器としても有効に機能することを示すこと。

提案手法

  • 33枚のテスト画像を用いた大規模な主観的評価を実施し、9つの最先端の補完アルゴリズムおよびプロフェッショナルな写真編集者を対象とした。
  • アルゴリズムの性能を基準とするための基準スコアとして、人間による比較スコアを収集した。
  • VGG-16特徴量、SSIMなどフルレファレンス指標と、Inception-V4、ResNetなど非レファレンス指標の、人間の判断との相関を評価した。
  • ImageNetで事前学習されたモデルの重みを初期値として用い、平均二乗誤差損失関数を用いて、画像を「綺麗」または「補完済み」と分類するための深層ニューラルネットワークを訓練した。
  • 一般化性および性能向上のため、スペクトル正規化とRGBノイズ特徴量を非レファレンスモデルに適用した。
  • 訓練中にモデルの予測と人間のスコアとの相関をモニタリングし、過学習を避けるために相関が最大となる時点で学習を停止した。

実験結果

リサーチクエスチョン

  • RQ1従来の目的的指標(例:PSNR、SSIM)は、画像補完品質に関する人間の知覚とどの程度相関しているか?
  • RQ2補完領域を検出するように訓練された非レファレンス深層学習モデルは、補完品質の推定器としても有効に機能するか?
  • RQ3どの目的的指標が、補完の現実性に関する人間の主観的評価と最も高い相関を示すか?
  • RQ4綺麗な画像と補完済み画像を区別するように訓練されたモデルは、主観的データに明示的にファインチューニングを行わずに、人間の知覚と良好に相関する指標を提供できるか?
  • RQ5フルレファレンス指標と非レファレンス指標は、補完品質に関する人間の好みを予測する能力において、どのように比較されるか?

主な発見

  • ImageNetで微調整したVGG-16のblock5_conv3層が、フルレファレンス指標の中で人間の反応と最も高い平均ピアソン相関(0.89)を達成した。
  • スペクトル正規化を施したInception-V4モデルが、非レファレンス指標として最高の性能を示し、主観的スコアに訓練されていなくても人間の判断と高い相関を示した。
  • 従来のフルレファレンス指標(例:SSIM)は人間の知覚と弱い相関を示し、補完結果の現実性をしばしば低く評価していた。
  • 最も優れた非レファレンスモデル(スペクトル正規化付きInception-V4)は、人間の比較と平均ピアソン相関0.83、スピアマン相関0.78を達成した。
  • 人間の相関を明示的に最適化していなくても、補完領域を検出するように訓練された深層学習モデルは、人間の知覚と強い整合性を示した。
  • 正解スコアを相関分析から除外したことで、フルレファレンス指標の優位性が低下し、このような指標が自己比較によって生じるバイアスが顕在化した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。