Skip to main content
QUICK REVIEW

[論文レビュー] E-LPIPS: Robust Perceptual Image Similarity via Random Transformation Ensembles

Markus Kettunen, Erik Härkönen|arXiv (Cornell University)|Jun 10, 2019
Advanced Image Processing Techniques参考文献 31被引用数 33
ひとこと要約

E-LPIPSはLPIPSを、実質的に無限のランダム入力変換とアーキテクチャの微調整のアンサンブルを平均化することで拡張します。これにより、人間の判断を保持しつつ、敵対的攻撃に対して頑健な知覚的類似度指標が得られます。さらに画像空間における知覚的凸性を明らかにし、復元タスクの損失性能を向上させます。

ABSTRACT

It has been recently shown that the hidden variables of convolutional neural networks make for an efficient perceptual similarity metric that accurately predicts human judgment on relative image similarity assessment. First, we show that such learned perceptual similarity metrics (LPIPS) are susceptible to adversarial attacks that dramatically contradict human visual similarity judgment. While this is not surprising in light of neural networks' well-known weakness to adversarial perturbations, we proceed to show that self-ensembling with an infinite family of random transformations of the input --- a technique known not to render classification networks robust --- is enough to turn the metric robust against attack, while retaining predictive power on human judgments. Finally, we study the geometry imposed by our our novel self-ensembled metric (E-LPIPS) on the space of natural images. We find evidence of "perceptual convexity" by showing that convex combinations of similar-looking images retain appearance, and that discrete geodesics yield meaningful frame interpolation and texture morphing, all without explicit correspondences.

研究の動機と目的

  • 人間の判断と矛盾する adversarial 攻撃に対する LPIPSスタイルの知覚的類似度指標の脆弱性を示す。
  • 人間の予測判断精度を失わずに頑健性を高めるために、ランダム入力変換とネットワーク変更をアンサンブルして E-LPIPS を提案する。
  • 自然画像空間における E-LPIPS が誘導する幾何特性を分析する:知覚的凸性や意味のある測地線を含む。

提案手法

  • LPIPS距離を計算する前に、入力画像に対して幾何学的および色変換のランダム化された、実質的に無限のアンサンブルを適用する。
  • 最後の層だけでなく、すべての畳み込み層で距離を計算し、入力カラー項も学習済み重みとともに含める。
  • 全層にドロップアウトを導入し、最大プーリングを平均プーリングに置換して勾配の流れと頑健性を向上させる。
  • E-LPIPSを、変換アンサンブル上のLPIPSの期待として定義する: d_E-LPIPS(x,y)=E[d_LPIPS(T(x),T(y))]。
  • 実用的なガイダンスを提供:各反復で1つのランダムサンプルで十分だが、精度のために N>=300 サンプルを推奨。
  • EoT風の最適化を用いて白箱攻撃に対する頑健性を評価し、LPIPSのバリアントと比較する。

実験結果

リサーチクエスチョン

  • RQ1LPIPSスタイルの知覚的類似度指標は、人間の判断と矛盾する adversarial 攻撃の影響を受けるのか?
  • RQ2ランダム変換の自己アンサンブル(E-LPIPS)は、人間の知覚判断との相関を保ちつつ攻撃への頑健性を向上させるのか?
  • RQ3E-LPIPS 指標下でどのような幾何学的特性(例:知覚的凸性、意味のある測地線)が現れるのか?
  • RQ4E-LPIPSは最適化安定性を損なうことなく、画像復元などのタスクに効果的な損失関数として機能し得るのか?

主な発見

  • E-LPIPSは lpips-vgg および lpips-sqz より対 adversarial 攻撃に対してはるかに頑健で、攻撃下のL2距離の増大を抑える(LPIPS バリアントの 3.7–14.5 に対して 16.0–16.2)。
  • 小さな L2摂動に制約された攻撃は LPIPS 距離をはるかに大きく増加させる一方で E-LPIPS は耐性が向上していることを示す。
  • アブレーションにより、各変換成分が頑健性に寄与することが示され、完全なアンサンブルが最強の防御をもたらす。
  • E-LPIPSは LPIPSとほぼ同等の人間判断予測精度を達成(2AFCタスク:69.16% 対 非アンサンブル変種の 68.65–70.07%)。
  • E-LPIPSは知覚的凸性を示す:バーベース(重心)は L2 や LPIPS より外観を良好に保持し、離散測地線は対応付けを明示せずに意味のあるフレーム補間やテクスチャモーフィングを生み出す。
  • 彼らの実験では、損失関数として E-LPIPS を使用すると、単純な LPIPS より一貫して復元結果が改善される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。