Skip to main content
QUICK REVIEW

[論文レビュー] On the relation between statistical learning and perceptual distances

Alexander Hepburn, Valero Laparra|arXiv (Cornell University)|Jun 8, 2021
Image and Signal Denoising Methods参考文献 47被引用数 5
ひとこと要約

本稿は、統計的画像特性、知覚的距離、および自己符号化器における教師なし表現学習の関係を調査する。知覚的距離は自然画像統計下での画像尤度と相関しており、自己符号化器における知覚的損失の使用は、特に小規模バッチサイズの場合、尤度との相関により、勾配推定の分散を低減する暗黙的正則化によって勾配推定を改善することを示している。ただし、画像統計が損失関数とデータの両方で二重にカウントされるため、MSEに比べて性能向上は限定的であり、データが乏しい状況を除いて顕著ではない。

ABSTRACT

It has been demonstrated many times that the behavior of the human visual system is connected to the statistics of natural images. Since machine learning relies on the statistics of training data as well, the above connection has interesting implications when using perceptual distances (which mimic the behavior of the human visual system) as a loss function. In this paper, we aim to unravel the non-trivial relationships between the probability distribution of the data, perceptual distances, and unsupervised machine learning. To this end, we show that perceptual sensitivity is correlated with the probability of an image in its close neighborhood. We also explore the relation between distances induced by autoencoders and the probability distribution of the training data, as well as how these induced distances are correlated with human perception. Finally, we find perceptual distances do not always lead to noticeable gains in performance over Euclidean distance in common image processing tasks, except when data is scarce and the perceptual distance provides regularization. We propose this may be due to a \emph{double-counting} effect of the image statistics, once in the perceptual distance and once in the training procedure.

研究の動機と目的

  • 知覚的距離、画像統計、および教師なし表現学習との関係を理解すること。
  • 人間の類似性予測が優れているにもかかわらず、自己符号化器の学習において知覚的距離が常にユークリッド距離を上回らない理由を調査すること。
  • 特に小規模バッチサイズ下での確率的勾配降下法におけるデータ分布と損失の分散の役割を分析すること。
  • 画像尤度と相関する知覚的距離が、外れ値を低減することで正則化として機能するかどうかを分析すること。
  • 画像統計が訓練データと知覚的損失関数の両方で暗黙的に符号化される二重カウント効果を明確にすること。

提案手法

  • 画像尤度を推定し、知覚的距離と相関させるために、確率的画像モデル(PixelCNN++)を用いる。
  • ユークリッド(MSE)および知覚的(NLPD、PIM)損失関数を用いて自己符号化器を訓練し、誘導される距離を比較する。
  • バッチサイズ1で確率的勾配降下法を用い、勾配分散と一般化誤差推定値を評価する。
  • NLPDとMSE損失で訓練したモデルの期待テストセットMSEを比較し、一般化性能を評価する。
  • 異なる損失関数下での勾配推定器の標準誤差を分析し、分散低減を定量化する。
  • 固定された乱数シードと複数回の実行を用い、再現性を確保し、結果の平均値と標準偏差を報告する。

実験結果

リサーチクエスチョン

  • RQ1知覚的距離は自然画像の確率分布とどのように関係しているか?
  • RQ2自己符号化器が誘導する距離は、人間の知覚的類似性とどの程度相関しているか?
  • RQ3なぜ知覚的距離は、画像再構成タスクにおいて常にMSEを上回らないのか?
  • RQ4知覚的損失の使用は、小規模バッチ学習における勾配推定分散にどのように影響するか?
  • RQ5画像統計の二重カウントが、知覚的損失の性能に果たす役割は何か?

主な発見

  • NLPD や PIM などの知覚的距離は、PixelCNN++ で推定された画像尤度と強く相関しており、知覚的類似性と自然画像統計の間に深い関係があることを示している。
  • MSE損失で訓練された自己符号化器が誘導する距離は、訓練画像の尤度と強く相関しており、モデルがデータ密度と整合した表現を学習していることを示している。
  • データが乏しい状況では、NLPD などの知覚的距離がMSEよりも優れた一般化性能を示す。これは、低尤度(外れ値)のサンプルを低減することで、暗黙的正則化が働くためである。
  • 小規模バッチ学習において NLPD が MSE よりも優れた性能を示すのは、知覚的距離が画像尤度と相関しており、その結果勾配推定器の分散が低減されるためである。
  • 人間の類似性予測が優れているにもかかわらず、知覚的距離が一貫して再構成性能を向上させないのは、画像統計がデータと損失関数の両方で二重にカウントされるためである。
  • NLPD を用いた場合、MSE よりも勾配推定器の標準誤差が低く抑えられ、特にバッチサイズ1のとき顕著に、一般化誤差の推定が改善されていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。