Skip to main content
QUICK REVIEW

[論文レビュー] Texture Interpolation for Probing Visual Perception

Jonathan Vacher, Aida Davila|arXiv (Cornell University)|Jun 5, 2020
Generative Adversarial Networks and Image Synthesis参考文献 64被引用数 8
ひとこと要約

本論文は、深層畳み込みニューラルネットワーク(CNN)の活性化に最適輸送理論を適用した、新規なテクスチャ補間手法を提案する。テクスチャ分布が楕円分布でよく近似されることを示し、視覚的に滑らかなテクスチャ間補間を可能にする。人間およびマカクザルの神経データにより、V4ニューロンは補間パラメータを線形に符号化しているのに対し、V1はそうではないことが確認され、テクスチャ知覚の幾何学的基盤が明らかになった。

ABSTRACT

Texture synthesis models are important tools for understanding visual processing. In particular, statistical approaches based on neurally relevant features have been instrumental in understanding aspects of visual perception and of neural coding. New deep learning-based approaches further improve the quality of synthetic textures. Yet, it is still unclear why deep texture synthesis performs so well, and applications of this new framework to probe visual perception are scarce. Here, we show that distributions of deep convolutional neural network (CNN) activations of a texture are well described by elliptical distributions and therefore, following optimal transport theory, constraining their mean and covariance is sufficient to generate new texture samples. Then, we propose the natural geodesics (ie the shortest path between two points) arising with the optimal transport metric to interpolate between arbitrary textures. Compared to other CNN-based approaches, our interpolation method appears to match more closely the geometry of texture perception, and our mathematical framework is better suited to study its statistical nature. We apply our method by measuring the perceptual scale associated to the interpolation parameter in human observers, and the neural sensitivity of different areas of visual cortex in macaque monkeys.

研究の動機と目的

  • 深層ニューラルネットワークの活性化に基づいて、数学的に整合性のあるテクスチャ補間手法を開発すること。
  • 視覚皮質におけるテクスチャ知覚と神経符号化が、テクスチャ空間の幾何学的性質とどのように関係するかを調査すること。
  • 既存の手法と比較して、最適輸送から導かれる補間経路が、知覚的および神経的反応をどれだけよく再現するかを検証すること。
  • MLDSプロトコルを用いて、人間被験者におけるテクスチャ補間の知覚的スケールを測定すること。
  • マカクザルの視覚皮質領域(V1 対 V4)における補間パラメータに対する神経感受性を比較すること。

提案手法

  • テクスチャの分布を、CNN活性化統計(平均と分散共分散)の空間における楕円分布としてモデル化する。
  • 最適輸送理論を適用し、これらの分布の空間にリーマン計量を定義することで、テクスチャ間の測地線補間を可能にする。
  • テクスチャ合成および補間の損失関数として、活性化分布間のワーサーテイン距離を用いる。
  • CNN特徴量の平均および共分散ベクトル空間における線形補間により、中間テクスチャを生成する。
  • 線形判別分析(LDA)を用いて、神経スパイク列およびスパイク数から補間パラメータを復号する。
  • 人間被験者における補間の全知覚的スケールを測定するために、MLDS(最大尤度差分スケーリング)プロトコルを用いる。

実験結果

リサーチクエスチョン

  • RQ1最適輸送に基づくテクスチャ間補間は、人間の知覚と整合する滑らかな遷移を生じるか?
  • RQ2V1およびV4の神経細胞は補間パラメータに対して異なった感受性を示すか?その感受性はテクスチャ空間幾何学の神経的符号化を反映しているか?
  • RQ3CNN活性化統計で定義されるテクスチャ空間の幾何学は、知覚的および神経的反応を予測できるか?
  • RQ4訓練済みと未訓練のCNNでは、補間経路の滑らかさと知覚的質にどのような差が生じるか?
  • RQ5平均および共分散という均質な特徴空間を用いることで、ポルチラ=シモネッリ法のような非均質な要約統計と比較して、テクスチャ知覚のモデリングが改善されるか?

主な発見

  • テクスチャのCNN活性化分布は、楕円分布でよく近似され、平均と共分散が十分統計量として適していることを裏付けた。
  • CNN活性化統計の空間における最適輸送による補間は、テクスチャ間で知覚的に滑らかな遷移を生じた。
  • 人間被験者では、MLDSプロトコルによる測定で補間の知覚的スケールが線形であったため、テクスチャ空間の一貫した知覚的サンプリングが示された。
  • V4の神経細胞は、スパイク数および完全なスパイク列の両方を用いて、補間パラメータの強い線形復号性能を示し、テクスチャ遷移の動的符号化を示した。
  • V1の神経細胞は補間パラメータの復号性能に有意差がなく、中間テクスチャ状態に対する感受性が低いことが示された。
  • 訓練済みCNNは未訓練のものよりも滑らかな補間経路を生成し、これらの経路は定常的かつ均質なテクスチャで構成されており、多様体の近似が向上していることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。