Skip to main content
QUICK REVIEW

[論文レビュー] Transforming Neural Network Visual Representations to Predict Human Judgments of Similarity

Maria Attarian, Brett D. Roads|arXiv (Cornell University)|Oct 13, 2020
Visual Attention and Saliency Detection参考文献 26被引用数 6
ひとこと要約

この論文は、画像の類似性に関する人間の判断をよりよく予測するため、深層ニューラルネットワークの視覚埋め込みに線形変換を適用する手法を提案している。一般線形変換(単純な拡大変換よりも優れている)を適用し、非対称な類似性判断を許容することで、二値選択の予測精度をベースラインの67.8%から90.3%まで向上させ、従来の手法を著しく上回り、人間の類似性認識が本質的に非対称であることを明らかにした。

ABSTRACT

Deep-learning vision models have shown intriguing similarities and differences with respect to human vision. We investigate how to bring machine visual representations into better alignment with human representations. Human representations are often inferred from behavioral evidence such as the selection of an image most similar to a query image. We find that with appropriate linear transformations of deep embeddings, we can improve prediction of human binary choice on a data set of bird images from 72% at baseline to 89%. We hypothesized that deep embeddings have redundant, high (4096) dimensional representations; however, reducing the rank of these representations results in a loss of explanatory power. We hypothesized that the dilation transformation of representations explored in past research is too restrictive, and indeed we found that model explanatory power can be significantly improved with a more expressive linear transform. Most surprising and exciting, we found that, consistent with classic psychological literature, human similarity judgments are asymmetric: the similarity of X to Y is not necessarily equal to the similarity of Y to X, and allowing models to express this asymmetry improves explanatory power.

研究の動機と目的

  • 画像類似性に関する人間の心理的埋め込みと深層ニューラルネットワークの視覚表現を一致させること。
  • 変換された深層埋め込みを用いて、人間の二値類似性選択を予測することを改善すること。
  • AからBへの類似性とBからAへの類似性が異なるという非対称な類似性判断が、人間の認識をよりよく捉えられるかどうかを調査すること。
  • 一般線形変換と拡大変換などの制限付き変換(例:拡大)の間で、人間の類似性をモデル化する際の有効性を評価すること。
  • 非常に過パラメータ化された線形モデルが、人間の判断を予測する際に過学習を起こすかどうかを特定すること。

提案手法

  • 4096次元のVGG-16深層埋め込みに一般線形変換を適用し、人間の類似性判断をよりよく予測できる空間にマッピングする。
  • 二つの画像間の類似性は、二重線形形式としてモデル化される:ŝ_ij = z_i^T W z_j、ここでWは学習された重み行列である。
  • 予測された類似性スコアと人間がアノテートしたスコアとの間の二乗誤差を損失関数として用い、過学習を防ぐためにL2正則化を適用する。
  • 類似性関数の対称版と非対称版の両方を評価し、方向性のある比較を可能にする。
  • アブレーションスタディでは、埋め込み次元(k=2048, 4096)と変換タイプ(拡大、一般線形、非負)の違いによる性能を比較する。
  • 汎用性のテストとして、訓練時に使わなかったトリプレットおよび画像を用い、ゼロショットおよび少数ショットの転移性を評価する。

実験結果

リサーチクエスチョン

  • RQ1一般線形変換を用いることで、元の埋め込みと比較して、人間の二値類似性選択の予測精度が顕著に向上するか?
  • RQ2類似性判断の対称性制約を緩和することで、人間データへのモデルの適合度が向上するか?
  • RQ3一般線形変換を用いることで得られる性能向上が、単純な拡大変換を用いる場合と比較して統計的に有意であるか?
  • RQ4線形変換における過パラメータ化が、人間の判断を予測する際に過学習を引き起こすか?
  • RQ5訓練時に見られなかった新しい画像に対してもモデルは一般化できるか?

主な発見

  • 提案手法は、生のVGG-16特徴を用いたベースラインの67.8%から比べて、人間の二値類似性選択の予測精度を90.3%まで向上させた。
  • 一般線形変換は、先行研究で用いられた拡大変換ですら顕著に上回り、高いモデル容量を持つ場合でさえも同様の優位性を示した。
  • 類似性の対称性制約を緩和することでモデル適合度が向上し、人間の類似性判断が本質的に非対称であるという強い証拠が得られた。
  • 訓練時に使わなかった画像に対してもモデルの汎用性は高く、性能はわずかに低下したが、手法間の相対順位は維持された。
  • 最大で185:1のパラメータ対学習例比を持つ過パラメータ化された線形モデルでも過学習が発生しなかったため、線形性がノイズへのフィットを制限する能力を持つことが示唆された。
  • 2048次元の埋め込みで最も高い性能が達成されたため、次元削減が解釈力に悪影響を及えないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。