Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised deep learning identifies semantic disentanglement in single inferotemporal neurons

Irina Higgins, Le Chang|arXiv (Cornell University)|Jun 25, 2020
Face Recognition and Perception参考文献 52被引用数 15
ひとこと要約

本研究では、サルの腹側側顔皮質(IT)における顔視認時に得られた神経応答に、深層教師なし生成モデル $\beta$-VAE を適用し、単一のITニューロンが性別や髪の長さといった意味的に解釈可能な分離要因を符号化していることを明らかにした。モデルはわずか数個のニューロンからの信号のみで新しい顔を再構築でき、ITニューロンが分離された潜在要因に整合した低次元で解釈可能な符号を支えることを示した。

ABSTRACT

Deep supervised neural networks trained to classify objects have emerged as popular models of computation in the primate ventral stream. These models represent information with a high-dimensional distributed population code, implying that inferotemporal (IT) responses are also too complex to interpret at the single-neuron level. We challenge this view by modelling neural responses to faces in the macaque IT with a deep unsupervised generative model, beta-VAE. Unlike deep classifiers, beta-VAE "disentangles" sensory data into interpretable latent factors, such as gender or hair length. We found a remarkable correspondence between the generative factors discovered by the model and those coded by single IT neurons. Moreover, we were able to reconstruct face images using the signals from just a handful of cells. This suggests that the ventral visual stream may be optimising the disentangling objective, producing a neural code that is low-dimensional and semantically interpretable at the single-unit level.

研究の動機と目的

  • 単一の洞側顔皮質(IT)ニューロンが、顔画像の変動要因として意味的に解釈可能な分離された要因(性別や髪の長さなど)を符号化しているかどうかを検証すること。
  • 従来の見解である「ITにおける解釈可能な符号化は集団的コードに限る」という仮説に反論するため、個々のニューロンが教師なし生成モデルから得られる分離された潜在ユニットと一致するかどうかを調査すること。
  • 教師ありまたは従来のモデルと比較して、$\beta$-VAE を用いた教師なし表現学習が、単一ニューロンの応答をよりよく説明できるかどうかを評価すること。
  • 少数の記録済みITニューロンからの信号のみを用いて、新しい顔画像を再構築する可能性を評価すること。

提案手法

  • 2,100枚の自然な顔画像の鏡像反転版を用いて $\beta$-VAE を学習させ、分離された潜在表現を学習した。
  • 線形回帰を用いて、$\beta$-VAE の単一の潜在ユニットから個々のITニューロンの応答を復元し、ニューロンと潜在ユニットの対応付けを可能にした。
  • 複数のベースライン(自己符号化器(AE)、変分自己符号化器(VAE)、VGG(PCAまたは生の特徴)、PCA、ICA、AAM)と比較して、$\beta$-VAE の性能を評価した。
  • 各ニューロンが単一の潜在ユニットとどれほど相関しているか、およびユニットの割り当てがどれほど多様であるかを評価するため、相関比とユニット比率スコアを測定した。
  • 単一ニューロンからの復元潜在ユニットを用いて、新しい顔画像を再構築し、実際の潜在応答と再構築された応答との間のコサイン距離を評価指標とした。
  • Welschのt検定を用いて、モデル間の対応する適合度および再構築性能の差の有意性を評価した。

実験結果

リサーチクエスチョン

  • RQ1サルの洞側顔皮質における単一のITニューロンは、性別や髪の長さといった意味的に意味のある分離要因を符号化しているか?
  • RQ2教師なし生成モデル(例:$\beta$-VAE)の単一の潜在ユニットが、教師ありまたは従来のモデルと比較して、単一ITニューロンの応答をよりよく説明できるか?
  • RQ3分離された生成モデルを用いて、わずか数個の単一ITニューロンからの信号のみで、新しい顔画像を再構築することは可能か?
  • RQ4$\beta$-VAE が単一ニューロン応答を説明する性能は、深層分類器、自己符号化器、および手作業で設計されたモデル(例:AAM)と比較してどうか?

主な発見

  • $\beta$-VAE は、すべてのベースラインモデルと比較して顕著に高い平均相関比スコアを達成しており、各ITニューロンの応答が、たった一つの分離された潜在ユニットと強く相関していることを示している。
  • $\beta$-VAE は、すべてのベースラインと比較して顕著に高い平均ユニット比率スコアを示しており、異なるニューロンが多様な潜在ユニットによって復元されていることから、分離性が裏付けられている。
  • $\beta$-VAE を用いて12個の単一ITニューロンからの信号のみで新しい顔を再構築したが、27〜30個のニューロンを必要とするベースラインより優れた性能を示し、実際の潜在応答と再構築された応答との間のコサイン距離が顕著に低かった。
  • $\beta$-VAE の潜在ユニットは、人間による属性アノテーションによって検証されたように、性別や髪の長さといった既知の意味的要因と顕著な一致を示した。
  • 「ゴールドスタンダード」として用いられたAAMモデルですら、適合度および再構築性能の両面で $\beta$-VAE に劣っており、顔構造に特化して手作業で設計されたにもかかわらず同様の結果となった。
  • 統計的検定により、$\beta$-VAE がすべてのベースラインを有意に上回る性能を示していることが確認された(p < 0.01)、これにより本研究の結果の堅牢性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。