Skip to main content
QUICK REVIEW

[論文レビュー] Divergent representations of ethological visual inputs emerge from supervised, unsupervised, and reinforcement learning

Grace W. Lindsay, Josh Merel|arXiv (Cornell University)|Dec 3, 2021
Neural dynamics and brain function被引用数 4
ひとこと要約

本研究は、エゴセントリック動画データ上で、教師あり学習、教師なし学習、強化学習(RL)によって訓練された同一のResNetアーキテクチャが学習する視覚的表現を比較する。表現類似度解析と神経科学にインspiredされた指標を用いて、RLで訓練されたネットワークは、他の手法とは顕著に異なる疎で高次元の表現を獲得しており、マウス視覚皮質と最も一致することが判明した。これは、RLが生物学的に妥当で行動に関連する表現を形成することを示唆している。

ABSTRACT

Artificial neural systems trained using reinforcement, supervised, and unsupervised learning all acquire internal representations of high dimensional input. To what extent these representations depend on the different learning objectives is largely unknown. Here we compare the representations learned by eight different convolutional neural networks, each with identical ResNet architectures and trained on the same family of egocentric images, but embedded within different learning systems. Specifically, the representations are trained to guide action in a compound reinforcement learning task; to predict one or a combination of three task-related targets with supervision; or using one of three different unsupervised objectives. Using representational similarity analysis, we find that the network trained with reinforcement learning differs most from the other networks. Using metrics inspired by the neuroscience literature, we find that the model trained with reinforcement learning has a sparse and high-dimensional representation wherein individual images are represented with very different patterns of neural activity. Further analysis suggests these representations may arise in order to guide long-term behavior and goal-seeking in the RL agent. Finally, we compare the representations learned by the RL agent to neural activity from mouse visual cortex and find it to perform as well or better than other models. Our results provide insights into how the properties of neural representations are influenced by objective functions and can inform transfer learning approaches.

研究の動機と目的

  • 教師あり、教師なし、強化学習という異なる学習目的が、深層ニューラルネットワークにおける学習済み視覚的表現の性質に与える影響を理解すること。
  • 同じエゴセントリック視覚データで訓練され、同一のアーキテクチャを用いたネットワークの表現構造を比較すること。
  • 強化学習で訓練された表現が、教師ありまたは教師なし手法のものよりも生物学的神経データとどれほどよく一致するかを評価すること。
  • 視覚的表現が強化学習エージェントにおける長期的行動計画および目的志向行動に果たす機能的役割を調査すること。

提案手法

  • 同じエゴセントリック動画データセット(Merel et al., 2020)を用いて、同一のResNetベースのモデルを8つ訓練し、訓練目的のみで異なる。
  • ネットワーク間の活性化パターンの類似度を比較するために表現類似度解析(RSA)を適用した。
  • 神経科学にインspiredされた指標(表現の疎らかさ、次元数、入力ごとの神経活動パターンの多様性)を用いた。
  • マウス視覚皮質からの生体内神経活動記録と比較することで、モデルの性能を評価した。
  • 3つの教師あり目的(タスク関連のターゲット予測)、3つの教師なし目的(対照的学習を含む)、1つの深層強化学習ポリシー(複合制御タスク用)を用いてモデルを訓練・比較した。
  • 階層的マッチング解析を実施し、ネットワークの初期層が視覚皮質の初期領域に、後続の層が高次領域に最もよく一致するかを評価した。

実験結果

リサーチクエスチョン

  • RQ1同じエゴセントリック視覚入力にさらされた場合、教師あり、教師なし、強化学習で訓練された深層ニューラルネットワークの表現的性質は、どのように異なるか?
  • RQ2強化学習エージェントの表現は、マウス視覚皮質で観察されたものとどの程度一致するか?
  • RQ3強化学習で訓練されたモデルの表現は、疎らかさ、高次元性、または表現の多様性といった特徴を示しており、他の訓練手法とは明確に区別されるか?
  • RQ4強化学習エージェントの表現は、構造的特徴と下流への影響によって、長期的行動計画を支援できるか?
  • RQ5強化学習で訓練されたネットワークの中間層は、マウス視覚皮質領域の層状構造と階層的に対応しているか?

主な発見

  • 表現類似度解析による測定において、強化学習(RL)で訓練されたモデルの表現は、他のモデルと顕著に異なり、特に深層部の層で顕著であった。
  • RLモデルは高い疎らかさと高次元の神経活動パターンを示し、個々の画像が重複のない特定のニューロン集合を活性化していた。
  • RLで訓練されたモデル(RLRod)の層R2が、マウスの全視覚皮質領域において、神経活動と最もよく一致した。これは、最良の教師なしモデルでさえも上回った。
  • RLモデルの視覚エンコーダは、主に即時の行動制御に使われているのではなく、長期的計画を支援する機能的役割を果たしていることが示唆された。
  • 訓練目的の違いにもかかわらず、教師なし対照的学習(UnsCPC)は、疎らかさと次元数といったRL表現の一部の特徴を捉えていたが、全般的な発現的性質を再現できなかった。
  • 初期層が初期視覚皮質領域に、後続層が高次領域に一致するという表現類似度の階層的傾向は、RLモデルでも観察されたが、全領域で最も良い一致は層R2が担っていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。