Skip to main content
QUICK REVIEW

[논문 리뷰] Divergent representations of ethological visual inputs emerge from supervised, unsupervised, and reinforcement learning

Grace W. Lindsay, Josh Merel|arXiv (Cornell University)|2021. 12. 03.
Neural dynamics and brain function인용 수 4
한 줄 요약

이 연구는 동일한 ResNet 아키텍처가 에고세트릭 비디오 데이터에서 지도학습, 비지도학습, 강화학습(RL)을 통해 학습한 시각적 표현을 비교한다. 표현 유사도 분석과 신경과학 기반 지표를 사용하여, RL로 학습된 네트워크가 다른 방법과는 다름없이 희박하고 고차원적인 표현을 형성하며, 이는 쥐의 시각皮질과 가장 유사한 것으로 나타났다. 이는 RL이 생물학적으로 타당하고 행동적으로 관련 있는 표현을 형성함을 시사한다.

ABSTRACT

Artificial neural systems trained using reinforcement, supervised, and unsupervised learning all acquire internal representations of high dimensional input. To what extent these representations depend on the different learning objectives is largely unknown. Here we compare the representations learned by eight different convolutional neural networks, each with identical ResNet architectures and trained on the same family of egocentric images, but embedded within different learning systems. Specifically, the representations are trained to guide action in a compound reinforcement learning task; to predict one or a combination of three task-related targets with supervision; or using one of three different unsupervised objectives. Using representational similarity analysis, we find that the network trained with reinforcement learning differs most from the other networks. Using metrics inspired by the neuroscience literature, we find that the model trained with reinforcement learning has a sparse and high-dimensional representation wherein individual images are represented with very different patterns of neural activity. Further analysis suggests these representations may arise in order to guide long-term behavior and goal-seeking in the RL agent. Finally, we compare the representations learned by the RL agent to neural activity from mouse visual cortex and find it to perform as well or better than other models. Our results provide insights into how the properties of neural representations are influenced by objective functions and can inform transfer learning approaches.

연구 동기 및 목표

  • 지도학습, 비지도학습, 강화학습이라는 서로 다른 학습 목적이 깊이 신경망에서 학습된 시각적 표현의 특성에 어떻게 영향을 미치는지 이해하기 위해.
  • 동일한 에고세트릭 시각 데이터를 사용하지만 다른 학습 목표로 학습된 네트워크의 표현적 구조를 비교하기 위해.
  • 강화학습으로 학습된 표현이 지도학습 또는 비지도학습 방법으로 학습된 표현보다 생물학적 신경 데이터와 더 잘 일치하는지 평가하기 위해.
  • 강화학습 에이전트에서 시각적 표현의 기능적 역할이 장기적 행동 계획 및 목표 탐색에 어떻게 기여하는지 조사하기 위해.

제안 방법

  • 동일한 에고세트릭 비디오 데이터셋(메렐 등, 2020)을 사용하여 동일한 ResNet 기반 모델 8개를 학습하였으며, 학습 목표만 다를 뿐이었다.
  • 모델 간 레이어 간 활성화 패턴을 비교하기 위해 표현 유사도 분석(RSA)을 적용하였다.
  • 신경과학 기반 지표인 표현의 희박성, 차원수, 입력 간 신경 활동 패턴의 다양성 등을 사용하였다.
  • 쥐의 시각皮질에서의 생체 내 신경 활동 기록과의 유사도를 비교하여 모델 성능을 평가하였다.
  • 세 가지 지도학습 목표(작업 관련 타겟 예측), 세 가지 비지도학습 목표(대조학습 포함), 그리고 복합 제어 과제를 위한 딥 강화학습 정책을 사용하여 모델을 학습하고 비교하였다.
  • 계층적 매칭 분석을 수행하여, 초기 네트워크 레이어가 초기 시각 피질 영역과 가장 잘 매칭되고, 후속 레이어가 고차원 영역과 매칭되는지 평가하였다.

실험 결과

연구 질문

  • RQ1동일한 에고세트릭 시각 입력에 노출되었을 때, 지도학습, 비지도학습, 강화학습을 통해 학습된 깊이 신경망의 표현적 특성에는 어떤 차이가 있는가?
  • RQ2강화학습 에이전트에서 유도된 표현이 쥐의 시각皮질에서 관찰된 표현과 어느 정도 일치하는가?
  • RQ3강화학습으로 학습된 모델의 표현이 희박성, 고차원성, 표현의 다양성 측면에서 다른 학습 방식과 어떻게 다를 수 있는가?
  • RQ4강화학습 에이전트의 표현이 장기적 행동 계획을 지원할 수 있는가? 이는 표현의 구조와 후속 영향을 통해 어떻게 확인할 수 있는가?
  • RQ5강화학습로 학습된 네트워크의 중간 레이어는 쥐의 시각 피질 영역의 층상 구조와 계층적으로 대응하는가?

주요 결과

  • 표현 유사도 분석을 통해 측정한 결과, 강화학습(RL)으로 학습된 모델의 표현은 다른 모델과 특히 깊은 레이어에서 가장 다름을 보였다.
  • RL 모델은 높은 희박성과 고차원 신경 활동 패턴을 보였으며, 개별 이미지가 서로 겹치지 않는 고유한 뉴런 집합을 활성화시켰다.
  • RL로 학습된 모델의 레이어 R2(Rod)가 쥐의 모든 시각 피질 영역에서 신경 활동과 가장 뛰어난 일치도를 보였으며, 비지도학습 모델 중 가장 우수한 성능을 기록했다.
  • RL 모델의 시각 인코더는 즉각적인 동작 제어를 위한 것이 아니라 장기적 계획 수립을 지원하는 데 기여했으며, 이는 실시간 시각 운동 제어를 넘어서는 功能적 역할을 함을 시사한다.
  • 학습 목표의 차이에도 불구하고, 비지도학습 대조학습(UnsCPC)은 일부 RL 표현 특성(희박성, 차원수)을 반영했지만, 전체적인 잠재적 특성의 복제에는 실패했다.
  • 계층적 표현 유사도 경향—즉, 초기 네트워크 레이어가 초기 시각 피질 영역과 매칭되고, 후속 레이어가 고차원 영역과 매칭되는 것—은 RL 모델에서도 관찰되었지만, 전체적으로 가장 뛰어난 일치는 레이어 R2 하나에 의해 주로 달성되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.