Skip to main content
QUICK REVIEW

[논문 리뷰] Training recurrent neural networks with sparse, delayed rewards for flexible decision tasks

Thomas Miconi|arXiv (Cornell University)|2015. 07. 31.
Neural Networks and Reservoir Computing참고 문헌 22인용 수 3
한 줄 요약

이 논문은 실시간 오차 신호나 전용 피드백 네트워크 없이 희소하고 지연된 보상만을 사용하여 순환 신경망(RNNs)을 훈련시키는 생물학적으로 타당한 보상 조절 히브시안 학습 규칙을 제안한다. 이 방법은 지연된 비일치-샘플 작업에서 RNN을 성공적으로 훈련시키며, 자극에 특화된 코드에서 반응에 특화된 코드로 변화하는 역동적인, 임무 관련 신경 표현을 생성한다. 이는 행동 중인 동물의皮질 활동과 유사하다.

ABSTRACT

Recurrent neural networks in the chaotic regime exhibit complex dynamics reminiscent of high-level cortical activity during behavioral tasks. However, existing training methods for such networks are either biologically implausible, or require a real-time continuous error signal to guide the learning process. This is in contrast with most behavioral tasks, which only provide time-sparse, delayed rewards. Here we show that a biologically plausible reward-modulated Hebbian learning algorithm, previously used in feedforward models of birdsong learning, can train recurrent networks based solely on delayed, phasic reward signals at the end of each trial. The method requires no dedicated feedback or readout networks: the whole network connectivity is subject to learning, and the network output is read from one arbitrarily chosen network cell. We use this method to successfully train a network on a delayed nonmatch to sample task (which requires memory, flexible associations, and non-linear mixed selectivities). Using decoding techniques, we show that the resulting networks exhibit dynamic coding of task-relevant information, with neural encodings of various task features fluctuating widely over the course of a trial. Furthermore, network activity moves from a stimulus-specific representation to a response-specific representation during response time, in accordance with neural recordings in behaving animals for similar tasks. We conclude that recurrent neural networks, trained with reward-modulated Hebbian learning, offer a plausible model of cortical dynamics during learning and performance of flexible association.

연구 동기 및 목표

  • 실시간 오차 신호 없이도 RNN을 훈련시킬 수 있는 생물학적으로 타당한 학습 규칙을 개발하기 위해.
  • 모든 시험 후에만 희소하고 파동형의 보상 신호로 복잡하고 영리한 결정 과제를 학습할 수 있도록 RNN을 가능하게 하기 위해.
  • 전용 피드백 또는 읽기 출력 네트워크 없이 모든 연결을 유연하게 학습시킬 수 있도록 하기 위해.
  • 이러한 네트워크가 행동 중인 뇌의 기록에서 관찰된 것과 유사한 역동적이고 임무 관련 신경 코드를 보일 수 있는지 조사하기 위해.
  • 보상 조절 히브시안 학습이 기억, 비선형 연관성, 영리한 행동을 수행할 수 있는 네트워크를 생성할 수 있는지 입증하기 위해.

제안 방법

  • 이 방법은 보상 조절 히브시안 학습 규칙을 사용하며, 시냅스 가중치 변화는 전시냅스 활동, 후시냅스 활동 및 지연된 보상 신호의 곱에 따라 결정된다.
  • 네트워크는 기억과 영리한 연관성을 요구하는 지연된 비일치-샘플 과제에서 훈련되며, 보상은 각 시험의 끝에서만 제공된다.
  • 출력은 네트워크 내에서 임의로 선택된 하나의 뉴런에서 읽어내어 별도의 읽기 출력 또는 피드백 메커니즘의 필요성을 제거한다.
  • 모든 네트워크 연결, 특히 순환 연결까지도 학습 대상이 되어 보상 피드백만으로도 전체 엔드 투 엔드 훈련이 가능하다.
  • 역동적인 임무 특징 표현을 시간에 따라 분석하기 위해 복원 기법을 사용하여 뉴런 코드의 변화를 밝혀낸다.
  • 백프로파게이션 또는 실시간 오차 신호 없이 학습 규칙을 구현하여 생물학적 타당성과의 호환성을 확보한다.

실험 결과

연구 질문

  • RQ1생물학적으로 타당한 보상 조절 히브시안 학습 규칙이 실시간 오차 신호 없이도 지연되고 희소한 보상만으로 복잡하고 영리한 결정 과제를 수행할 수 있도록 RNN을 훈련시킬 수 있는가?
  • RQ2결과로 도출된 네트워크가 시험 도중 자극에 특화된 표현에서 반응에 특화된 표현으로 변화하는 역동적 신경 코드를 보일 수 있는가?
  • RQ3전용 피드백 또는 읽기 출력 네트워크 없이도 네트워크가 비선형 혼합 선택성과 지연 기간 동안의 기억을 유지할 수 있는가?
  • RQ4이러한 행동 과제에서 관찰된 뇌피질 기록과 비교했을 때 네트워크의 내부 표현은 어떻게 유사한가?
  • RQ5지속적인 오차 신호 없이도 단지 파동형 보상 신호만으로 RNN에서 영리한 연관성 학습을 달성할 수 있는가?

주요 결과

  • 네트워크는 각 시험의 끝에서만 희소하고 파동형의 보상 신호만을 사용하여 지연된 비일치-샘플 과제를 성공적으로 학습했다.
  • 신경 활동은 시험 도중 자극에 특화된 표현에서 반응에 특화된 표현으로 변화하는 역동적인 방식으로 임무 관련 정보를 인코딩했다.
  • 네트워크는 비선형 혼합 선택성과 지연 기간 동안의 기억을 유지하며 영리한 결정 행동을 보였다.
  • 복원 분석을 통해 임무 특징이 네트워크 활동의 변동성이 큰 시간에 따라 변화하는 패턴으로 표현되고 있음을 확인했다.
  • 학습 규칙은 피드백 또는 읽기 출력 네트워크 없이도 전체 엔드 투 엔드 훈련을 가능하게 했으며, 모든 연결이 보상 조절 히브시안 유연성에 의해 학습되었고, 유연성이 보장되었다.
  • 결과로 도출된 네트워크의 역학은 유사한 과제를 수행하는 행동 중인 동물의 뇌피질 기록에서 관찰된 것과 유사하게 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.