Skip to main content
QUICK REVIEW

[논문 리뷰] New Reinforcement Learning Using a Chaotic Neural Network for Emergence of "Thinking" - "Exploration" Grows into "Thinking" through Learning -

Katsunari Shibata, Yuki Goto|arXiv (Cornell University)|2017. 05. 16.
Neural Networks and Applications참고 문헌 5인용 수 6
한 줄 요약

이 논문은 외부 랜덤성 없이 내재된 혼돈 동역학을 통해 탐색을 생성하는 혼돈 신경망(ChNN)을 사용하는 새로운 강화학습 프레임워크를 제안한다. 이는 학습된 이성적 전이를 통해 '사고'-유사 행동을 가능하게 한다. 방법은 인과 추적과 시간 차이 오차를 사용하여 가중치를 갱신하며, 2차원 로봇 작업에서 장애물 회피 학습이 성공적으로 이루어졌고, 탐색 능력 향상과 목표 향한 행동이 부상하는 결과를 보였다.

ABSTRACT

Expectation for the emergence of higher functions is getting larger in the framework of end-to-end reinforcement learning using a recurrent neural network. However, the emergence of "thinking" that is a typical higher function is difficult to realize because "thinking" needs non fixed-point, flow-type attractors with both convergence and transition dynamics. Furthermore, in order to introduce "inspiration" or "discovery" in "thinking", not completely random but unexpected transition should be also required. By analogy to "chaotic itinerancy", we have hypothesized that "exploration" grows into "thinking" through learning by forming flow-type attractors on chaotic random-like dynamics. It is expected that if rational dynamics are learned in a chaotic neural network (ChNN), coexistence of rational state transition, inspiration-like state transition and also random-like exploration for unknown situation can be realized. Based on the above idea, we have proposed new reinforcement learning using a ChNN as an actor. The positioning of exploration is completely different from the conventional one. The chaotic dynamics inside the ChNN produces exploration factors by itself. Since external random numbers for stochastic action selection are not used, exploration factors cannot be isolated from the output. Therefore, the learning method is also completely different from the conventional one. At each non-feedback connection, one variable named causality trace takes in and maintains the input through the connection according to the change in its output. Using the trace and TD error, the weight is updated. In this paper, as the result of a recent simple task to see whether the new learning works or not, it is shown that a robot with two wheels and two visual sensors reaches a target while avoiding an obstacle after learning though there are still many rooms for improvement.

연구 동기 및 목표

  • 강화학습에서 '사고'의 부상 문제를 해결하기 위해, 영감 유사 동역학을 가진 이성적이고 다단계 상태 전이를 정의한다.
  • 기존 강화학습의 한계를 극복하기 위해, 탐색을 위해 외부 랜덤 노이즈에 의존하고 수렴성 및 전이 동역학을 형성하기 어려운 점을 해결한다.
  • 순환 신경망에서 혼돈 이터내시의 특성을 활용하여 계획 및 발견과 같은 고차원 인지 기능의 부상을 가능하게 한다.
  • 탐색, 학습, 이성적 의사결정을 통합한 유일한 결정론적 프레임워크 내에서 학습 메커니즘을 개발한다.

제안 방법

  • 학습자-비평가 아키텍처로 혼돈 신경망(ChNN)을 사용하며, 내부 혼돈 동역학이 외부 랜덤 노이즈 없이 자연스럽게 탐색을 생성한다.
  • 각 연결에 인과 추적 $ C_{ji} $ 를 도입하여 입력-출력 관계를 추적하며, 출력 변화에 따라 갱신된다: $ C^{[l]}_{ji,t} = (1 - | abla x^{[l]}_{j,t}|)C^{[l]}_{ji,t-1} + abla x^{[l]}_{j,t} x^{[l-1]}_{i,t} $.
  • 가중치 갱신은 시간 차이(TD) 오차와 인과 추적을 사용한다: $ abla w^{[l]}_{ji,t} = heta \cdot \hat{r}_t \cdot C^{[l]}_{ji,t} $, 여기서 $ \theta $ 는 학습률이다.
  • 비평가 네트워크는 가치 함수를 추정하고, 학습자 네트워크는 내부 ChNN 동역학에 기반하여 행동을 생성한다.
  • 학습 후에도 양의 리아푸노프 지수로 확인된 바와 같이, 시스템은 혼돈 동역학을 유지한다.
  • 출력에서 탐색이 분리되지 않으며, 대신 ChNN의 동역학에서 유기적으로 탄생하여 이성적 상태와 탐색적 상태 사이의 적응적 전이가 가능하다.

실험 결과

연구 질문

  • RQ1신경망 내부의 내재된 혼돈 동역학이 이성적이고 다단계 상태 전이와 같은 '사고'-유사 행동의 부상을 지원할 수 있는가?
  • RQ2탐색을 학습 과정에 통합할 수 있는가? 이는 외부 주입이 아닌, 체계적이고 목표 향한 행동으로 진화해야 한다.
  • RQ3인과 추적은 비선형이고 혼돈적인 시스템에서 입력-출력 의존성을 효과적으로 포착할 수 있는가? 이는 강화학습에서 책임 할당에 기여한다.
  • RQ4학습 중 시스템은 얼마나 오랫동안 혼돈 동역학을 유지하는가? 이는 행동의 적응 가능성에 어떤 영향을 미치는가?
  • RQ5인과 추적과 TD 오차에 기반한 결정론적 학습 규칙이 복잡한 주행 과제에서 기존의 확률적 탐색 방식을 능가할 수 있는가?

주요 결과

  • 로봇은 20×20 격자에서 목표에 도달하면서 장애물을 회피하는 데 성공했으며, 이는 제안된 방법이 복잡한 환경에서 효과적인 주행을 가능하게 한다는 것을 보여준다.
  • 목표에 도달하는 데 걸리는 평균 단계 수가 에피소드가 진행되면서 감소하여, 효과적인 학습과 정책 성능 향상을 나타낸다.
  • 학습이 진행됨에 따라 탐색이 자동으로 감소하여, 감소하는 탐색 비율에 의존하지 않고도 체계적인 행동이 내재화되었음을 시사한다.
  • 학습자 네트워크는 비균일한 뉴런 활성화를 보였으며, 많은 뉴런이 ±0.5에 포화 상태에 도달하여 강력하고 구조적인 동역학이 존재함을 나타낸다.
  • 리아푸노프 지수는 양수(0.0 이상)로 유지되어, 학습 기간 동안 시스템이 혼돈 성질을 유지함을 확인하였으며, 이는 지속적인 탐색과 적응 가능성에 기여한다.
  • 환경 조건이 변화할 경우 리아푸노프 지수가 再상승하여 혼돈 동역학 재활성화가 이루어졌으며, 이는 새로운 상황에 대한 적응을 지원할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.