Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning applied to Single Neuron

Zhipeng Wang, Ming Bo Cai|arXiv (Cornell University)|2015. 05. 15.
Reinforcement Learning in Robotics참고 문헌 5인용 수 4
한 줄 요약

이 논문은 각 신경세포를 독립된 에이전트로 모델링하여, 고전적 거래 샘플링과 정책 그래디언트 방법을 사용해 시냅스 가중치를 최적화함으로써 누적 전역 보상의 최대화를 목표로 다중 에이전트 시스템에 강화학습을 적용한다. 알고리즘은 공명 감지에 적합한 5개 신경세포 네트워크에서는 성공적으로 수렴하지만, 고차원 보상 지도에서 높은 차원의 보상 지도로 인해 더 큰 50개 신경세포의 운동 제어 시스템에서는 수렴에 실패한다.

ABSTRACT

This paper extends the reinforcement learning ideas into the multi-agents system, which is far more complicated than the previously studied single-agent system. We studied two different multi-agents systems. One is the fully-connected neural network consists of multiple single neurons. Another one is the simplified mechanical arm system which is controlled by multiple neurons. We suppose that each neuron is like an agent and it can do Gibbs sampling of the posterior probability of stimulus features. The policy is optimized in a way that the cumulative global rewards are maximized. The algorithm for the second system is based on the same idea but we incorporate the physics model into the constraints. The simulation results show that for the first system our algorithm converges well. For the second system it does not converge well in a reasonable simulation time length. In summary, we took the initial endeavor to study the reinforcement learning for multi-agents system. The computational complexity is always an issue and significant amount of works have to be done in order to better understand the problem.

연구 동기 및 목표

  • 신경세포를 독립된 에이전트로 모델링하여 단일 에이전트에서 다중 에이전트 시스템으로 강화학습을 확장하는 것.
  • 정책 그래디언트 방법을 사용해 순환 신경망의 시냅스 가중치를 최적화하는 학습 알고리즘 개발.
  • 완전히 연결된 신경망과 단순화된 기계 팔 제어 시스템에 이 프레임워크를 테스트하는 것.
  • 고차원 신경 정책 공간에서의 계산적 과제와 수렴 행동을 조사하는 것.

제안 방법

  • 각 신경세포는 자가상관을 갖는 가우시안 과정로 모델링된 시냅스 가중치 분포에 대해 고전적 거래 샘플링을 수행하는 에이전트로 작동한다.
  • 할인 누적 보상에 기반한 기울기 상승 규칙을 사용하여 시냅스 가중치를 업데이트하며, 이는 식 (3)에 의해 추정된다.
  • 전역 보상은 목표 신경세포 간의 스파ike 수 상관관계 또는 내적곱으로 정의되어, 원하는 활동 패턴을 촉진한다.
  • 보상은 시간에 따른 가중 평균으로 처리되며, 학습률 β는 가중치 분포의 평균을 조정한다.
  • 알고리즘은 신경세포의 순차적 또는 동시 샘플링 및 업데이트를 허용하여 수렴 속도와 보상 기여 정확도 사이의 균형을 이룬다.
  • 기계 팔 과제에서는 물리 모델이 운동을 제약하며, 보상 함수는 의도한 각도와 관측된 각도 간의 상관관계를 측정한다.

실험 결과

연구 질문

  • RQ1강화학습이 각각 독립된 에이전트로 작동하는 단일 신경세포 네트워크에 효과적으로 적용될 수 있는가?
  • RQ2시냅스 가중치의 고전적 거래 샘플링을 통한 제안된 정책 그래디언트 방법이 순환 신경망에서 전역 보상을 최적화하는 데 어떻게 작용하는가?
  • RQ3더 큰, 더 복잡한 신경 시스템, 예를 들어 운동 제어 네트워크와 같은 경우 알고리즘이 수렴 성질을 어떻게 보이는가?
  • RQ4간단한 네트워크에서는 성공했지만 기계 팔 제어 과제에서는 알고리즘이 수렴하지 못하는 이유는 무엇인가?

주요 결과

  • 알고리즘이 5개 신경세포 네트워크에서 성공적으로 수렴하였으며, 신경세포 2번이 신경세포 1번으로부터 강한 입력 가중치를 확보하여 스파이크 수 상관관계를 높였다.
  • 다른 신경세포들은 활동을 최소화하기 위해 입력 가중치를 크게 감소시켰으며, 보상 함수에서 어떤 스파이크도 처벌로 간주되기 때문이다.
  • 50개 신경세포의 운동 제어 시스템에서는 기대 보상이 시간이 지남에 따라 증가했지만, 합리적인 시뮬레이션 시간 내에 수렴하지 못했다.
  • 기계 팔 과제에서의 실패는 보상 지도의 고차원성으로 인해 최적화가 어려워졌기 때문으로 추정된다.
  • 저자들은 보상 함수를 하위 구성요소로 분해함으로써 경쟁을 줄이고 수렴을 향상시킬 수 있을 것이라고 제안한다.
  • 이 방법은 네트워크 구조에 대한 사전 가정이 필요 없으며, 초기화 단계부터 완전히 연결된 네트워크에 적용될 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.