Skip to main content
QUICK REVIEW

[논문 리뷰] Learning sparse representations in reinforcement learning

Jacob Rafati, David C. Noelle|arXiv (Cornell University)|2019. 09. 04.
Neural dynamics and brain function참고 문헌 24인용 수 5
한 줄 요약

이 논문은 강화학습에서 인공 신경망에 k-윈너스-테이크-올 (kWTA) 메커니즘을 도입하여 희박하고 분산된 내부 표현을 학습함으로써 고전적 제어 과제인 풀들 월드, 마운틴카, 애크로봇에서 표준 백프로파게이션을 사용하는 TD 학습이 실패하는 상황에서도 성능을 크게 향상시킨다. 이 방법은 횡방향 억제를 활용하여 일반화와 패턴 분리 사이의 균형을 이루며, 치명적인 간섭을 감소시켜 이전에는 해결이 어려웠던 환경에서도 성공적인 학습을 가능하게 한다.

ABSTRACT

Reinforcement learning (RL) algorithms allow artificial agents to improve their selection of actions to increase rewarding experiences in their environments. Temporal Difference (TD) Learning -- a model-free RL method -- is a leading account of the midbrain dopamine system and the basal ganglia in reinforcement learning. These algorithms typically learn a mapping from the agent's current sensed state to a selected action (known as a policy function) via learning a value function (expected future rewards). TD Learning methods have been very successful on a broad range of control tasks, but learning can become intractably slow as the state space of the environment grows. This has motivated methods that learn internal representations of the agent's state, effectively reducing the size of the state space and restructuring state representations in order to support generalization. However, TD Learning coupled with an artificial neural network, as a function approximator, has been shown to fail to learn some fairly simple control tasks, challenging this explanation of reward-based learning. We hypothesize that such failures do not arise in the brain because of the ubiquitous presence of lateral inhibition in the cortex, producing sparse distributed internal representations that support the learning of expected future reward. The sparse conjunctive representations can avoid catastrophic interference while still supporting generalization. We provide support for this conjecture through computational simulations, demonstrating the benefits of learned sparse representations for three problematic classic control tasks: Puddle-world, Mountain-car, and Acrobot.

연구 동기 및 목표

  • 풀들 월드, 마운틴카, 애크로봇와 같은 단순 제어 과제에서 신경망 함수 근사기와 함께 사용할 때 시간차 (TD) 학습이 실패하는 문제를 해결하기 위해.
  • 피어 cortical 횡방향 억제에서 영감을 얻은 희박하고 결합된 신경 표현이 치명적인 간섭을 방지하고 학습 안정성을 향상시킬 수 있는지 조사하기 위해.
  • 뇌가 TD 학습 실패를 알고리즘적 변화가 아니라 횡방향 억제에 의해 가능해지는 희박한 코딩을 통해 피하는지에 대한 가설을 검증하기 위해.
  • 신경망 내 k-윈너스-테이크-올 (kWTA) 메커니즘이 모델-프리 강화학습에서 안정적인 가치 함수 근사에 기여하는 희박한 표현을 생성할 수 있는지 평가하기 위해.
  • 표준 백프로파게이션 기반 네트워크가 실패하는 곳에서 희박한 표현이 성공적인 학습을 가능하게 하는지, 심지어 단순한 아키텍처를 사용할 때도 확인하기 위해.

제안 방법

  • 저자들은 히든 레이어에 kWTA 메커니즘을 적용한 피드포워드 신경망을 사용하여 상태-행동 가치 함수 근사기 구현하였다. 이는 희박성을 강제하기 위함이다.
  • kWTA 메커니즘은 각 입력에 대해 정확히 k개의 활성 뉴런을 선택함으로써 횡방향 억제를 통해 희박하고 분산된 표현을 촉진하며, 피어 미세 회로의 역동성을 모방한다.
  • 학습은 경험 리플레이와 타겟 네트워크를 사용한 SARSA 알고리즘을 통해 수행되며, 가치 함수는 신경망의 출력을 통해 근사된다.
  • 이 방법은 동일한 초모수를 사용하여 세 가지 고전적 제어 과제인 풀들 월드, 마운틴카, 애크로봇에서 평가된다.
  • 성능은 세 가지 네트워크 유형 간 비교된다: 선형 (히든 레이어 없음), 표준 백프로파게이션 (일반), kWTA 기반 네트워크이며, 학습 및 테스트 단계는 분리되어 있다.
  • 테스트 동안 가중치는 동결되고 탐색이 허용되지 않으며, 평균 TD 오차와 목표에 도달하는 데 걸리는 단계 수를 통해 일반화 능력을 측정한다.

실험 결과

연구 질문

  • RQ1k-윈너스-테이크-올 (kWTA)을 통해 강제된 희박한 분산 표현이 신경망과 함께 사용할 때 TD 학습이 실패하는 단순 제어 과제에서 문제를 해결할 수 있는가?
  • RQ2신경 회로의 횡방향 억제(즉, kWTA로 모의됨)가 가치 함수 근사에서 더 나은 일반화를 가능하게 하며 치명적인 간섭을 최소화할 수 있는가?
  • RQ3희박한 표현이 비선형 가치 함수를 가진 환경에서 모델-프리 강화학습의 학습 안정성과 수렴성을 향상시키는가?
  • RQ4kWTA 메커니즘이 생물학적 시스템(예: 중뇌 도파민계)이 인공 네트워크가 실패하는 강화학습 과제에서 성공하는 이유를 설명할 수 있는가?
  • RQ5표준 백프로파게이션 네트워크와 kWTA 네트워크 사이의 성능 격차는 향상된 패턴 분리 때문인가, 아니면 향상된 일반화 때문인가?

주요 결과

  • kWTA 기반 네트워크는 애크로봇 제어 과제에서 최적의 정책을 성공적으로 학습했으며, 선형 네트워크와 표준 백프로파게이션 네트워크 모두 최적 성능에 수렴하지 못했다.
  • 풀들 월드 과제에서 kWTA 네트워크는 일반 네트워크보다 유의미하게 낮은 평균 TD 오차와 더 적은 목표 도달 단계를 기록했으며, 일반 네트워크는 높은 불안정성과 나쁜 수렴성을 보였다.
  • 마운틴카 과제에서 kWTA 네트워크는 더 빠른 수렴과 낮은 TD 오차를 보였고, 훈련 런 간 일관된 성능을 유지했으며, 반면 일반 네트워크는 자주 학습에 실패했다.
  • 테스트 결과, 훈련 후 유일하게 kWTA 네트워크만 낮은 TD 오차와 최소한의 목표 도달 단계를 유지하여 안정적인 일반화와 안정적인 가치 함수 근사 능력을 보였다.
  • 표준 백프로파게이션 네트워크는 성능에 높은 변동성이 있었고, 자주 발산했으며, 특히 비선형 가치 함수를 가진 환경에서 일반화 능력이 떨어졌다.
  • 결과는 횡방향 억제를 통해 강제된 희박한 표현이 고차원적이고 비선형적인 환경에서 안정적이고 효과적인 TD 학습을 위해 필수적이라는 가설을 지지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.