Skip to main content
QUICK REVIEW

[논문 리뷰] The Utility of Sparse Representations for Control in Reinforcement Learning

Vincent Liu, Raksha Kumaraswamy|arXiv (Cornell University)|2018. 11. 15.
Reinforcement Learning in Robotics참고 문헌 29인용 수 9
한 줄 요약

이 논문은 분포 정규화 기반 정규화자—특히 Set KL—를 사용하여 딥 강화학습에서 희소하고 국소화된 표현을 학습하는 새로운 방법인 희소 표현 신경망(SR-NN)을 제안한다. 활성화 분포를 통해 낮고 안정적인 노드 활동을 촉진함으로써 SR-NN은 치명적 간섭을 감소시키고 환경 간에 제어 성능을 향상시킨다. 이는 증분 학습 환경에서 표준 밀집 네트워크와 이전의 희소 학습 방법보다 뛰어난 성능을 보인다.

ABSTRACT

We investigate sparse representations for control in reinforcement learning. While these representations are widely used in computer vision, their prevalence in reinforcement learning is limited to sparse coding where extracting representations for new data can be computationally intensive. Here, we begin by demonstrating that learning a control policy incrementally with a representation from a standard neural network fails in classic control domains, whereas learning with a representation obtained from a neural network that has sparsity properties enforced is effective. We provide evidence that the reason for this is that the sparse representation provides locality, and so avoids catastrophic interference, and particularly keeps consistent, stable values for bootstrapping. We then discuss how to learn such sparse representations. We explore the idea of Distributional Regularizers, where the activation of hidden nodes is encouraged to match a particular distribution that results in sparse activation across time. We identify a simple but effective way to obtain sparse representations, not afforded by previously proposed strategies, making it more practical for further investigation into sparse representations for reinforcement learning.

연구 동기 및 목표

  • 희소 표현이 강화학습에서 증분 정책 학습에 개선을 가져오는지 조사하는 것.
  • 밀집 신경망 표현이 증분 RL에서 치명적 간섭으로 인해 실패하는 이유를 규명하는 것.
  • 신경망을 사용하여 희소 표현을 학습하기 위한 실용적이고 확장 가능한 방법을 개발하는 것.
  • 희소성의 영향을 제어 과업에서 부트스트랩 안정성과 정책 성능에 미치는 영향을 평가하는 것.
  • 기존의 희소 표현 학습 방법들과 비교하여 SR-NN의 성능을 평가하는 것.

제안 방법

  • 숨은 레이어 활성화에서 희소성을 강제하기 위해 분포 정규화 기반 정규화자를 사용하는 희소 표현 신경망(SR-NN)을 제안한다.
  • 시간에 걸쳐 희소하고 국소화된 활성화 패턴을 장려하기 위해 Set KL 발산 정규화자를 적용한다.
  • 각 은닉 유닛의 활성화 분포를 희소 목표 분포와 일치시키기 위해 수정된 학습 목표를 사용한다.
  • 부트스트랩을 위한 안정적인 가치 추정을 유지하기 위해 온라인 증분 학습 중 정규화자를 적용한다.
  • ℓ1/ℓ2 정규화, k-희소, WTA-NN과 같은 대안 방법들과 비교하며, ReLU 및 시그모이드 활성화 함수를 사용한다.
  • 클래식한 제어 도메인에서 성능을 평가하기 위해 함수 근사와 함께 Sarsa(0)를 적용한다.

실험 결과

연구 질문

  • RQ1신경망 표현에서 희소성을 강제하면 증분 강화학습에서 제어 성능이 향상되는가?
  • RQ2밀집 표현이 증분 RL에서 실패하는 이유는 무엇이며, 희소성은 이를 어떻게 완화하는가?
  • RQ3Set KL과 같은 분포 정규화자가 외부 샘플 문제 없이 희소하고 안정적인 표현을 효과적으로 학습할 수 있는가?
  • RQ4SR-NN은 기존의 희소 표현 학습 방법들과 비교해 희소성과 성능 측면에서 어떻게 다른가?
  • RQ5희소성은 부트스트랩 기반 강화학습 알고리즘에서 치명적 간섭을 어느 정도 감소시키는가?

주요 결과

  • SR-NN은 희소 표현을 학습하는 데 있어 표준 밀집 신경망보다 모든 테스트 도메인—물결 월드, 마운틴 카, 캐처—에서 뚜렷한 성능 향상을 보였다.
  • KL 정규화자와 함께 시그모이드 활성화를 사용할 경우 의미 있는 희소성은 생성되지 않으며, 이는 밀집 활성화 패턴과 열악한 성능을 초래한다.
  • ReLU에 지수 분포 정규화자를 적용한 경우 높은 인스턴스 희소성(2–3%)과 안정적인 성능을 달성했으며, 활성화에 대해 ℓ2 정규화를 적용한 결과도 대부분의 도메인에서 SR-NN과 유사한 성능을 보였다.
  • k-희소-NN과 WTA-NN 방법은 이론적으로는 유리하지만, 사라진 유닛과 낮은 희소성 제어로 인해 효과적이지 않다.
  • 히트맵 분석 결과 SR-NN은 국소화되고 희소한 활성화 패턴을 생성하는 반면, SIG+KL과 같은 기준 방법은 거의 모든 은닉 유닛을 입력에 대해 활성화한다.
  • 결과는 희소성이 부트스트랩 과정에서 안정적인 가치 추정을 유지함으로써 치명적 간섭을 감소시키며, 특히 단일 작업 및 순차적 학습 환경에서 효과적이라는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.