Skip to main content
QUICK REVIEW

[논문 리뷰] Playing Atari with Six Neurons

Giuseppe Cuccu, Julian Togelius|arXiv (Cornell University)|2018. 06. 04.
Reinforcement Learning in Robotics참고 문헌 30인용 수 15
한 줄 요약

이 논문은 딥 강화학습에서 특징 추출과 정책 학습을 분리하는 새로운 방법을 제안하며, 두 가지 새로운 알고리즘인 증가하는 사전 벡터 양자화(Increasing Dictionary Vector Quantization, IDVQ)와 직접 잔차 희소 코딩(Direct Residuals Sparse Coding, DRSC)을 사용해 원시 아케이트 게임 프레임에서 압축되고 정보가 풍부한 표현을 생성한다. 단지 6~18개의 뉴런을 가진 매우 작은 신경망이 표준 딥 강화학습 접근 방식보다 파arameter 수를 두 배수 정도 줄여가며 여러 아케이트 게임에서 최신 기준 성능을 달성한다.

ABSTRACT

Deep reinforcement learning, applied to vision-based problems like Atari games, maps pixels directly to actions; internally, the deep neural network bears the responsibility of both extracting useful information and making decisions based on it. By separating the image processing from decision-making, one could better understand the complexity of each task, as well as potentially find smaller policy representations that are easier for humans to understand and may generalize better. To this end, we propose a new method for learning policies and compact state representations separately but simultaneously for policy approximation in reinforcement learning. State representations are generated by an encoder based on two novel algorithms: Increasing Dictionary Vector Quantization makes the encoder capable of growing its dictionary size over time, to address new observations as they appear in an open-ended online-learning context; Direct Residuals Sparse Coding encodes observations by disregarding reconstruction error minimization, and aiming instead for highest information inclusion. The encoder autonomously selects observations online to train on, in order to maximize code sparsity. As the dictionary size increases, the encoder produces increasingly larger inputs for the neural network: this is addressed by a variation of the Exponential Natural Evolution Strategies algorithm which adapts its probability distribution dimensionality along the run. We test our system on a selection of Atari games using tiny neural networks of only 6 to 18 neurons (depending on the game's controls). These are still capable of achieving results comparable---and occasionally superior---to state-of-the-art techniques which use two orders of magnitude more neurons.

연구 동기 및 목표

  • 정책 학습을 결정 내리는 과정에서 특징 추출을 분리함으로써 아케이트 게임에서 극히 작은 신경망으로도 정책 학습이 가능할지 조사하기 위해.
  • 종합적인 딥 강화학습에서 특징 추출과 정책 학습이 하나의 고성능 네트워크에 혼합되어 발생하는 한계를 해결하기 위해.
  • 재구성 오차 최소화에 의존하지 않고도 온라인으로, 개방형으로 압축되고 희소한 표현을 학습할 수 있는 방법을 개발하기 위해.
  • 효율적이고 적응형 특징 인코더와 짝을 이룬 작은 정책 네트워크가 경쟁 가능한 성능을 낼 수 있음을 보여주기 위해.
  • 시각 기반 강화학습 과제에서 복잡한 종단 간 딥 네트워크가 반드시 필요하다는 기존의 관념을 도전하기 위해.

제안 방법

  • 환경 상호작용 도중 새로운 시각적 특징이 나타날 때마다 관측 공간 내 중심점의 사전을 점진적으로 증가시키는 온라인 알고리즘인 증가하는 사전 벡터 양자화(Increasing Dictionary Vector Quantization, IDVQ)를 도입한다.
  • 재구성 오차 최소화가 아니라 정보 포함 최대화를 목표로 하는 직접 잔차 희소 코딩(Direct Residuals Sparse Coding, DRSC)을 적용하여, 어떤 중심점이 관련 정보를 포함하고 있는지를 나타내는 이진 코드를 생성한다.
  • 정책 네트워크의 입력 차원을 동적으로 증가시키기 위해 진화하는 사전 크기를 활용하며, 이는 입력 차원이 시간에 따라 변화하는 다변량 가우시안 분포의 차원을 적응적으로 조정하는 전문화된 변형인 지수 자연 진화 전략(Exponential Natural Evolution Strategies)에 의해 처리된다.
  • 에이전트의 환경 상호작용에서 관련 관측치를 선택함으로써 인코더를 자율적으로 훈련시켜 새로운 시각 패턴에 지속적으로 적응하도록 보장한다.
  • 단일층 신경망 정책을 사용하며, 뉴런 수가 6~18개에 불과한 정책 네트워크를 신경진화 알고리즘으로 훈련하여 압축된 코드에서 행동으로 매핑한다.
  • 현재 인코딩의 잔차에서 새로운 중심점을 구성함으로써 코드의 희소성과 정보 완전성 사이의 균형을 유지하며, 재구성 오류의 잔여물은 무시한다.

실험 결과

연구 질문

  • RQ1효율적이고 별도의 특징 인코더와 짝을 이룬 정책 네트워크에 6~18개의 뉴런만을 사용해도 아케이트 게임에서 경쟁 가능한 성능을 낼 수 있는가?
  • RQ2재구성 오차 최소화 없이도 압축되고 정보가 풍부한 시각적 표현을 학습할 수 있으며, 이는 정책 성능 향상으로 이어지는가?
  • RQ3사전에 환경에 대한 지식 없이도 온라인으로 개방형으로 시각적 관측치가 점점 더 복잡해지는 데에 적응할 수 있는 특징 학습 시스템은 가능한가?
  • RQ4특징 학습과 정책 학습을 분리함으로써 종단 간 딥 러닝에 비해 더 작고 해석 가능하며 잠재적으로 더 일반화 가능한 정책를 얻을 수 있는가?
  • RQ5고품질의 희소하고 정보가 풍부한 표현이 제공될 경우, 최소한의 신경망 정책이 다양한 아케이트 게임에 얼마나 잘 일반화되는가?

주요 결과

  • 제안된 방법은 정책 네트워크에 단지 6~18개의 뉴런만을 사용해 여러 아케이트 게임에서 최신 기준 성능을 달성한다. 이는 표준 딥 강화학습 기준 대비 파arameter 수가 두 배수 정도 줄어든 것이다.
  • 전략적 사고와 정밀한 타이밍이 요구되는 Qbert와 같은 도전적인 게임에서 더 뛰어나거나 동등한 성능을 기록한다.
  • DRSC와 IDVQ의 사용으로 재구성 오차 최소화 없이도 효과적인 특징 추출이 가능함을 입증하였으며, 정책 학습에 있어 정보 완전성이 완벽한 재구성보다 더 중요하다는 것을 보여준다.
  • 훈련 도중 새로운 시각 패턴에 적응하기 위해 인코더가 자율적으로 새로운 관측치를 선택하고 학습함으로써 개방형 온라인 방식으로 지속적인 적응이 가능하다.
  • 지수 자연 진화 전략의 변형이 입력 차원의 증가를 성공적으로 관리하여 분포의 차원을 시간에 따라 적응시킴으로써 진화하는 정책의 안정적인 훈련을 가능하게 하였다.
  • 대규모 서버 팩토리 없이도 일반 하드웨어에서 경쟁 가능한 결과를 달성하였으며, 재현 가능성을 위해 소스 코드가 공개되어 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.