Skip to main content
QUICK REVIEW

[논문 리뷰] DAQN: Deep Auto-encoder and Q-Network

Daiki Kimura|arXiv (Cornell University)|2018. 06. 02.
Reinforcement Learning in Robotics참고 문헌 31인용 수 14
한 줄 요약

이 논문은 복잡한 환경에서 학습 시도 횟수를 줄이기 위해 컨volutional auto-encoder를 사용해 딥 Q-네트워크를 사전 학습하는 DAQN이라는 딥 강화학습 방법을 제안한다. 레이블이 없는 시각 데이터에서 학습된 특징으로 Q-네트워크를 초기화함으로써, 노이즈가 많고 고복잡도의 이미지를 갖는 실제 로봇 작업에서 표준 DQN에 비해 2.5배 빠른 학습을 달성한다.

ABSTRACT

The deep reinforcement learning method usually requires a large number of training images and executing actions to obtain sufficient results. When it is extended a real-task in the real environment with an actual robot, the method will be required more training images due to complexities or noises of the input images, and executing a lot of actions on the real robot also becomes a serious problem. Therefore, we propose an extended deep reinforcement learning method that is applied a generative model to initialize the network for reducing the number of training trials. In this paper, we used a deep q-network method as the deep reinforcement learning method and a deep auto-encoder as the generative model. We conducted experiments on three different tasks: a cart-pole game, an atari game, and a real-game with an actual robot. The proposed method trained efficiently on all tasks than the previous method, especially 2.5 times faster on a task with real environment images.

연구 동기 및 목표

  • 노이즈가 많고 고복잡도의 시각 입력을 갖는 실제 로봇 환경에서 딥 강화학습을 위한 학습 시도 횟수를 줄이기.
  • 각 동작이 손상 위험이 있고 보상이 인간의 간섭이 필요한 실제 로봇 학습에서의 높은 샘플 및 상호작용 비용 문제를 해결하기.
  • 생성 모델(자동에코더)을 사용한 사전 학습이 딥 Q-네트워크의 샘플 효율성 향상에 기여하는지 탐색하기.
  • 모의 게임과 실제 로봇 작업을 포함한 다양한 환경에서 사전 학습의 효과를 입증하기.
  • 특히 노이즈가 많거나 복잡한 시각 설정에서 자동에코더 사전 학습이 딥 강화학습 성능 향상에 기여하는 조건을 명확히 하기.

제안 방법

  • 랜덤 정책 또는 환경 관찰을 통해 수집한 레이블이 없는 시각 입력에 대해 컨volutional auto-encoder를 학습시키며, 동작이나 보상 정보가 필요하지 않다.
  • 학습된 인코더를 사용해 딥 Q-네트워크의 특징 추출 레이어를 초기화하고, 표준적인 랜덤 초기화를 대체한다.
  • 자동에코더의 디코더 구성 요소를 제거하고, DQN 프레임워크 내에서 이산 동작 출력을 위한 새로운 완전 연결 레이어를 추가한다.
  • 표준 경험 재현 및 타겟 네트워크 기법을 사용해 초기화된 DQN을 미세 조정하여 최적의 정책을 학습한다.
  • 자동에코더가 학습한 표현을 활용해 고복잡도 이미지의 공간적 및 구조적 특징을 포착함으로써 일반화 능력과 수렴 속도 향상.
  • 최적의 사전 학습 및 강화학습 단계를 위해 하이퍼파ram터를 조정하여 이전 연구에서 관찰된 열악한 성능을 방지한다.

실험 결과

연구 질문

  • RQ1생성 모델(자동에코더)을 사용해 딥 Q-네트워크를 사전 학습하면, 딥 강화학습에서 요구되는 학습 에피소드 수를 상당히 줄일 수 있는가?
  • RQ2노이즈가 많거나 변동성이 큰 입력을 갖는 고복잡도 시각 환경, 예를 들어 실제 로봇 작업에서 자동에코더 사전 학습이 더 큰 이점을 제공하는가?
  • RQ3모의 및 실제 환경에서 DAQN의 샘플 효율성은 표준 DQN에 비해 어떻게 비교되는가?
  • RQ4사전 학습 데이터의 품질과 다양성이 사전 학습 단계 성공에 어떤 역할을 하는가?
  • RQ5이전 DQN에서 자동에코더 사전 학습을 尝시한 결과 실패한 이유는 무엇이며, DAQN은 이러한 한계를 어떻게 극복하는가?

주요 결과

  • 실제로 암초-가위-보 로봇 작업에서 DAQN은 표준 DQN에 비해 학습 수렴 속도가 2.5배 빠르게 나타나 상당한 샘플 효율성 향상을 입증했다.
  • 배경 노이즈와 변동성이 있는 실제 로봇 시각 입력을 갖는 고복잡도 시각 환경에서 요구되는 학습 시도 횟수를 감소시켰다.
  • 행동나 보상 정보 없이 수집한 레이블이 없는 데이터에 대해 컨volutional auto-encoder를 사용한 사전 학습이 정책 학습을 가속화하는 강력한 인덕티브 바이어스를 제공했다.
  • 단지 사전 학습된 자동에코더의 첫 번째 레이어만 복사한 이전 방법보다 더 우수한 성능을 보였으며, 전체 네트워크 전이가 더 효과적임을 입증했다.
  • 이 방법은 모의 카트폴 태스크, 아케이드 게임, 실제 로봇 게임을 포함한 세 가지의 서로 다른 환경에서 효과적이었으며, 광범위한 적용 가능성을 확인했다.
  • 사전 학습의 성공은 전체 자동에코더 네트워크 사용과 적절한 하이퍼파ram터 조정에 의존했으며, 이는 이전 연구의 한계를 해결한 바탕이 되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.