[논문 리뷰] Jointly Pre-training with Supervised, Autoencoder, and Value Losses for Deep Reinforcement Learning.
이 논문은 깊이 강화 학습을 위한 경량형 통합 사전 훈련 방법을 제안하며, 감독 분류, 오토에인코드르 복원, 기대 수익 손실을 결합하여 특징 학습을 향상시킵니다. 최소한의 인간 시범을 기반으로 A3C 에이전트를 사전 훈련함으로써, 이전 방법보다 훨씬 적은 환경 상호작용으로 Pong과 MsPacman과 같은 아케이드 게임에서 최신 기술 수준의 성능을 달성합니다.
Deep Reinforcement Learning (DRL) algorithms are known to be data inefficient. One reason is that a DRL agent learns both the feature and the policy tabula rasa. Integrating prior knowledge into DRL algorithms is one way to improve learning efficiency since it helps to build helpful representations. In this work, we consider incorporating human knowledge to accelerate the asynchronous advantage actor-critic (A3C) algorithm by pre-training a small amount of non-expert human demonstrations. We leverage the supervised autoencoder framework and propose a novel pre-training strategy that jointly trains a weighted supervised classification loss, an unsupervised reconstruction loss, and an expected return loss. The resulting pre-trained model learns more useful features compared to independently training in supervised or unsupervised fashion. Our pre-training method drastically improved the learning performance of the A3C agent in Atari games of Pong and MsPacman, exceeding the performance of the state-of-the-art algorithms at a much smaller number of game interactions. Our method is light-weight and easy to implement in a single machine. For reproducibility, our code is available at this http URL
연구 동기 및 목표
- 사전 훈련을 통해 사전 지식을 통합하여 딥 강화 학습의 데이터 효율성을 향상시키기.
- 제한된 비전문가 인간 시범을 활용해 异동 강화 학습(A3C) 에이전트의 학습을 가속화하기.
- 특징 표현 학습을 향상시키는 가벼운, 단일 머신에서 구현 가능한 사전 훈련 프레임워크 개발하기.
- 기존 방법보다 샘플 효율성을 높이면서도 아케이드 환경에서 강력한 성능 유지를 달성하기.
제안 방법
- 이 방법은 세 가지 손실 구성 요소를 동시에 최적화합니다: 정책 가이드를 위한 감독 분류 손실, 특징 학습을 위한 비감독 복원 손실, 가치 추정을 위한 기대 수익 손실.
- 표준 A3C 강화 학습으로의 피지테이닝 이전에 공유된 신경망 아키텍처에 대해 사전 훈련을 적용합니다.
- 정책, 표현, 가치 학습을 균형 있게 조정하기 위해 세 가지 손실의 가중 조합을 사용해 엔드 투 엔드로 모델을 훈련합니다.
- 인간 시범은 감독 신호로 사용되며, 오토에인코드르 구성 요소는 관측값을 복원하여 불변 특징을 학습합니다.
- 기대 수익 손실은 궤적에서 계산되어 정책 네트워크가 높은 수익 행동으로 향하도록 이끕니다.
- 최종 사전 훈련된 정책는 환경 상호작용을 통해 표준 A3C 업데이트로 피지테이닝됩니다.
실험 결과
연구 질문
- RQ1다양한 유형의 손실을 통합한 사전 훈련이 DRL에서 특징 표현과 샘플 효율성을 향상시킬 수 있는가?
- RQ2감독, 오토에인코드르, 가치 손실을 통합하는 것과 각각의 손실을 별도로 사전 훈련하는 것과의 비교에서 어떤가?
- RQ3최소한의 비전문가 인간 시범이 아케이드 게임에서 A3C 에이전트의 학습을 얼마나 가속화할 수 있는가?
- RQ4제안된 방법이 더 적은 환경 상호작용으로 최신 기술 수준의 베이스라인보다 뛰어난 성능을 달성할 수 있는가?
주요 결과
- 통합 사전 훈련 방법은 표준 A3C와 기본 사전 훈련 방법에 비해 아케이드 게임 Pong과 MsPacman에서 학습 성능을 크게 향상시켰습니다.
- 상당히 적은 게임 상호작용으로도 최신 기술 수준의 알고리즘을 초월한 성능을 달성했습니다.
- 단지 감독 또는 비감독 목표로 훈련된 모델보다 사전 훈련된 모델이 더 유용한 특징을 학습했습니다.
- 최소한의 계산 오버헤드로 강력한 성능을 달성했으며, 단일 머신에서 쉽게 구현할 수 있었습니다.
- 감독, 복원, 기대 수익 손실을 모두 통합한 결과, 어떤 단일 손실 사전 훈련보다 더 우수한 일반화 성능을 보였습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.