Skip to main content
QUICK REVIEW

[논문 리뷰] IMPACT: Importance Weighted Asynchronous Architectures with Clipped Target Networks

Michael Luo, Jiahao Yao|arXiv (Cornell University)|2019. 11. 30.
Reinforcement Learning in Robotics참고 문헌 15인용 수 8
한 줄 요약

IMPACT는 분산 강화학습 알고리즘을 제안하며, 중요도 가중치가 부여된 비동기적 경험 수집과 잘라내기 타겟 네트워크를 결합하여 학습을 안정화하고 배치당 다중 SGD 스텝을 가능하게 하여, 이는 이질적이고 연속적인 제어 환경에서 PPO 수준의 샘플 효율성을 유지하면서도 IMPALA 대비 최대 30% 빠른 학습을 달성한다.

ABSTRACT

The practical usage of reinforcement learning agents is often bottlenecked by the duration of training time. To accelerate training, practitioners often turn to distributed reinforcement learning architectures to parallelize and accelerate the training process. However, modern methods for scalable reinforcement learning (RL) often tradeoff between the throughput of samples that an RL agent can learn from (sample throughput) and the quality of learning from each sample (sample efficiency). In these scalable RL architectures, as one increases sample throughput (i.e. increasing parallelization in IMPALA), sample efficiency drops significantly. To address this, we propose a new distributed reinforcement learning algorithm, IMPACT. IMPACT extends IMPALA with three changes: a target network for stabilizing the surrogate objective, a circular buffer, and truncated importance sampling. In discrete action-space environments, we show that IMPACT attains higher reward and, simultaneously, achieves up to 30% decrease in training wall-time than that of IMPALA. For continuous control environments, IMPACT trains faster than existing scalable agents while preserving the sample efficiency of synchronous PPO.

연구 동기 및 목표

  • 분산 강화학습에서 샘플 처리량과 샘플 효율성 사이의 상충 관계를 해결한다.
  • 정책 업데이트가 동기화되지 않은 비동기 학습 환경에서 PPO의 서면 목적 함수를 안정화한다.
  • 비동기 아키텍처에서 배치당 다중 SGD 스텝을 가능하게 하되 학습 안정성이나 샘플 효율성을 떨어뜨리지 않는다.
  • 실시간 학습 효율성을 향상시키면서도 이질적 및 연속 제어 작업에서 동기 PPO의 샘플 효율성을 유지한다.

제안 방법

  • 비동기 학습에서 PPO 서면 목적 함수를 안정화하기 위해 타겟 네트워크를 도입하여 큰 정책 업데이트를 방지하는 신뢰 영역을 생성한다.
  • 비동기적으로 수집된 경험을 저장하기 위해 원형 버퍼를 사용하여 제어된 재현과 실시간 성능 및 샘플 효율성의 균형을 이룬다.
  • 오프-폴리시 업데이트에서 분포 이탈을 보정하기 위해 잘라낸 중요도 샘플링을 적용하여 학습 안정성을 향상시킨다.
  • 타겟 네트워크에서 안정화된 목적 함수를 활용해 런처에서 배치당 다중 SGD 스텝을 허용한다.
  • 타겟 네트워크를 이용해 이득과 가치 추정치를 계산하여 정책 평가를 주 정책 업데이트에서 분리한다.
  • 런처가 원형 버퍼에서 샘플을 추출하도록 설계하여 지연된 경험을 고려한 효율적이고 안정적인 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1비동기 분산 RL 환경에서 다중 SGD 스텝을 허용하기 위해 안정된 서면 목적 함수를 유지할 수 있는가?
  • RQ2원형 버퍼의 사용이 실시간 처리량과 샘플 효율성 사이의 상충 관계에 어떤 영향을 미치는가?
  • RQ3중요도 가중치가 부여된 잘라낸 타겟 네트워크가 샘플 효율성을 희생시키지 않고 학습 속도를 얼마나 향상시킬 수 있는가?
  • RQ4다양한 환경에서 IMPACT가 PPO 및 IMPALA와 비교해 벽시계 시간과 샘플 효율성 측면에서 어떻게 성능을 내는가?
  • RQ5이질적 대비 연속 제어 작업에서 최적의 성능을 내기 위한 하이퍼파rameter 설정(예: 버퍼 크기, 재현 길이)은 무엇인가?

주요 결과

  • IMPACT는 이질적 제어 환경에서 IMPALA 대비 최대 30% 빠른 학습 벽시계 시간을 기록하면서도 샘플 효율성을 유지하거나 향상시킨다.
  • 연속 제어 작업(Hopper, Humanoid, HalfCheetah)에서 IMPACT는 기존의 확장 가능한 에이전트보다 더 빠르게 학습되며, 동기 PPO의 샘플 효율성을 그대로 유지한다.
  • 연속 제어에서 N=16 및 K=20로 설정된 원형 버퍼는 재현 이점과 처리량 사이의 균형을 잘 맞춰 뛰어난 성능을 보인다.
  • 이질적 제어에서는 N=1 및 K=2 설정이 최적의 결과를 낳으며, 이는 이러한 환경에서 최신 경험의 가치가 재현된 경험보다 더 높다는 것을 시사한다.
  • IMPACT는 워커 수가 증가함에 따라 잘 스케일링되며, 높은 워커 수에서는 수익 감소로 인해 성능 향상 폭이 줄어든다.
  • 제거 실험 결과, 타겟 네트워크와 중요도 가중치는 비동기 환경에서 안정적이고 효율적인 학습을 위해 필수적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.