Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking Value Function Learning for Generalization in Reinforcement Learning

Seungyong Moon, JunYeong Lee|arXiv (Cornell University)|2022. 10. 18.
Domain Adaptation and Few-Shot Learning인용 수 4
한 줄 요약

이 논문은 관찰적 일반화를 향상시키기 위해 가치 네트워크의 학습 빈도를 정책 네트워크보다 낮게 설정함으로써 기억화를 줄이고 샘플 효율성을 향상시키는 모델-프리(policy-free) 정책 그래디언트 알고리즘인 지연-크리틱 정책 그래디언트(DCPG)를 제안한다. 또한 단일 판별자로 동시에 정방향 및 역방향 동역학을 최적화하는 통합된 자기지도 동역학 학습 작업을 도입하여 프로크젠 벤치마크에서 SOTA 성능을 달성하며, PPO 정규화 테스트 점수 202.2 ± 10.2를 기록한다.

ABSTRACT

Our work focuses on training RL agents on multiple visually diverse environments to improve observational generalization performance. In prior methods, policy and value networks are separately optimized using a disjoint network architecture to avoid interference and obtain a more accurate value function. We identify that a value network in the multi-environment setting is more challenging to optimize and prone to memorizing the training data than in the conventional single-environment setting. In addition, we find that appropriate regularization on the value network is necessary to improve both training and test performance. To this end, we propose Delayed-Critic Policy Gradient (DCPG), a policy gradient algorithm that implicitly penalizes value estimates by optimizing the value network less frequently with more training data than the policy network. This can be implemented using a single unified network architecture. Furthermore, we introduce a simple self-supervised task that learns the forward and inverse dynamics of environments using a single discriminator, which can be jointly optimized with the value network. Our proposed algorithms significantly improve observational generalization performance and sample efficiency on the Procgen Benchmark.

연구 동기 및 목표

  • 값 네트워크가 훈련 데이터를 기억하는 경향이 있는 다중 환경 강화학습에서 관찰적 과적합을 해결하기 위해.
  • 정규화를 통해 값 네트워크의 기억화를 줄임으로써 시각적으로 다양한 환경에서 훈련 및 테스트 성능을 향상시키기 위해.
  • 정책, 가치, 동역학 네트워크를 아키텍처 분리 없이 통합된 단일 네트워크 아키텍처로 공동 최적화할 수 있는 통합형 단일 네트워크 아키텍처를 개발하기 위해.
  • 단일 판별자를 사용한 자기지도 동역학 학습 목표를 통해 샘플 효율성과 일반화를 향상시키기 위해.
  • 지연된 가치 업데이트와 동역학 학습이 상호보완적으로 작용하여 프로크젠 벤치마크에서 성능 향상에 기여하는지 입증하기 위해.

제안 방법

  • 값 네트워크의 업데이트 빈도를 정책 네트워크보다 낮게 설정함으로써 값 추정에 암묵적인 페널티를 주고 기억화를 줄이는 DCPG라는 정책 그래디언트 알고리즘을 제안한다.
  • 정책 네트워크와 가치 네트워크를 별도로 유지하지 않는 단일 통합 네트워크 아키텍처를 사용하여 간섭을 방지한다.
  • 단일 판별자를 사용하여 정방향 및 역방향 동역학을 동시에 학습하는 자기지도 작업을 도입하고, 복합 손실 함수를 적용한다.
  • 이중 목표를 적용한다: 정책 업데이트를 위한 클리핑된 서rogate 정책 목표와 훈련 안정화를 위한 지연된 가치 함수 업데이트.
  • 판별자가 실제 전이(st, at, st+1)와 가짜 전이(st, ˆat, st+1) 또는 (st, at, ˆst+1)를 올바르게 분류하도록 하는 동역학 손실을 적용한다.
  • 값 네트워크가 정책 네트워크보다 덜 자주 업데이트되지만, 더 많은 훈련 데이터를 사용하는 지연된 크리틱 업데이트 스케줄을 적용한다.

실험 결과

연구 질문

  • RQ1값 네트워크의 업데이트 빈도를 낮추는 것이 다중 환경 강화학습에서 기억화를 완화시키는가?
  • RQ2단일 통합 네트워크 아키텍처가 간섭 없이 정책, 가치, 동역학 네트워크를 효과적으로 학습시킬 수 있는가?
  • RQ3단일 판별자를 사용한 정방향 및 역방향 동역학의 공동 학습이 상태 표현과 일반화를 향상시키는가?
  • RQ4지연된 가치 업데이트의 성능 향상 효과가 자기지도 동역학 학습과 상호보완적인가?
  • RQ5DCPG는 프로크젠 벤치마크에서 관찰적 일반화와 샘플 효율성 면에서 SOTA 성능을 달성할 수 있는가?

주요 결과

  • DCPG는 프로크젠 벤치마크에서 PPO 정규화 테스트 점수 184.5 ± 5.2를 기록하여 PPO(160.3 ± 6.3)와 PPG(171.7 ± 4.9)를 상당히 앞서며 성능을 뛰어넘었다.
  • DCPG에 정방향 및 역방향 동역학 학습을 통합한 변종 DDCPG는 PPO 정규화 테스트 점수 202.2 ± 10.2를 기록하여 프로크젠에서 새로운 SOTA를 수립했다.
  • 정방향 동역학 판별자가 잘못 분류한 이방향(OOD) 행동 수는 DCPG+F에서 7.05 ± 1.47에서 DDCPG로 감소하여 0.74 ± 0.75로 줄었으며, 행동 인식 기반의 동역학 이해가 향상됨을 보여준다.
  • 개별 판별자를 사용하는 것에 비해 단일 판별자를 사용한 통합된 동역학 학습은 OOD 행동 오분류를 감소시켜 행동 정보를 더 효과적으로 활용함을 시사한다.
  • 지연된 가치 업데이트와 동역학 학습의 조합은 상호보완적인 성능 향상을 가져왔으며, DDCPG는 DCPG와 DPPG 모두를 테스트 성능에서 앞서며 성능을 뛰어넘었다.
  • RLiable를 사용한 통계 분석 결과, DDCPG는 모든 지표(중앙값, IQM, 평균)에서 95% 신뢰구간 내로 PPG를 유의미하게 뛰어넘었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.