Skip to main content
QUICK REVIEW

[논문 리뷰] A Deeper Look at Discounting Mismatch in Actor-Critic Algorithms

Shangtong Zhang, Romain Laroche|arXiv (Cornell University)|2020. 10. 02.
Reinforcement Learning in Robotics참고 문헌 49인용 수 5
한 줄 요약

이 논문은 이론적으로 일관성을 권장하는 바에도 불구하고, 일반적으로 액터-크리틱 강화학습에서 크리틱은 할인률을 적용하지만(\gamma_{\text{c}} < 1), 액터 업데이트에서는 할인률을 생략하는 관행(\gamma_{\text{a}} = 1)을 조사한다. 표현 학습 관점에서 이 불일치가 할인되지 않은 설정에서는 편향-분산-표현의 상호보완적 트레이드오프를 유리하게 만들며, 할인된 설정에서는 효과적인 보조 과제로 작용함을 보이며, 제어된 환경에서의 실험적 검증을 통해 이를 입증한다.

ABSTRACT

We investigate the discounting mismatch in actor-critic algorithm implementations from a representation learning perspective. Theoretically, actor-critic algorithms usually have discounting for both actor and critic, i.e., there is a $γ^t$ term in the actor update for the transition observed at time $t$ in a trajectory and the critic is a discounted value function. Practitioners, however, usually ignore the discounting ($γ^t$) for the actor while using a discounted critic. We investigate this mismatch in two scenarios. In the first scenario, we consider optimizing an undiscounted objective $(γ= 1)$ where $γ^t$ disappears naturally $(1^t = 1)$. We then propose to interpret the discounting in critic in terms of a bias-variance-representation trade-off and provide supporting empirical results. In the second scenario, we consider optimizing a discounted objective ($γ&lt; 1$) and propose to interpret the omission of the discounting in the actor update from an auxiliary task perspective and provide supporting empirical results.

연구 동기 및 목표

  • 이론적으로 일관성을 권장하는 바에도 불구하고, 널리 퍼져 있는 관행인 할인된 크리틱(\gamma_{\text{c}} < 1)을 사용하면서도 액터 업데이트에서는 할인률을 생략하는 것(\gamma_{\text{a}} = 1)의 경험적 이점을 조사하는 것.
  • 특히 편향, 분산, 표현 능력 간의 트레이드오프에 미치는 영향을 고려하여, 표현 학습 관점에서 이 불일치를 이해하는 것.
  • 액터 업데이트에서 할인률을 생략하는 것이 할인된 목표에서 정책 학습을 향상시키는 데 효과적인 보조 과제로 작용하는지 평가하는 것.
  • 진정한 목표가 할인된 경우에도, 편향이 있는 설정(\gamma_{\text{a}} = 1, \gamma_{\text{c}} < 1)이 편향이 없는 설정(\gamma_{\text{a}} = \gamma_{\text{c}} = \gamma < 1)보다 함수 근사 설정에서 성능이 뛰어나다는 경험적 증거를 제공하는 것.

제안 방법

  • 저자들은 두 가지 별개의 시나리오를 분석한다: (1) 할인률이 1인 비할인 목표(\gamma = 1)를 최적화하면서 \gamma_{\text{c}} < 1을 사용하는 경우, (2) 할인률이 1보다 작은 할인 목표(\gamma < 1)를 최적화하면서 \gamma_{\text{a}} = 1, \gamma_{\text{c}} = \gamma < 1을 사용하는 경우.
  • 시나리오 1에서는 \gamma_{\text{c}} < 1을 편향, 분산, 표현 학습 간 균형을 이루는 메커니즘으로 해석하며, 고정된 시간 간격의 TD 학습을 사용해 이러한 영향을 분리한다.
  • 시나리오 2에서는 편향 있는 설정과 편향 없는 설정 간의 차이를 보조 과제로 프레임워크화하여 표현 학습이 성능에 미치는 영향을 분리한다.
  • 보상의 부호가 특정 시간 이후 뒤바뀌는 환경을 새롭게 설계하여 분포 이탈을 유도하고, 이로 인해 불일치에 대한 내성적 저항력을 테스트한다.
  • 통제된 조건 하에서 편향 있는 설정(\gamma_{\text{a}} = 1)과 편향 없는 설정(\gamma_{\text{a}} = \gamma_{\text{c}} = \gamma < 1) 간의 성능을 비교한다.
  • 보조 과제를 사용한 Proximal Policy Optimization (PPO)를 통해, 불일치가 표현 학습을 향상시킨다는 가설을 검증한다.

실험 결과

연구 질문

  • RQ1왜 할인되지 않은 강화학습 설정에서 크리틱에 \gamma_{\text{c}} < 1을 사용하면서도 액터 업데이트에서는 \gamma_{\text{a}} = 1로 설정하는 것이 성능 향상에 기여하는가?
  • RQ2할인된 목표에서 액터 업데이트에서 할인률을 생략하는 것(\gamma_{\text{a}} = 1)은 표현 학습에 어떤 영향을 미치는가?
  • RQ3액터와 크리틱의 할인률 간 불일치를 정책 학습을 향상시키는 효과적인 보조 과제로 해석할 수 있는가?
  • RQ4진정한 목표가 할인된 경우에도, 편향 있는 설정(\gamma_{\text{a}} = 1, \gamma_{\text{c}} < 1)이 편향 없는 설정(\gamma_{\text{a}} = \gamma_{\text{c}} = \gamma < 1)보다 성능이 뛰어나게 되는가?
  • RQ5\gamma_{\text{a}} = 1에 의해 유도되는 인도적 편향이 학습에 해로운 영향을 미치는 조건는 무엇인가?

주요 결과

  • 할인되지 않은 설정(\gamma = 1)에서 \gamma_{\text{c}} < 1을 사용하면 분산이 감소하고 표현 학습이 용이해져, 편향이 존재하더라도 성능 향상이 이루어진다.
  • 경험적 결과로는 \gamma_{\text{c}} < 1이 \gamma_{\text{c}} = 1보다 좋은 표현을 학습하기 쉬운 것으로 나타났으며, 이는 분산 감소를 넘어서는 효과이다.
  • 할인된 설정(\gamma < 1)에서는 환경이 분포 이탈을 유도할 경우, 예를 들어 보상의 부호가 뒤바뀌는 경우, 편향 있는 설정(\gamma_{\text{a}} = 1, \gamma_{\text{c}} = \gamma < 1)이 편향 없는 설정보다 성능이 뛰어나다.
  • 편향 있는 설정에서의 성능 향상은 표현 학습 향상 덕분이며, 이는 보조 과제 설정을 통해 이 효과를 고립시켜 확인할 수 있었다.
  • \gamma_{\text{a}} = 1에 의해 유도되는 인도적 편향이 해로운 경우, 예를 들어 강한 분포 이탈이 존재하는 환경에서는 편향 없는 설정이 더 나은 성능을 보였다.
  • 저자들은 AuxPPO가 편향 있는 설정을 보조 과제로 사용할 경우, 인도적 편향의 정확성에 크게 의존하지 않더라도 강건하고 효과적인 방법임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.