Skip to main content
QUICK REVIEW

[논문 리뷰] Parameter-Free Deterministic Reduction of the Estimation Bias in Continuous Control.

Baturay Sağlam, Enes Duran|arXiv (Cornell University)|2021. 09. 24.
Reinforcement Learning in Robotics참고 문헌 42인용 수 5
한 줄 요약

이 논문은 연속 제어에서 과소추정 편향을 줄이기 위해 클리핑된 더블 Q-학습과 맥스민 Q-학습 원리를 융합한 파라미터가 없는 결정론적 딥 Q-학습 변종을 제안한다. 비용 함수 목표에 고정된 선형 조합의 크리틱 네트워크를 사용함으로써, MuJoCo 및 Box2D 환경 전반에서 최신 기술 수준의 성능을 달성하며 대부분의 작업에서 베이스라인 알고리즘을 능가한다.

ABSTRACT

Approximation of the value functions in value-based deep reinforcement learning systems induces overestimation bias, resulting in suboptimal policies. We show that when the reinforcement signals received by the agents have a high variance, deep actor-critic approaches that overcome the overestimation bias lead to a substantial underestimation bias. We introduce a parameter-free, novel deep Q-learning variant to reduce this underestimation bias for continuous control. By obtaining fixed weights in computing the critic objective as a linear combination of the approximate critic functions, our Q-value update rule integrates the concepts of Clipped Double Q-learning and Maxmin Q-learning. We test the performance of our improvement on a set of MuJoCo and Box2D continuous control tasks and find that it improves the state-of-the-art and outperforms the baseline algorithms in the majority of the environments.

연구 동기 및 목표

  • 강화 학습 신호의 분산이 클 경우 발생하는 딥 액터-크리틱 방법에서의 과소추정 편향을 해결하기 위해.
  • 기존 방법들이 과대추정 편향을 줄이지만 연속 제어에서 상당한 과소추정을 유발하는 한계를 극복하기 위해.
  • 초기화 및 하이퍼파rameter 튜닝이 필요 없는 파라미터가 없는 접근법을 개발하여 결정론적 행동을 유지하기 위해.
  • 클리핑된 더블 Q-학습과 맥스민 Q-학습 원리를 융합하여 연속 행동 공간에서의 가치 추정을 안정화하기 위해.
  • 표준 연속 제어 벤치마크 전반에서 더 높은 샘플 효율성과 성능을 달성하기 위해.

제안 방법

  • 학습 가능한 가중치가 없는 다수의 근사 크리틱 함수의 고정 선형 조합으로 비용 함수 목표를 정의하여, 학습 가능한 가중치가 필요 없도록 한다.
  • 과대추정을 줄이기 위해 클리핑된 더블 Q-학습 메커니즘을 적용한다.
  • 다수의 추정기에서 최소 Q-값을 선택하여 과소추정을 완화하기 위해 맥스민 Q-학습을 통합한다.
  • 클리핑의 안정성과 최소 집합의 강건성을 결합한 결정론적 Q-값 함수 업데이트 규칙을 사용한다.
  • 고정된 가중치 조합의 Q-추정치를 강제로 만족시키는 손실 함수를 사용하여 비용 함수를 학습함으로써 일관성과 분산 감소를 보장한다.
  • 추론 비용 증가 없이도 다수의 크리틱 헤드를 활용하여 가치 추정을 향상시키기 위해 단일 액터 정책 네트워크를 유지한다.

실험 결과

연구 질문

  • RQ1파라미터가 없는 방법이 연속 제어 작업에서 과소추정 편향을 효과적으로 줄일 수 있는가?
  • RQ2고정된 가중치 선형 조합을 통해 클리핑된 더블 Q-학습과 맥스민 Q-학습을 융합하면 고분산 환경에서 가치 추정 안정성이 어떻게 향상되는가?
  • RQ3크리틱 네트워크의 고정된 가중치 선형 조합이 표준 액터-크리틱 베이스라인 대비 더 높은 샘플 효율성과 최종 성능을 제공하는가?
  • RQ4제안된 방법이 표준 MuJoCo 및 Box2D 벤치마크에서 기존 최신 기술 수준 알고리즘보다 어느 정도 뛰어나게 성능을 발휘하는가?
  • RQ5추가 하이퍼파rameter 튜닝이나 아키텍처 복잡성 없이도 이 방법이 뛰어난 성능을 달성할 수 있는가?

주요 결과

  • 고분산 보상이 가치 추정 오차를 악화시키는 연속 제어 환경에서 제안된 방법이 과소추정 편향을 줄인다.
  • 클리핑된 더블 Q-학습과 맥스민 Q-학습을 고정된 선형 가중치로 융합함으로써, 표준 딥 Q-학습 변종보다 더 정확한 가치 추정을 달성한다.
  • 대부분의 MuJoCo 및 Box2D 연속 제어 환경에서 최신 기술 수준의 성능을 달성한다.
  • 모든 테스트 환경에서 최종 수익과 학습 안정성 측면에서 베이스라인 알고리즘을 능가한다.
  • 파라미터가 없는 설계로 크리틱 조합 가중치의 하이퍼파rameter 튜닝이 필요 없어 배포 및 비교가 간편해진다.
  • 실험 결과는 특히 희박 보상 및 고분산 환경에서 기존 방법에 비해 일관된 향상을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.