Skip to main content
QUICK REVIEW

[논문 리뷰] Distributional Reinforcement Learning for Multi-Dimensional Reward Functions

Pushi Zhang, Xiaoyu Chen|arXiv (Cornell University)|2021. 10. 26.
Reinforcement Learning in Robotics참고 문헌 21인용 수 4
한 줄 요약

이 논문은 다중 보상 원천 간의 연관성을 고려하여 복수의 보상 원천에 걸친 공동 수익 분포를 모델링하는 분포 강화학습 방법인 다차원 분포 DQN(MD3QN)을 제안한다. 예측된 공동 분포와 벨먼 타겟 공동 분포 간의 최대 평균 차이(MMD)를 최소화함으로써 MD3QN은 워샤르스키 메트릭 하에서 수렴하며, HRA와 같은 이전 방법들보다 다차원 보상 환경에서 더 뛰어난 성능을 보이며 정확한 공동 분포 모델링과 향상된 샘플 효율성을 입증한다.

ABSTRACT

A growing trend for value-based reinforcement learning (RL) algorithms is to capture more information than scalar value functions in the value network. One of the most well-known methods in this branch is distributional RL, which models return distribution instead of scalar value. In another line of work, hybrid reward architectures (HRA) in RL have studied to model source-specific value functions for each source of reward, which is also shown to be beneficial in performance. To fully inherit the benefits of distributional RL and hybrid reward architectures, we introduce Multi-Dimensional Distributional DQN (MD3QN), which extends distributional RL to model the joint return distribution from multiple reward sources. As a by-product of joint distribution modeling, MD3QN can capture not only the randomness in returns for each source of reward, but also the rich reward correlation between the randomness of different sources. We prove the convergence for the joint distributional Bellman operator and build our empirical algorithm by minimizing the Maximum Mean Discrepancy between joint return distribution and its Bellman target. In experiments, our method accurately models the joint return distribution in environments with richly correlated reward functions, and outperforms previous RL methods utilizing multi-dimensional reward functions in the control setting.

연구 동기 및 목표

  • 다중 보상 강화학습에서 스칼라 및 주변 가치 함수 학습의 한계를 보완하기 위해 공동 수익 분포를 모델링하는 것.
  • 개별 보상 원천 내의 랜덤성 뿐 아니라 그들 간의 상관관계까지 포착하여 더 풍부한 환경 이해를 가능하게 하는 것.
  • 분포 강화학습을 스칼라 수익을 넘어서 다차원 수익 분포로 확장하기 위해 이론적으로 탄탄한 벨먼 연산자를 사용하는 것.
  • 공동 분포 벨먼 연산자를 정확하게 근사하는 경험적 알고리즘을 개발하기 위해 MMD 손실을 사용하는 것.

제안 방법

  • 워샤르스키 메트릭 하에서 공동 수익 분포를 그 타겟으로 매핑하는 공동 분포 벨먼 연산자를 도입한다.
  • 공동 분포 벨먼 연산자가 워샤르스키 메트릭 하에서 수렴함을 증명하여 이론적 안정성을 확보한다.
  • MMD를 최소화하여 예측된 공동 분포와 그 벨먼 타겟 간의 거리를 줄이는 MD3QN 알고리즘을 제안한다.
  • 편향이 없는 MMD 추정을 사용한 미니배치 경사하강법을 적용하여 공동 분포를 최적화하고 확장 가능한 훈련을 가능하게 한다.
  • 각 보상 원천에 대응하는 출력 헤드를 갖는 딥 네ural 네트워크를 사용하여 복수의 보상 원천에 걸친 수익의 공동 분포를 회귀한다.
  • 픽셀 관측치를 사용하고 엔드 투 엔드 훈련을 수행하는 분해된 보상이 있는 환경(예: 아케이드 게임, 미로 과제)에 이 방법을 적용한다.

실험 결과

연구 질문

  • RQ1다차원 수익의 공동 분포를 모델링하면 가치 기반 강화학습에서 샘플 효율성과 성능 향상에 기여할 수 있는가?
  • RQ2다중 보상 환경에서 보상 간 상관관계를 포착하면 정책 학습과 표현 품질에 어떤 영향을 미치는가?
  • RQ3공동 분포 벨먼 연산자는 표준 메트릭 하에서 수렴하는가? 실무에서 효과적으로 근사될 수 있는가?
  • RQ4밀도 추정이 필요 없이 MMD 기반 훈련이 공동 수익 분포를 안정적이고 정확하게 학습시키는 데 효과적인가?
  • RQ5모델링된 상관관계를 고려한 보상에서 MD3QN은 HRA 및 MMDQN과 같은 기존 방법들보다 성능 면에서 어떻게 비교되는가?

주요 결과

  • MD3QN은 미로 환경과 아케이드 게임 모두에서 복수의 보상 원천에 걸친 공동 수익 분포를 성공적으로 모델링하였으며, 시각화 결과 진정한 분포와 밀도 있는 일치를 보였다.
  • 독립적, 동일, 다중 보상 원천이 있는 미로 환경에서 MD3QN은 샘플 분포가 기준값 패턴과 일치함으로써 보상 간 상관관계를 정확히 포착하였다.
  • 분해된 보상을 가진 여섯 개의 아케이드 게임에서 MD3QN은 모든 환경에서 HRA를 능가하거나 동등한 성능을 보이며 학습 효율성 향상을 입증하였다.
  • MMDQN의 성능을 모두 뛰어넘지 못했지만, MD3QN은 HRA보다 더 나은 또는 유사한 성능을 달성하여 주변 분포 모델링 대비 공동 분포 모델링의 이점을 입증하였다.
  • 부록 A.3.3의 아블레이션 연구에서 상관관계가 있는 제약 조건이 있는 환경에서는 주변 분포만 모델링하는 것이 실패함을 입증하여 공동 분포 학습의 必要성을 입증하였다.
  • MD3QN이 모델링한 공동 분포는 실제 보상 상관관계와 척도를 반영하며, 예를 들어 MsPacman에서 몬스터를 잡는 것과 점수를 획득하는 것 사이의 양의 상관관계를 잘 반영함으로써 메서드의 표현 능력을 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.