Skip to main content
QUICK REVIEW

[논문 리뷰] Reward Tweaking: Maximizing the Total Reward While Planning for Short Horizons

Chen Tessler, Shie Mannor|arXiv (Cornell University)|2020. 02. 09.
Reinforcement Learning in Robotics참고 문헌 38인용 수 5
한 줄 요약

이 논문은 유한한 시간 간격에서의 총 보상 작업에서, 짧은 시간 간격 할인 목표로 훈련할 때조차 강화학습 에이전트가 최적 성능을 달성할 수 있도록 보조 보상 함수를 학습하는 보상 조정(reward tweaking) 방법을 제안한다. 궤적 간 최대 마진 분류 문제로 보상 학습을 설정함으로써, 모든 가능한 할인 인자에 대해 성능을 향상시키며, 특히 γ=0.99에서 Hopper-v2 성능을 평균적으로 +6% 향상시킨다.

ABSTRACT

In reinforcement learning, the discount factor $γ$ controls the agent's effective planning horizon. Traditionally, this parameter was considered part of the MDP; however, as deep reinforcement learning algorithms tend to become unstable when the effective planning horizon is long, recent works refer to $γ$ as a hyper-parameter -- thus changing the underlying MDP and potentially leading the agent towards sub-optimal behavior on the original task. In this work, we introduce \emph{reward tweaking}. Reward tweaking learns a surrogate reward function $ ilde r$ for the discounted setting that induces optimal behavior on the original finite-horizon total reward task. Theoretically, we show that there exists a surrogate reward that leads to optimality in the original task and discuss the robustness of our approach. Additionally, we perform experiments in high-dimensional continuous control tasks and show that reward tweaking guides the agent towards better long-horizon returns although it plans for short horizons.

연구 동기 및 목표

  • 강화학습에서 할인 목표로 훈련하는 것과 총 할인되지 않은 보상으로 평가하는 것 사이의 격차를 해소하기 위해.
  • 낮은 할인 인수로 인한 부족한 계획 기간으로 인해 발생하는 최적화되지 않은 행동을 완화하기 위해.
  • γ-할인 목표 하에 훈련된 에이전트가 원래의 유한 시간 간격 총 보상 작업에서 여전히 최적의 행동을 달성할 수 있도록 하기 위해.
  • 원래 작업의 최적성을 유지하면서도 표준 강화학습 알고리즘과 호환되는 보조 보상 함수를 학습하는 방법을 설계하기 위해.
  • 표준 알고리즘이 낮은 할인 인수 선택으로 인해 실패하는 고차원 연속 제어 작업에서의 샘플 효율성과 성능을 향상시키기 위해.

제안 방법

  • 이 방법은 γ-할인 목표 하에서 최적화될 때 원래의 총 보상 목표에 대해 최적의 정책을 유도하는 보조 보상 함수 $\tilde{r}$ 를 학습한다.
  • 보상 학습은 고보상 궤적과 저보상 궤적 간의 최대 마진 분리자 찾기로 특수화된 지도 학습 분류 문제로 설정된다.
  • 보조 보상은 환경에서 샘플된 부분 궤적을 사용해 훈련하며, 전체 궤적 세그먼트에 대한 손실을 계산하여 장기적 보상 차이를 포착한다.
  • 이 방법은 원래 작업 목표 하에서 최적의 행동을 유도하는 보조 보상이 존재함을 이론적으로 입증한다.
  • 이 방법은 표본화된 환경과 고차원 연속 제어 설정 모두에서 평가되었으며, Hopper-v2 환경을 포함한다.
  • 보조 보상은 오프라인 경험을 사용해 오프라인으로 훈련되어 추가 환경 상호작용 없이도 여러 정책 훈련 런에 재사용 가능하다.

실험 결과

연구 질문

  • RQ1γ-할인 목표 하에서 최적화될 때 원래의 유한 시간 간격 총 보상 작업에서 최적의 행동을 달성할 수 있도록 보조 보상 함수를 학습할 수 있는가?
  • RQ2특히 Blackwell 최적화되지 않는 영역(γ < 0.99)에서 보상 조정의 성능은 어떻게 되는가?
  • RQ3표준 알고리즘이 불안정성 또는 짧은 계획 기간으로 인해 어려움을 겪는 고차원 연속 제어 작업, 예를 들어 Hopper-v2에서 이 방법이 성능 향상에 기여하는가?
  • RQ4보상 학습을 위한 최대 마진 설정이 기준 방법에 비해 더 강건하고 일반화 가능한 보조 보상을 유도하는가?
  • RQ5보상 조정은 할인된 훈련 목표와 할인되지 않은 평가 지표 사이의 성능 격차를 어느 정도 줄이는가?

주요 결과

  • Hopper-v2 환경에서 평균 성능이 약 6% 향상되어, γ=0.99일 때 보상이 약 ~3200에서 ~3400으로 증가한다.
  • 모든 가능한 할인 인수(γ ≤ 0.99)에서 성능 향상이 이루어지며, 특히 짧은 계획 기간으로 인한 최적화되지 않은 행동을 효과적으로 완화한다.
  • γ가 감소할수록 성능 변동성이 증가하여, 짧은 계획 기간에서 보조 보상을 학습하는 것이 더 어려워지는 것으로 나타났다.
  • 표본화된 설정에서는 학습된 보조 보상 신호가 조밀하고 정보가 풍부하여, 강화학습 알고리즘이 더 쉽게 학습할 수 있음을 시각화를 통해 확인했다.
  • 보상 조정은 훈련 목표로 부적절한 할인 인수를 사용할 때조차도 원래의 총 보상 작업에서 최적의 행동을 달성할 수 있도록 한다.
  • 고γ 값(>0.99)에서의 훈련 불안정성 문제를 해결하지는 않지만, 저γ 영역에서 더 널리 퍼져 있는 Blackwell 최적화되지 않는 문제를 효과적으로 해결한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.