Skip to main content
QUICK REVIEW

[論文レビュー] Reward Tweaking: Maximizing the Total Reward While Planning for Short Horizons

Chen Tessler, Shie Mannor|arXiv (Cornell University)|Feb 9, 2020
Reinforcement Learning in Robotics参考文献 38被引用数 5
ひとこと要約

本稿では、報酬チューニングという手法を提案する。この手法は、短時間の割引報酬目的で訓練された強化学習エージェントが、有限時限の合計報酬タスクにおいて最適な性能を達成できるようにするための代替報酬関数を学習する。報酬学習を経路間のマックスマージン分類問題として定式化することで、γ=0.99を含むあらゆる可能な割引係数において性能が向上し、Hopper-v2の性能が平均で+6%向上する。

ABSTRACT

In reinforcement learning, the discount factor $γ$ controls the agent's effective planning horizon. Traditionally, this parameter was considered part of the MDP; however, as deep reinforcement learning algorithms tend to become unstable when the effective planning horizon is long, recent works refer to $γ$ as a hyper-parameter -- thus changing the underlying MDP and potentially leading the agent towards sub-optimal behavior on the original task. In this work, we introduce \emph{reward tweaking}. Reward tweaking learns a surrogate reward function $ ilde r$ for the discounted setting that induces optimal behavior on the original finite-horizon total reward task. Theoretically, we show that there exists a surrogate reward that leads to optimality in the original task and discuss the robustness of our approach. Additionally, we perform experiments in high-dimensional continuous control tasks and show that reward tweaking guides the agent towards better long-horizon returns although it plans for short horizons.

研究の動機と目的

  • 強化学習における割引目的で訓練することと、未割引合計報酬で評価することのギャップを解消すること。
  • 低割引係数(ブラックウェルの非最適性)による計画時間の不足が引き起こす非最適行動を軽減すること。
  • γ-割引目的で訓練されたエージェントが、元の有限時限合計報酬タスクにおいても最適な行動を達成できるようにすること。
  • 元のタスクの最適性を保ちつつ、標準的な強化学習アルゴリズムと互換性のある代替報酬関数を学習する手法を設計すること。
  • 高次元連続制御タスクにおけるサンプル効率と性能を向上させること。標準的なアルゴリズムは、割引係数の選択が不適切なために失敗することがある。

提案手法

  • この手法は、γ-割引目的で最適化された場合に、元の合計報酬目的で最適な方策を導く代替報酬関数 $\tilde{r}$ を学習する。
  • 報酬学習は、上位報酬と下位報酬の経路を分離するマックスマージン分離器を求める、教師あり分類問題として定式化される。
  • 代替報酬は、環境からサンプリングされた部分的経路を用いて学習され、長期間の報酬差を捉えるために、全経路セグメント上で損失が計算される。
  • 理論的に、元のタスク目的で最適な行動を誘導する代替報酬が存在することを示す。
  • 本手法は、表形式と高次元連続制御設定の両方で評価されており、Hopper-v2環境も含む。
  • 代替報酬はオフライン経験を用いて事前学習され、追加の環境インタラクションなしに複数回のポリシー訓練に再利用可能である。

実験結果

リサーチクエスチョン

  • RQ1γ-割引目的で最適化された代替報酬関数を学習できるか。その場合、元の有限時限合計報酬タスクで最適な行動が達成できるか。
  • RQ2特にブラックウェル非最適性領域(γ < 0.99)における、さまざまな割引係数での報酬チューニングの性能はいかがなものか。
  • RQ3Hopper-v2のような高次元連続制御タスクにおいて、標準的なアルゴリズムが不安定さや短い計画時間のために苦戦する状況で、本手法が性能向上をもたらすか。
  • RQ4報酬学習におけるマックスマージン定式化は、ベースライン手法と比較して、より頑健で汎用性の高い代替報酬をもたらすか。
  • RQ5報酬チューニングは、割引訓練目的と未割引評価指標の間の性能ギャップをどの程度縮小できるか。

主な発見

  • Hopper-v2環境における平均性能が約6%向上し、γ=0.99で報酬が約3200から約3400に上昇する。
  • すべての可能な割引係数(γ ≤ 0.99)において、性能が向上し、特に短い計画時間による非最適性を効果的に軽減する。
  • γが低下するにつれて性能のばらつきが増加しており、短い計画時間において代替報酬の学習がより困難であることが示唆される。
  • 表形式設定では、学習された代替報酬が密集した有用な信号を示しており、視覚化により、強化学習アルゴリズムがそれを容易に学習できることを確認した。
  • 報酬チューニングにより、訓練目的で非最適な割引係数が使われても、元の合計報酬タスクで最適な行動を達成できる。
  • 高γ値(>0.99)における訓練不安定性は解決しないが、低γ領域におけるより広範なブラックウェル非最適性問題には効果的に対処できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。