Skip to main content
QUICK REVIEW

[論文レビュー] Designing Rewards for Fast Learning

Henry Sowerby, Zhiyuan Zhou|arXiv (Cornell University)|May 30, 2022
Auction Theory and Applications被引用数 8
ひとこと要約

本稿では、最適な方策を生成する複数の正しい報酬関数が存在するにもかかわらず、報酬関数の設計を最適化することで強化学習の学習を加速する線形計画法を提案する。この手法は、行動ギャップを最大化し、最適な意思決定を考慮する必要がある有効な計画期間を測る新しい指標「主観的割引率(subjective discount)」を最小化することを目的としている。実験の結果、表形式の環境でQ学習を用いた場合、この方法で設計された報酬関数は著しく高速な学習を実現しており、主な原則には行動のペナルティ付与、段階的なサブゴール報酬の増加、および注意深く設計された密集報酬の導入が含まれる。

ABSTRACT

To convey desired behavior to a Reinforcement Learning (RL) agent, a designer must choose a reward function for the environment, arguably the most important knob designers have in interacting with RL agents. Although many reward functions induce the same optimal behavior (Ng et al., 1999), in practice, some of them result in faster learning than others. In this paper, we look at how reward-design choices impact learning speed and seek to identify principles of good reward design that quickly induce target behavior. This reward-identification problem is framed as an optimization problem: Firstly, we advocate choosing state-based rewards that maximize the action gap, making optimal actions easy to distinguish from suboptimal ones. Secondly, we propose minimizing a measure of the horizon, something we call the "subjective discount", over which rewards need to be optimized to encourage agents to make optimal decisions with less lookahead. To solve this optimization problem, we propose a linear-programming based algorithm that efficiently finds a reward function that maximizes action gap and minimizes subjective discount. We test the rewards generated with the algorithm in tabular environments with Q-Learning, and empirically show they lead to faster learning. Although we only focus on Q-Learning because it is perhaps the simplest and most well understood RL algorithm, preliminary results with R-max (Brafman and Tennenholtz, 2000) suggest our results are much more general. Our experiments support three principles of reward design: 1) consistent with existing results, penalizing each step taken induces faster learning than rewarding the goal. 2) When rewarding subgoals along the target trajectory, rewards should gradually increase as the goal gets closer. 3) Dense reward that's nonzero on every state is only good if designed carefully.

研究の動機と目的

  • 同じ最適方策を生成する複数の正しい報酬関数が存在する中で、学習速度を向上させる報酬設計の原則を同定すること。
  • 「主観的割引率」として有効な計画期間を測る指標を導入し、報酬構造が学習速度に与える影響を形式化すること。
  • 行動ギャップを最大化し、主観的割引率を最小化する報酬関数を生成する最適化フレームワークを開発すること。
  • 適切に設計された報酬—特に行動ペナルティや段階的に増加するサブゴール報酬を含む報酬—が、スパarsな報酬や構造が不適切な密集報酬よりも、方策の一致を著しく高速に達成できることを実証的に検証すること。

提案手法

  • 与えられた割引率のもとで、最適行動と非最適行動の間の行動ギャップを最大化する線形計画問題として報酬設計問題を定式化する。
  • 「主観的割引率」として、最適方策が依然として最適である最小の割引率を定義し、異なる報酬関数間での有効な計画期間を比較可能にする。
  • 各候補報酬関数の主観的割引率を計算するために二分探索を用い、この指標の効率的最適化を可能にする。
  • 状態に依存する報酬を状態特徴の線形結合として設計することで、解釈可能性を確保するとともに、構造化された環境へのスケーラビリティを実現する。
  • 高い行動ギャップと低い主観的割引率の両方を最適化することで、明確な方策の区別と、少ない先読み要件の両立を図る。
  • 本手法をグリッドワールドおよびチェーンMDPに適用し、Q学習を用いて累積的な正解行動数を測定することで、学習速度を評価する。

実験結果

リサーチクエスチョン

  • RQ1同じ最適方策を生成する異なる報酬関数は、学習速度においてどのように異なるか?
  • RQ2報酬関数のどのような構造的特性が、Q学習における収束速度の向上に寄与するか?
  • RQ3報酬関数の有効な計画期間を捉える指標を定義し、報酬設計の指針として用いることができるか?
  • RQ4適切に設計された場合、行動ペナルティ、サブゴール報酬、および密集報酬は、学習速度の向上にどの程度寄与するか?
  • RQ5提案された最適化手法は、Q学習を超えて、他の強化学習アルゴリズムにも一般化可能か?

主な発見

  • 各行動に対してペナルティを課す報酬は、ゴールのみに報酬を与える報酬よりも高速な学習を実現し、主観的割引率は0.9249である一方、ゴールのみの報酬には明確な主観的割引率が定義されない。
  • 線形計画法によって生成された段階的に増加するサブゴール報酬は、主観的割引率が0.8232にまで低下し、定数のサブゴール報酬(0.9510)よりも顕著に低い。これは、より高速な学習をもたらす。
  • ペナルティと報酬を組み合わせた線形計画法による「コンビネーション報酬」は、主観的割引率が0.9238にまで低下し、ゴールのみの報酬や定数サブゴール報酬よりも優れた性能を示した。
  • 急激に変動する非一様なパターン(例:交互に負の値と正の値をとる)を持つ密集報酬は、非常に低い主観的割引率0.2128を達成し、極めて高速な学習を実現した。
  • 行動ギャップがほぼゼロ(0.0024)の密集報酬は性能が著しく劣り、すべての密集報酬が有益であるわけではないことが示され、報酬設計の質が極めて重要であることが明らかになった。
  • 本手法の有効性はQ学習に限定されない。R-maxを用いた予備的な結果から、これらの原則は強化学習アルゴリズム全体に一般化可能であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。