Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning by Comparing Immediate Reward

Punit Pandey, Deepshikha Pandey|arXiv (Cornell University)|Sep 14, 2010
Reinforcement Learning in Robotics参考文献 2被引用数 5
ひとこと要約

本論文は、累積報酬信号に依存するのではなく、現在の即時報酬と直前のステップの報酬を比較することによって行動を選択する、新しいQ学習の変種を提案する。直前のパフォーマンスに対する高い即時報酬を持つ行動を優先することで、最適なQ値に収束するためのエピソード数を削減し、20×20グリッドワールド環境において標準Q学習よりも高速な学習を実現した。

ABSTRACT

This paper introduces an approach to Reinforcement Learning Algorithm by comparing their immediate rewards using a variation of Q-Learning algorithm. Unlike the conventional Q-Learning, the proposed algorithm compares current reward with immediate reward of past move and work accordingly. Relative reward based Q-learning is an approach towards interactive learning. Q-Learning is a model free reinforcement learning method that used to learn the agents. It is observed that under normal circumstances algorithm take more episodes to reach optimal Q-value due to its normal reward or sometime negative reward. In this new form of algorithm agents select only those actions which have a higher immediate reward signal in comparison to previous one. The contribution of this article is the presentation of new Q-Learning Algorithm in order to maximize the performance of algorithm and reduce the number of episode required to reach optimal Q-value. Effectiveness of proposed algorithm is simulated in a 20 x20 Grid world deterministic environment and the result for the two forms of Q-Learning Algorithms is given.

研究の動機と目的

  • 累積報酬に依存するための学習が遅く、まれに負の報酬が発生する標準Q学習の遅れを解消すること。
  • 強化学習タスクにおいて最適なQ値に到達するためのエピソード数を削減すること。
  • 相対的報酬比較を用いた行動選択を行う、モデルフリーでインタラクティブな学習手法を開発すること。
  • 決定的グリッドワールド環境における相対的報酬に基づく学習の有効性を評価すること。

提案手法

  • アルゴリズムは、現在の即時報酬と直前の行動の報酬を比較する。
  • 行動は、現在の即時報酬が直前の行動の報酬を上回る場合にのみ選択される。
  • Q値の更新ルールを変更し、時間経過に伴う改善を優遇する相対的報酬比較を組み込む。
  • 標準Q学習と同様にモデルフリーな設定で動作するが、探索および選択戦略が変更されている。
  • 性能のシミュレーションと評価には、決定的な20×20グリッドワールド環境を用いる。
  • 性能は、最適なQ値に到達するまでに要するエピソード数を用いて、提案手法と標準Q学習とを比較する。

実験結果

リサーチクエスチョン

  • RQ1即時報酬と過去の報酬を比較することで、強化学習における学習速度が向上するか?
  • RQ2相対的報酬に基づく選択メカニズムは、最適なQ値に到達するためのエピソード数を削減できるか?
  • RQ3決定的グリッドワールド環境において、提案されたアルゴリズムは標準Q学習と比較してどのように性能を発揮するか?
  • RQ4報酬比較は収束の安定性および性能にどのような影響を与えるか?

主な発見

  • 提案された相対的報酬に基づくQ学習アルゴリズムは、標準Q学習よりも少ないエピソード数で最適なQ値に収束した。
  • 直前のステップと比較して低いまたは停滞した即時報酬を持つ行動を避けることで、アルゴリズムはより迅速な学習を示した。
  • 20×20グリッドワールド環境では、新規手法が最適なパフォーマンスに到達するまでに要するエピソード数を顕著に削減した。
  • 結果から、相対的報酬比較はモデルフリーな強化学習における学習効率を向上させることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。