Skip to main content
QUICK REVIEW

[論文レビュー] Temporal Difference Uncertainties as a Signal for Exploration

Sebastian Flennerhag, Jane X. Wang|arXiv (Cornell University)|Oct 5, 2020
Reinforcement Learning in Robotics参考文献 52被引用数 7
ひとこと要約

本論文は、時系列差分(TD)誤差の不確実性を推定することで、内生的探索信号を生成する、強化学習における探索のための新規手法Temporal Difference Uncertainties(TDU)を提案する。観測された状態・行動遷移に条件づけられた不確実性により、モデルの不確実性を環境ノイズから分離し、高不確実性状態を標的とする別個の探索方策を可能にすることで、Montezuma’s Revenge や Deep Sea といった困難な探索タスクにおけるデータ効率と性能が向上する。

ABSTRACT

An effective approach to exploration in reinforcement learning is to rely on an agent's uncertainty over the optimal policy, which can yield near-optimal exploration strategies in tabular settings. However, in non-tabular settings that involve function approximators, obtaining accurate uncertainty estimates is almost as challenging a problem. In this paper, we highlight that value estimates are easily biased and temporally inconsistent. In light of this, we propose a novel method for estimating uncertainty over the value function that relies on inducing a distribution over temporal difference errors. This exploration signal controls for state-action transitions so as to isolate uncertainty in value that is due to uncertainty over the agent's parameters. Because our measure of uncertainty conditions on state-action transitions, we cannot act on this measure directly. Instead, we incorporate it as an intrinsic reward and treat exploration as a separate learning problem, induced by the agent's temporal difference uncertainties. We introduce a distinct exploration policy that learns to collect data with high estimated uncertainty, which gives rise to a curriculum that smoothly changes throughout learning and vanishes in the limit of perfect value estimates. We evaluate our method on hard exploration tasks, including Deep Sea and Atari 2600 environments and find that our proposed form of exploration facilitates both diverse and deep exploration.

研究の動機と目的

  • 関数近似を用いた非表形式の強化学習における価値関数の信頼性のある不確実性推定の課題に対処すること。
  • 未観測の将来状態の訪問による価値関数の不確実性推定のバイアスを低減すること。
  • モデルの不確実性を環境的不確実性から分離するスケーラブルな探索信号を開発すること。
  • 不確実性駆動の内生的報酬に基づいて学習された別個の方策により、効率的な探索を可能にすること。
  • 硬い探索を要する Atari エンvironments および Deep Sea における、向上したデータ効率と最終パフォーマンスを示すこと。

提案手法

  • TDU は価値関数そのものではなく、時系列差分(TD)誤差の不確実性を推定することで、将来状態訪問の不確実性に起因するバイアスを低減する。
  • 観測された状態・行動遷移に条件づけた不確実性推定により、環境の変動を制御し、モデルの不確実性を分離する。
  • 別個の探索方策を、これらの TD 不確実性に基づく内生的報酬を最大化するように学習させることで、探索と方策最適化を分離する。
  • 価値最適化方策と探索方策の間で共有されたリプレイバッファを使用することで、ブートストラップ不確実性推定を可能にする。
  • 内生的報酬はボーナスハイパーパrameter β でスケーリングされ、探索の強度を制御でき、環境ごとにチューニング可能である。
  • TDU は、ブートストラップ DQN を用いた二重方策設定で評価されており、探査者(exploiter)は最適方策を学び、探索者(explorer)は不確実性に基づいてデータ収集を行う。

実験結果

リサーチクエスチョン

  • RQ1価値関数の不確実性を直接推定するのではなく、時系列差分誤差の不確実性を推定することで、探索のためのより信頼性が高くバイアスの少ない信号が得られるか?
  • RQ2観測された状態・行動遷移に条件づけた不確実性推定は、関数近似設定においてバイアスを低減し、探索効率を向上させるか?
  • RQ3不確実性に基づく内生的報酬に従って学習された別個の探索方策は、標準的な探索手法に比べて、より高いデータ効率と最終パフォーマンスを達成できるか?
  • RQ4探索ボーナスの強度(β)は、硬い探索を要するゲームや報酬密度の高いゲームを含む多様な環境において、性能にどのように影響するか?
  • RQ5事前関数を組み込むことで、TDU フレームワークにおけるパフォーマンスはどの程度向上するか?

主な発見

  • TDU は、Montezuma’s Revenge や Private Eye、Venture、Gravitar などの硬い探索ゲームにおいて、最終平均スコアとデータ効率の両面で統計的に有意な向上を達成した。
  • Montezuma’s Revenge において、事前関数を用いない TDU は、ベースラインより統計的に有意な向上を示し、より高い最終パフォーマンスと高速な収束を達成した。
  • 全 57 ゲームの Atari サイズでは、探索ボーナス強度を低減(λ=0.1)することで、人間正規化スコア(HNS)が向上し、探索を要するゲームのパフォーマンスに悪影響を与えることなく、性能が維持された。
  • 事前関数を用いた TDU は、Montezuma’s Revenge、Private Eye、Gravitar で統計的に有意な向上を示し、最も困難な環境において、事前関数がパフォーマンスを向上させることを示した。
  • 報酬密度の高いゲームおよび探索を要するゲームの両方において、TDU はすべてのベースラインを上回るか、同等のパフォーマンスを示し、Seaquest や Tennis のようなゲームでは、平均 HNS の向上と、より速い収束が見られた。
  • アブレーションスタディの結果、探索ボーナスの強度(β)はパフォーマンスに顕著な影響を及ぼし、特に報酬密度の高い環境では最適なチューニングが必要であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。