Skip to main content
QUICK REVIEW

[論文レビュー] Large-Scale Retrieval for Reinforcement Learning

Peter C. Humphreys, Arthur Guez|arXiv (Cornell University)|Jun 10, 2022
Reinforcement Learning in Robotics被引用数 11
ひとこと要約

本論文は、近似的最近傍探索を用いて数千万ものエキスパートのデモンストレーション状態を動的にアクセスできる、リtrieバル拡張強化学習フレームワークを提案する。9x9ゴリの意思決定性能が著しく向上する。この手法はエンド・トゥ・エンドの学習を実現し、エージェントは再訓練を伴わず、取得したコンテキストを活用して予測精度とゲーム性能を向上させる。新しいデータが推論時に追加されても同様に有効である。

ABSTRACT

Effective decision making involves flexibly relating past experiences and relevant contextual information to a novel situation. In deep reinforcement learning (RL), the dominant paradigm is for an agent to amortise information that helps decision making into its network weights via gradient descent on training losses. Here, we pursue an alternative approach in which agents can utilise large-scale context sensitive database lookups to support their parametric computations. This allows agents to directly learn in an end-to-end manner to utilise relevant information to inform their outputs. In addition, new information can be attended to by the agent, without retraining, by simply augmenting the retrieval dataset. We study this approach for offline RL in 9x9 Go, a challenging game for which the vast combinatorial state space privileges generalisation over direct matching to past experiences. We leverage fast, approximate nearest neighbor techniques in order to retrieve relevant data from a set of tens of millions of expert demonstration states. Attending to this information provides a significant boost to prediction accuracy and game-play performance over simply using these demonstrations as training trajectories, providing a compelling demonstration of the value of large-scale retrieval in offline RL agents.

研究の動機と目的

  • 推論時に過去の経験の巨大な外部データセットにアクセス・活用できるように、深層強化学習エージェントを可能にすること。
  • 新しい情報を組み込むために膨大な再訓練を必要とする純粋なパrametricモデルの限界を克服すること。
  • 大規模かつコンテキストに依存するリtrieバルが、9x9ゴリのような組み合わせ的環境における一般化と意思決定を改善できるかどうかを検討すること。
  • リtrieバルが、多様な情報源を強化学習エージェントに統合するスケーラブルで効率的かつ適応的メカニズムとして機能できることを示すこと。
  • リtrieバルが分布シフト下でも、追加の訓練なしに性能向上をもたらすかどうかを検証すること。

提案手法

  • エージェントは、パラメトリックな方策ネットワークとリtrieバルメカニズムを組み合わせた半パラメトリックアーキテクチャを採用し、関連する過去の経験にアクセスする。
  • 関連する経験は、ボード状態の埋め込み空間における近似的最近傍(ANN)探索によって取得される。
  • リtrieバルクエリは、現在の観測値からクエリネットワークによって生成され、上位k個の最近傍が方策および価値予測のコンテキストとして使用される。
  • モデルは、約5000万本のエキスパートゴーゲームのデモンストレーションデータセットを用いた、オフラインの教師付き強化学習設定でエンド・トゥ・エンドに学習される。
  • 推論時に、取得したコンテキストを活用して方策性能をさらに向上させるためにモンテカルロツリー探索(MCTS)が適用される。
  • リtrieバルデータセットは推論時に動的に更新可能であり、新しいゲームデータを追加することで即座に性能向上が達成され、再訓練は不要である。

実験結果

リサーチクエスチョン

  • RQ1大規模かつコンテキストに依存する過去経験のリtrieバルは、深層強化学習エージェントの意思決定を改善できるか?
  • RQ2外部データへのリtrieバルベースのアクセスは、9x9ゴリのような組み合わせ的環境における一般化を向上させるか?
  • RQ3リtrieバルデータベースの更新のみで、再訓練なしにエージェントが新しい情報を即座に適応できるか?
  • RQ4リtrieバルは、従来のリプレイやパラメトリックアモアタイゼーションと比較して、性能および効率性において優れているか?
  • RQ5リtrieバルは、分布外設定における計画手法(例:MCTS)とどの程度相乗効果を発揮するか?

主な発見

  • リtrieバル拡張エージェントは、9x9ゴリにおける予測精度とゲームプレイ性能の両面で、強力な非リtrieバルベースラインを著しく上回った。
  • 評価相手との対局で得られた新しいゲームデータをリtrieバルデータセットに追加することで、再訓練なしに即座にエージェントの性能が向上した。
  • 推論時にランダムにリtrieバルされた近傍を使用しても、エージェントは依然として顕著な性能を維持していた。これは、トレーニング段階で取得したデータから一般化する能力がモデルに学習されたことを示している。
  • リtrieバルとMCTSの組み合わせにより、相乗的な性能向上が得られ、シミュレーション回数とリtrieバルされた近傍数の両方が結果を向上させた。
  • 計算効率性も示された。MCTSのシミュレーション回数を増やすコストに比べて、リtrieバルによる性能向上は顕著であった。
  • 従来の手法とは異なり、本手法は、取得した情報をどう使うかをエンド・トゥ・エンドで学習可能であり、過去データの利用方法を固定で規定するものではない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。