Skip to main content
QUICK REVIEW

[論文レビュー] Importance Resampling for Off-policy Prediction

Matthew Schlegel, Wesley Chung|arXiv (Cornell University)|Jun 11, 2019
Reinforcement Learning in Robotics参考文献 35被引用数 4
ひとこと要約

本稿では、重要度サンプリング再重み付けを、再重み付けの代わりに再サンプリングを用いる、オフポリシー予測のための新規手法である重要度リサンプリング(IR)を導入する。IRは、IS、WIS、V-traceと比較して、更新の分散を低減し、収束速度を向上させる。特に学習率への感受性が低く、サンプル効率が向上する。

ABSTRACT

Importance sampling (IS) is a common reweighting strategy for off-policy prediction in reinforcement learning. While it is consistent and unbiased, it can result in high variance updates to the weights for the value function. In this work, we explore a resampling strategy as an alternative to reweighting. We propose Importance Resampling (IR) for off-policy prediction, which resamples experience from a replay buffer and applies standard on-policy updates. The approach avoids using importance sampling ratios in the update, instead correcting the distribution before the update. We characterize the bias and consistency of IR, particularly compared to Weighted IS (WIS). We demonstrate in several microworlds that IR has improved sample efficiency and lower variance updates, as compared to IS and several variance-reduced IS strategies, including variants of WIS and V-trace which clips IS ratios. We also provide a demonstration showing IR improves over IS for learning a value function from images in a racing car simulator.

研究の動機と目的

  • 大きな重要度サンプリング(IS)比によって引き起こされるオフポリシー価値関数学習における高い分散問題に対処する。
  • 再重み付けの代替としてリサンプリングをオフポリシー予測で検討し、極端なIS比による更新の直接乗算を回避する。
  • 学習の前にリサンプリングを行うことで、ISに基づく手法と比較して訓練の安定性を向上させ、収束速度を向上させることを示す。
  • 画像ベースの制御タスクも含む、タブラーおよびディープRL設定においてIRを評価し、一般化性と頑健性を検証する。
  • 複数の環境において、IS、WIS、V-traceと比較して、分散、学習率感受性、収束速度の観点からIRを評価する。

提案手法

  • 再重み付けの代わりに、IS比をサンプリング確率として使用して、リプレイバッファから遷移をリサンプリングする:P(s,a) ∝ π(a|s)/μ(a|s)。
  • 標準的なオンポリシー更新(例:TD(0))をリサンプリングされた遷移に適用し、更新式においてIS比による直接乗算を回避する。
  • 経験の分布を補正するための重み付きブートストラップ手法を導入し、不偏推定を保証する。
  • リサンプリングによるバイアスを低減しながら一貫性を維持するためのバイアス補正版IRを導入する。
  • ミニバッチ更新とバッファ管理を実装し、オンライン学習とスケーラビリティをサポートする。
  • 同一の実験設定において、IRをIS、WIS(バッファおよびミニバッチバージョン)、V-trace(さまざまなクリッピング閾値を用いる)と比較する。

実験結果

リサーチクエスチョン

  • RQ1IS比を重みとして経験をリサンプリングすることで、標準的なISおよびWISと比較して、更新の分散が低減するか?
  • RQ2タブラーおよびディープRL環境において、IRはISおよびV-traceと比較して、学習率感受性および収束速度で優れているか?
  • RQ3重み更新回数の観点から、IRは一貫性と低バイアスを維持しながら、より速く収束するか?
  • RQ4大きなIS比を伴う高分散・高比設定、例えば画像観測を伴うTORCsレーシングカー・シミュレータにおいて、IRは性能を向上させるか?
  • RQ5初期学習段階におけるIRの更新分散は、ISおよびWISと比較してどのように異なるか?

主な発見

  • 初期学習段階において、IRはISおよびWISと比較して顕著に低い更新分散を達成しており、特にランダムウォークマルコフ連鎖環境で顕著である。
  • すべての手法の中で、IRは最も低い学習率感受性を示し、オンポリシー学習の性能安定性に匹敵する。
  • フォーフォールズ環境では、IRはISおよびWISよりも速く収束し、分散が低く、サンプル効率が向上している。
  • 画像観測を伴うTORCsレーシングカー・シミュレータにおいて、IRはISおよびV-traceを上回り、特に高い学習率で顕著に優れた性能を示しており、分散が低減していることが示唆される。
  • IRは一貫性を維持しており、WISと同等のバイアスを示す。バイアス補正版では不偏推定が達成される。
  • IRの更新分散は、学習の反復回数にかかわらず、ISと比較して一貫して低く、学習率感受性の低減および高速収束と相関している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。