Skip to main content
QUICK REVIEW

[論文レビュー] Learning more skills through optimistic exploration

DJ Strouse, Kate Baumli|arXiv (Cornell University)|Jul 29, 2021
Reinforcement Learning in Robotics参考文献 35被引用数 4
ひとこと要約

本稿では、識別器のアンサンブル間の合意のなさを用いてエピステミックな不確実性を推定し、教師なしスキル発見における探索を促進する、内生的探索ボーナスであるDISDAINを提案する。予測の不確実性が高まる(特に新しい状態において)行動を報酬化することで、DISDAINは悲観的探索の問題を克服し、グリッドワールドおよびアーケードゲームの両方においてベースライン手法と比較して、スキル学習を顕著に向上させる。

ABSTRACT

Unsupervised skill learning objectives (Gregor et al., 2016, Eysenbach et al., 2018) allow agents to learn rich repertoires of behavior in the absence of extrinsic rewards. They work by simultaneously training a policy to produce distinguishable latent-conditioned trajectories, and a discriminator to evaluate distinguishability by trying to infer latents from trajectories. The hope is for the agent to explore and master the environment by encouraging each skill (latent) to reliably reach different states. However, an inherent exploration problem lingers: when a novel state is actually encountered, the discriminator will necessarily not have seen enough training data to produce accurate and confident skill classifications, leading to low intrinsic reward for the agent and effective penalization of the sort of exploration needed to actually maximize the objective. To combat this inherent pessimism towards exploration, we derive an information gain auxiliary objective that involves training an ensemble of discriminators and rewarding the policy for their disagreement. Our objective directly estimates the epistemic uncertainty that comes from the discriminator not having seen enough training examples, thus providing an intrinsic reward more tailored to the true objective compared to pseudocount-based methods (Burda et al., 2019). We call this exploration bonus discriminator disagreement intrinsic reward, or DISDAIN. We demonstrate empirically that DISDAIN improves skill learning both in a tabular grid world (Four Rooms) and the 57 games of the Atari Suite (from pixels). Thus, we encourage researchers to treat pessimism with DISDAIN.

研究の動機と目的

  • 変分的スキル発見における固有の「悲観的探索」問題に対処すること。これは、新しい状態が識別器の予測に低信頼度をもたらし、探索を妨げるためである。
  • アレアトリックな不確実性(ポリシーの性能の低さ)とエピステミックな不確実性(学習データの不足)を区別すること。後者は探索のための望ましい信号である。
  • 識別器のパラメータに関する情報量の増加を直接推定・報酬化できるように、スキル発見に特化した内生的探索ボーナスを設計すること。
  • 提案されたDISDAINボーナスが、表計算的およびピクセルベースの環境におけるスキルの数と多様性の向上を実証的に検証すること。

提案手法

  • パラメトリックなスキル識別器のアンサンブルを訓練し、メンバー間の予測の不一致を通じてエピステミックな不確実性を推定する。
  • DISDAINボーナスをアンサンブル平均予測の負のエントロピーとして定義し、予測が不確実かつ多様である場合に増加するようにする。
  • DISDAINボーナスを内生的報酬信号として用い、アンサンブルが合意しない状態を探索するようにポリシーを最適化する。
  • ベイズ的観点からDISDAINを形式的に導出する。識別器パラメータの事後分布をアンサンブルでモデル化し、情報量の増加を最大化する。
  • DIAYNなどの既存の変分型インフォマックススキル学習フレームワークにDISDAINを統合し、コアのスキル学習目的を変更しないようにする。
  • アブレーションを通じて、アンサンブルサイズやボーナス重み付けなどのハイパーパrameterを調整し、内生的報酬と外生的報酬のバランスを取る。

実験結果

リサーチクエスチョン

  • RQ1スキル発見の過程で、識別器のアンサンブルベースの合意のなさがエピステミックな不確実性の信頼できる信号として機能するか。
  • RQ2DISDAINを内生的ボーナスとして用いることで、教師なしスキル発見におけるスキルの数と多様性が向上するか。
  • RQ3DISDAINは、パーソコントウベースおよびRNDベースの探索ボーナスと比較して、スキル学習のパフォーマンスで優れているか。
  • RQ4DISDAINは、さまざまなハイパーパrameter設定および環境においてもパフォーマンスを維持できるか。

主な発見

  • Four Roomsグリッドワールドにおいて、DISDAINは、ボーナスなしの学習と比較して、発見された異なるスキルの数が25%増加した。
  • Atari 2600スイートにおいて、DISDAINは、ボーナスなしおよびRND拡張ベースラインと比較して、ゼロショット報酬パフォーマンスが高く、ライフタイム中の状態カバレッジが向上した。
  • RNDはスキル学習を向上させず、ボーナス重みを増加させると性能が悪化する傾向にあり、非定常なスキル学習目的とは相性が悪いことが示された。
  • DISDAINボーナスなしの「アンサンブルオンリー」ベースラインでは、ほとんど改善が見られず、内生的ボーナス機構自体が本質的であることが確認された。
  • DISDAINは、アンサンブルサイズやボーナス重み付けといった広範なハイパーパラメータ設定においても、強力なパフォーマンスを維持した。
  • 定性的な分析から、DISDAインはゼロショット評価における改善確率が高く、Atariゲーム全体にわたるパーセンタイル改善の分布も良好であることがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。