Skip to main content
QUICK REVIEW

[論文レビュー] AC-Teach: A Bayesian Actor-Critic Method for Policy Learning with an Ensemble of Suboptimal Teachers

Andrey Kurenkov, Ajay Mandlekar|arXiv (Cornell University)|Sep 9, 2019
Reinforcement Learning in Robotics参考文献 38被引用数 17
ひとこと要約

AC-Teachは、部分的・不完全・矛盾する教師のアンサンブルを活用することで、深層強化学習におけるサンプル効率を向上させるベイジアンアクタークリティックフレームワークを提案する。確率的価値推定と教師が提案する行動に対するトマソンサンプリングを用いることで、安定的かつ適応的な探索を可能にし、ロボット操作タスクにおいて収束速度および漸近的性能の両面でベースラインを上回る。低品質または不完全な教師セットでさえも有効である。

ABSTRACT

The exploration mechanism used by a Deep Reinforcement Learning (RL) agent plays a key role in determining its sample efficiency. Thus, improving over random exploration is crucial to solve long-horizon tasks with sparse rewards. We propose to leverage an ensemble of partial solutions as teachers that guide the agent's exploration with action suggestions throughout training. While the setup of learning with teachers has been previously studied, our proposed approach - Actor-Critic with Teacher Ensembles (AC-Teach) - is the first to work with an ensemble of suboptimal teachers that may solve only part of the problem or contradict other each other, forming a unified algorithmic solution that is compatible with a broad range of teacher ensembles. AC-Teach leverages a probabilistic representation of the expected outcome of the teachers' and student's actions to direct exploration, reduce dithering, and adapt to the dynamically changing quality of the learner. We evaluate a variant of AC-Teach that guides the learning of a Bayesian DDPG agent on three tasks - path following, robotic pick and place, and robotic cube sweeping using a hook - and show that it improves largely on sampling efficiency over a set of baselines, both for our target scenario of unconstrained suboptimal teachers and for easier setups with optimal or single teachers. Additional results and videos at https://sites.google.com/view/acteach/home.

研究の動機と目的

  • スパarsityな報酬を伴う長時間スケールのロボット操作タスクにおける深層強化学習のサンプル効率を向上させること。
  • 最適または完全なエキスパートデモンストレーションを必要とせず、部分的・不完全・矛盾する教師からも有効なポリシー学習を可能にすること。
  • 個々の教師に明示的に依存しない統合的かつスケーラブルなフレームワークを構築し、異種の教師の助言を行動ポリシーに統合すること。
  • エージェントと教師の行動が混在したオフポリシー経験から学習する際の安定性と性能を維持すること。
  • 教師のセットが不十分またはノイズが多い状況でも、どの教師にもカバーされていない行動を学習できるようにすること。

提案手法

  • AC-Teachは、ベイジアンクリティックが予測する行動価値の確率的事後分布からのトマソンサンプリングに基づいて行動を選択する行動ポリシーをアクタークリティックアーキテクチャに拡張する。
  • ベイジアンクリティックはQ値の事後分布を維持し、エージェントの行動と教師が提案する行動の間での不確実性認識選択を可能にする。
  • 教師の助言は明示的な条件付けなしに代替行動提案として統合され、大規模または動的変化する教師セットへのスケーラビリティを実現する。
  • コミットメント機構により、エージェントが一時的に特定の教師ポリシーに従うことで、ジターリングを低減し、ポリシーの安定性を向上させる。
  • オフポリシー経験リプレイを用いることで、エージェントと複数の教師が生成する異種のデータから学習可能である。
  • 本フレームワークは任意のオフポリシーRLアルゴリズムと互換性があり、ここではベイジアンDDPG(BDDPG)を用いて実証している。

実験結果

リサーチクエスチョン

  • RQ1部分的・不完全・矛盾する教師のアンサンブルを用いた場合、AC-Teachはサンプル効率を顕著に向上させることができるか?
  • RQ2教師セットが不十分な場合、エージェントがタスクの一部を完全に新規に学習する必要がある状況でAC-Teachはどのように動作するか?
  • RQ3ノイズの多いまたは低品質な教師(たとえば、ランダム行動を提供する教師)に対してもAC-Teachはどれほど頑健か?
  • RQ4多様な教師構成において、収束速度および最終的性能の両面でAC-Teachはベースラインを上回るか?
  • RQ5各構成要素(不確実性推定、コミットメント機構、アンサンブル統合)が全体のパフォーマンスに果たす寄与度はどの程度か?

主な発見

  • AC-Teachは、ピックアンドプレース、パスフォローリング、フックスイーピングタスクにおいて、すべてのベースラインをサンプル効率および漸近的パフォーマンスの両面で顕著に上回る。
  • 1つのノイズの多い教師しか利用できない状況でも、AC-Teachは効果的に学習し、ノイズの多い完全な教師の性能に近づくが、すべてのベースラインは学習に失敗する。
  • 複数の部分的教師(例:分離されたピック・プレースコントローラ)を用いた場合、AC-Teachはノイズを含む手動でコーディングされた近似的最適な教師よりも優れたパフォーマンスを示す。
  • ランダムな教師を追加してもAC-Teachの性能はゆっくりと低下するが、常にすべてのベースラインを上回る。
  • アブレーションスタディにより、ベイジアンクリティック、トマソンサンプリング、コミットメント機構、アンサンブル統合という4つの構成要素が強力なパフォーマンスを発揮するために不可欠であることが確認された。
  • 部分的・不完全な教師を追加することで、最適または単一の教師よりもパフォーマンスが向上する。これは、教師の助言の多様性が外挿誤差を緩和することを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。