Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Controller Fusion: Leveraging Control Priors in Deep Reinforcement Learning for Robotics

Krishan Rana, Vibhavari Dasagi|arXiv (Cornell University)|Jul 21, 2021
Fault Detection and Control Systems被引用数 7
ひとこと要約

本稿では、深層強化学習方策と手作業で設計された制御器の両方の不確実性を考慮した出力を組み合わせることで、ロボット工学における安全でサンプル効率の良い学習を可能にするハイブリッド強化学習フレームワーク「ベイジアンコントローラーフュージョン(BCF)」を提案する。ベイジアン推論を用いてこれらの制御器を統合することで、BCFは学習を加速し、ナビゲーションタスクと到達タスクにおいて、それぞれ116%および282%の性能向上を達成した。また、分布外状態においても安全な動作を保証している。

ABSTRACT

We present Bayesian Controller Fusion (BCF): a hybrid control strategy that combines the strengths of traditional hand-crafted controllers and model-free deep reinforcement learning (RL). BCF thrives in the robotics domain, where reliable but suboptimal control priors exist for many tasks, but RL from scratch remains unsafe and data-inefficient. By fusing uncertainty-aware distributional outputs from each system, BCF arbitrates control between them, exploiting their respective strengths. We study BCF on two real-world robotics tasks involving navigation in a vast and long-horizon environment, and a complex reaching task that involves manipulability maximisation. For both these domains, simple handcrafted controllers exist that can solve the task at hand in a risk-averse manner but do not necessarily exhibit the optimal solution given limitations in analytical modelling, controller miscalibration and task variation. As exploration is naturally guided by the prior in the early stages of training, BCF accelerates learning, while substantially improving beyond the performance of the control prior, as the policy gains more experience. More importantly, given the risk-aversity of the control prior, BCF ensures safe exploration and deployment, where the control prior naturally dominates the action distribution in states unknown to the policy. We additionally show BCF's applicability to the zero-shot sim-to-real setting and its ability to deal with out-of-distribution states in the real world. BCF is a promising approach towards combining the complementary strengths of deep RL and traditional robotic control, surpassing what either can achieve independently. The code and supplementary video material are made publicly available at https://krishanrana.github.io/bcf.

研究の動機と目的

  • 実世界のロボット工学における深層強化学習のサンプル非効率性と安全性の制限を解消すること。
  • 探索をガイドし、サンプル効率を向上させるために、既存の信頼性は高いが性能が劣る手作業で設計された制御器を行動事前分布として活用すること。
  • 未知または分布外の状態において、古典的制御器のリスク回避特性を活用することで、安全な展開を保証すること。
  • 不確実性を考慮した古典的制御器と組み合わせることで、深層強化学習方策のシミュレーションから実環境への転送を信頼性高く実現すること。
  • 信頼性の高い制御戦略を実現するため、自信に基づいて学習済み制御と古典的制御を動的に仲裁するハイブリッド制御戦略を開発し、最終的な方策性能を事前分布を上回ること。

提案手法

  • 深層強化学習方策と手作業で設計された制御器から得られる確率的行動分布を、予測不確実性を用いて重み付けするベイジアン統合メカニズムを定式化する。
  • 各アクチュエータごとに、不確率推定値から導かれる平均と分散を持つ単変量ガウス分布として、各制御器の出力を表現する。
  • ベイジアンモデル平均を適用して合成行動分布を計算し、各状態で不確実性が低い制御器が優位に働くようにする。
  • 初期学習段階におけるロバストネスと多様性を向上させるために、深層強化学習方策のアンサンブルを用いてエピステミック不確実性を推定する。
  • 安全な探索と実環境での安定した展開を可能にするため、統合メカニズムを組み合わせ型方策に統合する。
  • 長時間にわたるナビゲーションタスクと、操作性を最大化する到達タスクにこのフレームワークを適用し、性能向上と分布シフトに対するロバストネスを実証する。

実験結果

リサーチクエスチョン

  • RQ1不確実性を考慮した深層強化学習方策と手作業で設計された制御器を組み合わせることで、ロボット制御タスクにおけるサンプル効率と最終的性能が向上するか?
  • RQ2強化学習方策が分布外状態に直面した場合、ハイブリッド制御戦略はどのように安全な探索と展開を保証できるか?
  • RQ3制御事前分布と学習済み方策のベイジアン統合は、複雑なロボットタスクにおいて、信頼性のあるシミュレーションから実環境への転送をどの程度可能にするか?
  • RQ4統合メカニズムにより、事前分布が劣っている場合でも、最終的な方策がその性能を上回る可能性はあるか?
  • RQ5不確実性に基づく制御器間の仲裁は、長時間にわたる、報酬がスパarsな環境における学習ダイナミクスとロバストネスにどのように影響を与えるか?

主な発見

  • BCFは、長時間にわたるナビゲーションタスクにおいて、制御事前分布よりも116%の性能向上を達成し、ベースライン手法を著しく上回った。
  • 複雑な到達タスクでは、BCFはベースライン制御器と比較して操作性を34.9%向上させ、タスク固有の最適化が優れていることを示した。
  • 実世界のナビゲーション実験では、反応型制御器に見られる振動行動を排除することで、BCFは作動時間を50.7%短縮した。
  • BCFは両タスクにおいて、成功裏にシミュレーションから実環境への転送を実現した。分布外状態では、単独の強化学習方策が失敗したが、BCFは一般化して動作した。
  • アンサンブルベースの不確実性推定により、既知の領域では初期不確実性が低く、未到達領域では分散が高くなることが確認され、効果的な探索が可能になった。
  • BCFのベイジアン統合メカニズムにより、未知状態ではリスク回避的である制御事前分布が優位に働き、展開時の安全な動作が保証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。