Skip to main content
QUICK REVIEW

[論文レビュー] Efficient reinforcement learning control for continuum robots based on Inexplicit Prior Knowledge

Junjia Liu, Jiaying Shou|arXiv (Cornell University)|Feb 26, 2020
Soft Robotics and Applications参考文献 38被引用数 8
ひとこと要約

本論文は、連続ロボットにおける学習の高速化を目的として、非明示的先行知識(IPK)を統合したモデルベース強化学習フレームワークを提案する。カルマンフィルタを用いて先行アクションとRL出力を融合し、探索と活用のバランスを取るための適応的活用係数を導入している。本手法は、10,000~20,000回の環境相互作用で、データ効率的かつ実世界での視覚追跡および距離維持を実現した。

ABSTRACT

Compared to rigid robots that are generally studied in reinforcement learning, the physical characteristics of some sophisticated robots such as soft or continuum robots are higher complicated. Moreover, recent reinforcement learning methods are data-inefficient and can not be directly deployed to the robot without simulation. In this paper, we propose an efficient reinforcement learning method based on inexplicit prior knowledge in response to such problems. We first corroborate the method by simulation and employed directly in the real world. By using our method, we can achieve active visual tracking and distance maintenance of a tendon-driven robot which will be critical in minimally invasive procedures. Codes are available at https://github.com/Skylark0924/TendonTrack.

研究の動機と目的

  • 複雑で非定常的な動的な実世界の連続ロボットにおける強化学習のデータ非効率性を解消すること。
  • ソフトおよび連続ロボティクス分野におけるモデルフリーRLと従来の運動学的モデリングの限界を克服すること。
  • 明示的な数式モデルを必要とせず、非明示的先行知識(IPK)を統合して方策探索を指導すること。
  • カルマンフィルタベースのコントローラーを用いて先行知識とRL出力を融合することで、安全かつ効果的な探索を実現すること。
  • 本手法の実世界応用を、腱駆動連続ロボットを用いて最小侵襲手術タスクに応用して実証すること。

提案手法

  • 非明示的先行知識(IPK)を統合したモデルベースRLフレームワークを提案し、妥当な行動領域への方策探索をガイドする。
  • カルマンフィルタを用いてIPKとディープRLの行動分布を融合し、先行知識と探索のバランスを取ったハイブリッド行動方策を生成する。
  • IPKとRLの行動分布間のカルバック・ライブラー(KL)ダイバージェンスに基づいて、適応的活用係数ζを調整する。
  • シミュレーションから実世界への移行を伴わない、物理的ロボット相互作用からの直接学習を実装する。
  • ピンホールカメラをロボットのエンドエフェクタに搭載し、ファーストパーソンビューからの視覚サーボを統合して、リアルタイムの状態観測を実現する。
  • モーターエンコーダーを用いて正確なアクション実行と安全性のモニタリングを実現し、機械的過延長を防止する。

実験結果

リサーチクエスチョン

  • RQ1非明示的先行知識は、連続ロボットにおける強化学習のサンプル複雑性を顕著に低減できるか?
  • RQ2先行知識をどのようにディープRLと効果的に融合させ、探索を維持しながら収束を加速できるか?
  • RQ3不確実な先行アクションとRL出力を組み合わせる際、カルマンフィルタベースの融合機構は方策学習の安定化に寄与するか?
  • RQ4本手法は、シミュレーションから実世界へのドメインランダマイゼーションを伴わず、どの程度の実世界展開が可能か?
  • RQ5本手法は、1台のロボットシステムで視覚追跡と軸方向距離の維持を同時に実現できるか?

主な発見

  • 提案手法は、実際の腱駆動連続ロボット上で、10,000回未満の環境相互作用で動くターゲットの安定的視覚追跡を達成した。
  • 高さに基づく報酬形状化を追加したことで、ロボットは約20,000回の相互作用でターゲットとの一定距離を維持する学習を達成した。
  • KLダイバージェンスに基づく適応的活用係数ζは、先行知識と探索のバランスをうまく保ち、早期収束を防ぐのに成功した。
  • 実験結果から、本手法は最先端のモデルベースRL手法よりも少ない相互作用回数で学習を完了しており、優れたデータ効率性を示した。
  • シミュレーションから実世界への移行を伴わない実世界トレーニングパイプラインは、実世界の不確実性を的確に捉え、物理環境における頑健な性能を実現した。
  • 本手法は物理的ロボットへの直接展開を可能とし、視覚追跡および距離制御といった最小侵襲手術に類似したタスクで、成功したタスク実行を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。