Skip to main content
QUICK REVIEW

[論文レビュー] Guided Policy Search with Delayed Senor Measurements.

Connor Schenck, Dieter Fox|arXiv (Cornell University)|Sep 10, 2016
Reinforcement Learning in Robotics参考文献 23被引用数 3
ひとこと要約

本論文は、状態拡張を組み込むことで、遅延するセンサ測定値を伴う非マルコフ型環境にガイド付き方策探索を拡張し、正確な液体注ぎなどのタスクにおける有効な学習を可能にした。この手法は、センサ遅延にもかかわらず、サンプル効率を維持し、高い精度を達成し、実世界のロボット制御においても頑健な性能を示した。

ABSTRACT

Guided policy search is a method for reinforcement learning that trains a general policy for accomplishing a given task by guiding the learning of the policy with multiple guiding distributions. Guided policy search relies on learning an underlying dynamical model of the environment and then, at each iteration of the algorithm, using that model to gradually improve the policy. This model, though, often makes the assumption that the environment dynamics are markovian, e.g., depend only on the current state and control signal. In this paper we apply guided policy search to a problem with non-markovian dynamics. Specifically, we apply it to the problem of pouring a precise amount of liquid from a cup into a bowl, where many of the sensor measurements experience non-trivial amounts of delay. We show that, with relatively simple state augmentation, guided policy search can be extended to non-markovian dynamical systems, where the non-markovianess is caused by delayed sensor readings.

研究の動機と目的

  • センサ測定値に遅延がある非マルコフ型動的システムへのガイド付き方策探索の適用という課題に対処すること。
  • センサフィードバックの遅延があるロボット制御タスクにおいて、サンプル効率の高い強化学習を可能にすること。
  • センサ遅延によって生じる環境の非マルコフ性にもかかわらず、方策の一般化性と性能を維持すること。
  • 状態拡張が非マルコフ問題を方策学習に適したマルコフ問題に変換する方法の有効性を示すこと。

提案手法

  • システムダイナミクスにおけるマルコフ性を回復するために、遅延するセンサ測定値を状態空間に追加する。
  • 標準的なガイド付き方策探索と同様に、方策最適化中に環境遷移を学習された動的モデルでシミュレートする。
  • 拡張された状態空間を用いてガイド付き方策探索を適用し、モデルベースのロールアウトを用いて反復的に方策を改善する。
  • 遅延するセンサ読み取りを状態表現に統合することで、方策が完全な歴史的観測に基づいて意思決定できるようにする。
  • デモとモデルベースのロールアウトを用いて方策を訓練し、拡張された状態が遅延フィードバックがあっても正確な方策更新を可能にする。
  • 液体注ぎなどのタスクの構造を活用して、関連する遅延情報を取り込む意味のある状態拡張を定義する。

実験結果

リサーチクエスチョン

  • RQ1ガイド付き方策探索は、顕著なセンサ測定遅延を伴う非マルコフ型システムに効果的に適用可能か?
  • RQ2遅延測定値による状態拡張は、このような環境における方策学習をどのように改善するか?
  • RQ3提案手法は、遅延フィードバックがある実世界のロボット制御タスクにおいてもサンプル効率と性能を維持できるか?
  • RQ4拡張された状態空間は、ガイド付き方策探索に必要なマルコフ性をどの程度回復できるか?
  • RQ5この手法は、センサ遅延下でも正確な液体注ぎのような複雑な操作タスクに一般化可能か?

主な発見

  • 提案手法は、状態拡張を用いることで、遅延するセンサ測定値を伴う非マルコフ型システムへのガイド付き方策探索の拡張に成功した。
  • 状態拡張により、顕著なセンサ遅延があっても、液体注ぎタスクにおける高い精度を達成できるようになった。
  • モデルベースのロールアウトとガイド付き学習を活用することで、遅延観測があってもサンプル効率を維持した。
  • 実世界のロボット実験において、このアプローチは頑健な性能を示し、遅延センサ環境への実用的妥当性を示した。
  • 結果から、センサ遅延による非マルコフ型ダイナミクスは、構造的な状態拡張によって効果的に緩和可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。