Skip to main content
QUICK REVIEW

[論文レビュー] Self-learning and adaptation in a sensorimotor framework

Ali Ghadirzadeh, Judith Bütepage|arXiv (Cornell University)|Jan 5, 2016
Gaussian Processes and Bayesian Inference参考文献 15被引用数 4
ひとこと要約

本論文では、次元削減のための自動関連性決定を用いたガウス過程を用いて、ロボットがセンサモータ情報を自己学習することで、自律的かつ柔軟にモーターコマンドを学習・適応可能にするフレームワークを提案する。長期的計画にはRRT*を、リアルタイムの行動選択には勾配ベース最適化を組み合わせることで、12秒未満という短時間でデータ効率の高い学習が達成され、追加された負荷などの環境変化に対しても迅速に適応する。高次元の関節空間制御においてリアルタイム性能を実現した。

ABSTRACT

We present a general framework to autonomously achieve a task, where autonomy is acquired by learning sensorimotor patterns of a robot, while it is interacting with its environment. To accomplish the task, using the learned sensorimotor contingencies, our approach predicts a sequence of actions that will lead to the desirable observations. Gaussian processes (GP) with automatic relevance determination is used to learn the sensorimotor mapping. In this way, relevant sensory and motor components can be systematically found in high-dimensional sensory and motor spaces. We propose an incremental GP learning strategy, which discerns between situations, when an update or an adaptation must be implemented. RRT* is exploited to enable long-term planning and generating a sequence of states that lead to a given goal; while a gradient-based search finds the optimum action to steer to a neighbouring state in a single time step. Our experimental results prove the successfulness of the proposed framework to learn a joint space controller with high data dimensions (10$ imes$15). It demonstrates short training phase (less than 12 seconds), real-time performance and rapid adaptations capabilities.

研究の動機と目的

  • 事前の専門家知識やロボットモデルの仮定なしに、自律的かつセンサモータタスクを学習可能にする。
  • 不確実性や動的環境変化下における高次元のセンサおよびモータ空間の課題に対処する。
  • 負荷変化やタスク条件の変化といった外部の摂動を検出し、適応可能とするシステムの開発。
  • 制約付きで非凸な制御タスクにおいて、長期的計画とリアルタイム行動最適化を統合する。
  • データ効率的で段階的な学習を実現するとともに、関連するセンサおよびモータ次元を自動で同定する。

提案手法

  • 高次元空間における入力次元の関連性を特定するために、自動関連性決定(ARD)を用いたガウス過程を用いて、前向きのセンサモータマッピングを学習する。
  • 予測誤差に基づいて、モデル更新とシステムの適応を区別する段階的学習戦略を採用する。
  • 過剰応答を最小限に抑えるために、ゴールに偏ったサンプリングを用いたRRT*を用いて、タスク制約を満たす行動シーケンスを生成する。
  • 各時刻で勾配ベース最適化を実行し、隣接状態への最適な行動を計算する。
  • 予測されたと実際のセンサ出力(例:関節位置)の不一致を検出し、予測誤差がしきい値を超えた際に適応をトリガーする。
  • 変化した条件下で収集された新しい測定値と、古くなった訓練データペアを交換することで、迅速な適応を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ロボットは、事前のモデルや専門家のデモンストレーションなしに、センサモータフィードバックのみを用いて最適なモーターコマンドを自律的に学習できるか?
  • RQ2タスク実行中に、追加された負荷などの環境変化をシステムが検出し、適応できるか?
  • RQ3RRT*計画が、高次元制御タスクにおける過剰応答を最小限に抑えることで、軌道品質をどの程度向上できるか?
  • RQ4自動関連性決定は、関連するセンサおよびモータコンponentsを同定することで、計算コストをどの程度低減できるか?
  • RQ5このフレームワークは、複雑で動的な環境においてもリアルタイム性能を維持し、迅速な収束を達成できるか?

主な発見

  • 10×15次元のタスク空間において、関節空間コントローラーの学習が12秒未満で成功した。
  • 外部摂動(例:ロボットのグリッパーに300gの負荷が追加された場合)に対しても、リアルタイム性能を維持し、迅速に適応した。
  • 次元削減により、過剰応答が低減され、図6(左)に示すように、目標状態に安定した。計画は約32秒後に開始された。
  • 予測誤差がしきい値を超えたことで適応がトリガーされ、数イテレーションで適用トルクの不一致を検出し、是正可能となった。
  • RRT*計画により、ゴールに近いサンプリングを優先し、コストを最小化することで、過剰応答を回避する行動シーケンスが成功的に生成された(図7を参照)。
  • 本手法により、変化の能動的検出が可能となり、環境が変化した条件下で古くなった訓練データペアを新しい測定値に置き換えることで、動的環境へのロバスト性が確保された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。