Skip to main content
QUICK REVIEW

[論文レビュー] Co-active Learning to Adapt Humanoid Movement for Manipulation

Ren Mao, John S. Baras|arXiv (Cornell University)|Sep 12, 2016
Robot Manipulation and Learning参考文献 12被引用数 5
ひとこと要約

本稿では、反復的な人間のフィードバックを用いて、人間型ロボットの操作タスクにおける動きの適応を実現する共同学習フレームワークを提案する。タスク文脈の認識、動きの模倣、ポリシー最適化、オンライン重み更新を統合し、三つの部分に分けた重みベクトル(模倣、文脈、環境)を用いることで、射影勾配更新による収束を達成し、より優れた適応性を実現する。

ABSTRACT

In this paper we address the problem of robot movement adaptation under various environmental constraints interactively. Motion primitives are generally adopted to generate target motion from demonstrations. However, their generalization capability is weak while facing novel environments. Additionally, traditional motion generation methods do not consider the versatile constraints from various users, tasks, and environments. In this work, we propose a co-active learning framework for learning to adapt robot end-effector's movement for manipulation tasks. It is designed to adapt the original imitation trajectories, which are learned from demonstrations, to novel situations with various constraints. The framework also considers user's feedback towards the adapted trajectories, and it learns to adapt movement through human-in-the-loop interactions. The implemented system generalizes trained motion primitives to various situations with different constraints considering user preferences. Experiments on a humanoid platform validate the effectiveness of our approach.

研究の動機と目的

  • 人間が提供するフィードバックを用いて、人間型ロボットがリアルタイムで操作動作を適応可能にする。
  • 複雑な操作タスクにおける動的タスク文脈と不完全な模倣の課題に対処する。
  • 認識、模倣、フィードバック駆動型ポリシー適応を統合する包括的な学習フレームワークを構築する。
  • 複数の重み成分の射影的オンライン更新を通じて、安定的かつ収束するポリシー学習を保証する。

提案手法

  • 本手法は、模倣、文脈、環境の特徴を組み合わせた合成重みベクトルを初期化する:$\bm{w}^{(0)} = [\bm{w}_{D}^{(0)\top}, \bm{w}_{C}^{(0)\top}, \bm{w}_{E}^{(0)\top}]^{\top}$。
  • 各反復 $i$ において、システムは現在のタスク文脈 $\bm{x}_{c}^{(i)}$ を認識し、$p(\bm{\mathcal{T}}|\bm{x}_{c}^{(i)})$ を生成して $\bm{y}_{D}^{(i)}$ と $\bm{\Sigma}_{D}^{(i)}$ を抽出する。
  • 報酬関数 $f(\bm{y}, \bm{x}_{c}^{(i)}, \bm{y}_{D}^{(i)}; \bm{w}^{(i)})$ を最大化するようにポリシー $\bm{\pi}^{*(i)}$ を最適化し、実行用の行動 $\bm{y}^{(i)}$ を生成する。
  • 実行後、人間のフィードバック $\bm{\bar{y}}^{(i)}$ を用いて、減少するステップサイズ $\alpha^{(i)} = 1/\sqrt{i}$ で重みを更新する。
  • 模倣($\bm{w}_{D}$)、文脈($\bm{w}_{C}$)、環境($\bm{w}_{E}$)のそれぞれについて、分離された三つの重み更新を実行する。特徴の差分を用いる。
  • 射影ステップにより、更新された重み $\bm{w}^{(i+1)}$ が可能集合 $\bm{C}$ 内に保たれ、重み空間における発散を防ぎ、安定性と収束性を維持する。

実験結果

リサーチクエスチョン

  • RQ1人間型ロボットは、リアルタイムの人のフィードバックにどのように効果的に対応して操作ポリシーを適応させることができるか?
  • RQ2認識、模倣、フィードバックを統合する最適な方法は何か?
  • RQ3模倣、文脈、環境のための分離された重み成分は、ポリシー適応にどのように寄与するか?
  • RQ4非定常環境において、オンラインでフィードバック駆動型の重み更新を実行する場合、どのような収束保証を得られるか?

主な発見

  • 共同学習フレームワークにより、人間のフィードバックを用いて人間型ロボットの操作ポリシーの安定的かつ反復的適応が可能になった。
  • 減少するステップサイズ $\alpha^{(i)} = 1/\sqrt{i}$ の使用により、時間の経過とともに重み更新が収束することが保証された。
  • 射影更新機構により、妥当性が維持され、重み空間における発散が防止された。
  • 模倣、文脈、環境の重み成分を分離することで、モジュラーかつ解釈可能なポリシー学習が可能になった。
  • アルゴリズムは、認識、模倣、ポリシー最適化、フィードバックを一つの統合的ループに効果的に統合した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。