Skip to main content
QUICK REVIEW

[論文レビュー] Generating Goal-Directed Visuomotor Plans Based on Learning Using a Predictive Coding-type Deep Visuomotor Recurrent Neural Network Model

Minkyu Choi, Takazumi Matsumoto|arXiv (Cornell University)|Mar 7, 2018
Visual perception and processing mechanisms参考文献 17被引用数 5
ひとこと要約

本論文では、訓練中に視覚的・体性感覚的シーケンスから意図状態を推定することで、目的志向の視覚的・運動的計画を学習する予測符号化型の深層視覚運動再帰ニューラルネットワーク(P-DVMRNN)を提案する。モデルは予測誤差を最小化することで、学習されていない目的状態に対しても一般化し、実ロボット実験で複数ステップの計画を成功裏に生成したが、十分な訓練データに依存しており、低解像度の視覚入力によって制限を受ける。

ABSTRACT

The current paper presents how a predictive coding type deep recurrent neural networks can generate vision-based goal-directed plans based on prior learning experience by examining experiment results using a real arm robot. The proposed deep recurrent neural network learns to predict visuo-proprioceptive sequences by extracting an adequate predictive model from various visuomotor experiences related to object-directed behaviors. The predictive model was developed in terms of mapping from intention state space to expected visuo-proprioceptive sequences space through iterative learning. Our arm robot experiments adopted with three different tasks with different levels of difficulty showed that the error minimization principle in the predictive coding framework applied to inference of the optimal intention states for given goal states can generate goal-directed plans even for unlearned goal states with generalization. It was, however, shown that sufficient generalization requires relatively large number of learning trajectories. The paper discusses possible countermeasure to overcome this problem.

研究の動機と目的

  • 予測符号化の原則に従い、学習可能でエンドツーエンドの深層ニューラルネットワークを、目的志向の視覚的・運動的計画に用いる。
  • 訓練済みでない目的状態に対しても、望ましい知覚的結果を生成する意図状態をロボットが推論できるようにする。
  • 訓練データ量が視覚的・運動的計画の一般化性能に与える影響を調査する。
  • 推論された意図状態から、長時間スパンの視覚的・体性感覚的シーケンスを生成するモデルの能力を評価する。

提案手法

  • P-DVMRNNモデルは、予測誤差の最小化を通じて、意図状態(内部ニューラル状態)から視覚的・体性感覚的シーケンスへの因果的マッピングを深層再帰的アーキテクチャで学習する。
  • 意図状態は訓練中に自己決定され、RNNの初期隠れ状態として符号化され、目的志向行動の内部表現を推論可能にする。
  • モデルは、複数のタスクにおける異なるロボット軌道の、ピクセルレベルの視覚と関節角度の同期シーケンスをオフラインで訓練する。
  • 計画のための推論は、学習されたマッピングを逆転することで行う:たとえば、ターゲット視覚フレーム(目的状態)が与えられた場合、それが生成されるような意図状態を推定する。
  • フレームワークは誤差最小化を用い、反復的に意図状態の推定値を改善することで、予測符号化による目的志向の計画を可能にする。
  • 1ステップおよび複数ステップの予測は、フィードバックあり(クローズドループ)およびフィードバックなし(オープンループ)の設定で評価され、計画の正確さを検証する。

実験結果

リサーチクエスチョン

  • RQ1予測符号化に基づく深層RNNは、学習済みでない目的状態からの未学習の視覚的・運動的結果を生成する意図状態を推論できるか?
  • RQ2訓練データ量が、視覚的・運動的計画の一般化能力にどのように影響するか?
  • RQ3リアルタイムフィードバックなしで、モデルが正確な複数ステップの視覚的および運動的シーケンスをどの程度正確に生成できるか?
  • RQ4画像解像度と感覚の忠実度は、物体の把持といった複雑な操作タスクの成功にどのように影響するか?
  • RQ5空間的制御が高度に必要なタスクを含め、難易度の異なるタスク間でモデルは一般化できるか?

主な発見

  • P-DVMRNNは、予測誤差の最小化による意図状態の推定を通じて、学習済みでない目的状態に対しても目的志向の視覚的・運動的計画を成功裏に生成し、タスク間での一般化を示した。
  • 最初のタスク(到達)では、75%の成功率を達成したが、訓練データが減少すると著しく低下した。
  • 物体操作タスクでは、厳密な把持条件では48%の成功率を示したが、把持位置に最大3ピクセル(3.9 cm)のずれを許容すると71%に向上した。
  • フィードバックなしのオープンループ予測は、フィードバックありのクローズドループ予測を大きく上回り、3ピクセルの許容誤差を許すと93%の成功率を達成した。
  • 視覚的および運動的モalityの両方において、遠くの将来の予測(複数ステップ先)を強力に生成でき、内部計画能力の高さを示した。
  • 本研究では、訓練データが不足していると一般化性能が著しく制限されることを特定し、データ効率を向上させるためのバリエーションベイズ正則化が有効な解決策である可能性を示唆した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。