Skip to main content
QUICK REVIEW

[論文レビュー] Sensorimotor learning for artificial body perception

German Diez-Valencia, Takuya Ohashi|arXiv (Cornell University)|Jan 15, 2019
Action Observation and Synchronization参考文献 11被引用数 4
ひとこと要約

本稿では、センサモータリィ学習を用いて、階層ベイジアンモデル、予測コーディング、生成対抗ネットワーク(GAN)を組み合わせたマルチメソッドフレームワークを提案し、マーカーやセグメンテーションなしで自己検出とクロスモーダルなボディ表現を可能にする人工的ボディ認識を実現する。深層畳み込み生成対抗ネットワーク(DC-GAN)を用いて関節角度からロボットアームマスクを再構築する実験で、84.4%の精度を達成し、セグメンテーションやマーカーを用いずに安定した自己認識を実現した。

ABSTRACT

Artificial self-perception is the machine ability to perceive its own body, i.e., the mastery of modal and intermodal contingencies of performing an action with a specific sensors/actuators body configuration. In other words, the spatio-temporal patterns that relate its sensors (e.g. visual, proprioceptive, tactile, etc.), its actions and its body latent variables are responsible of the distinction between its own body and the rest of the world. This paper describes some of the latest approaches for modelling artificial body self-perception: from Bayesian estimation to deep learning. Results show the potential of these free-model unsupervised or semi-supervised crossmodal/intermodal learning approaches. However, there are still challenges that should be overcome before we achieve artificial multisensory body perception.

研究の動機と目的

  • マーカーや手動セグメンテーションを用いずに、センサモータリィの継続的変化を活用してロボットが自らの体を認識できるようにすること。
  • リアルタイムで自己生成の感覚入力(インボディ)と外部からの入力(アウトボディ)を区別する課題に取り組むこと。
  • 視覚、体位覚、触覚信号を統合する視覚的・体位覚的・触覚的信号の非教師ありクロスモーダル学習アーキテクチャを構築すること。
  • 深層生成モデルを用いて、異なる背景やセンサ構成に対しても一般化可能なボディ認識を実現すること。
  • ラバーハンド錯覚のような現象を再現する生物学的に妥当なボディ認識メカニズムを実現すること。

提案手法

  • 体位覚的および視覚的情報を用いて、視覚領域がロボットの体に属する確率を推定するため、階層ベイジアン推論グリッドを採用した。
  • 自由エネルギーの下界を最小化する潜在的ボディ状態を推定するために、ガウス過程回帰を用いた予測コーディングを適用した。
  • 深層畳み込み生成対抗ネットワーク(DC-GAN)を用いて、関節角度から合成背景上でのアームの外観を生成する前向きの視覚的・運動学的モデルを学習した。
  • 背景差分法を用いてランダムな背景とブールマスクを生成することで、合成トレーニングデータを生成し、一般化性能を向上させた。
  • 共有表現を用いない、ワサーラインGANベースのノイズ除去オートエンコーダをフレームワークに統合し、視覚的・触覚的・体位覚的信号を再構築した。
  • 同期された関節角度、タッチセンサアレイ、視覚フィールド内での2次元キューブ位置を備えた、シミュレーテッドiCubデータをオフラインでトレーニングした。

実験結果

リサーチクエスチョン

  • RQ1マーカーやセグメンテーションなしで、センサモータリィフィードバックのみを用いてロボットが自らの体と環境を区別して学習できるか?
  • RQ2ガウス過程回帰を用いた予測コーディングは、ロボットのボディスキーマにおいて人間らしい体位覚的ずれのパターンを再現できるか?
  • RQ3明示的なセグメンテーションなしで、GANベースのモデルが多様な背景においてロボットアームの視覚的外観をどの程度一般化できるか?
  • RQ4ノイズ除去オートエンコーダアーキテクチャは、視覚的・触覚的・体位覚的信号をクロスモーダル入力から再構築する際にどの程度効果的か?
  • RQ5非教師ありで自己生成されるパターンが、強固で柔軟な人工的ボディ認識を可能にする役割を果たすか?

主な発見

  • 階層ベイジアンモデルは、マーカーなしで視覚的および加速度計データのベイジアンフィルタリングにより、インボディとアウトボディの視覚的ソースを正確に区別し、自己検出を実現した。
  • 予測コーディングモデルは、同期的な視覚的・触覚的摂動を引き起こすことで、ラバーハンド錯覚をロボット上で再現し、妥当なボディスキーマの適応を示した。
  • DC-GANは、すべてのテスト設定において、元のアームマスク領域と生成された領域の一致率が84.4%に達し、学習されていない背景タイプに対しても安定した性能を示した。
  • アームの大部分が視野外にある場合、モデルはアームの再構築に失敗し、部分的可視性下での一般化性能の限界が示された。
  • 畳み込み層はタッチセンサアレイからの空間的構造を効果的に抽出したが、モダリティの不一致のため、信頼性のあるタッチ信号の再構築には失敗した。
  • ノイズ除去オートエンコーダは、マルチモーダルデータ(関節角度、タッチ、視覚的キューブ位置)を効果的に再構築した。図4の再構築されたカラムは、元のデータとよく一致していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。