Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Hierarchical Dirichlet Process-based Active Perception

Tadahiro Taniguchi, Toshiaki Takano|arXiv (Cornell University)|Oct 1, 2015
Advanced Image and Video Retrieval Techniques参考文献 50被引用数 5
ひとこと要約

本稿では、時間制約のもとで情報利得(IG)を最大化するように行動を選択する、マルチモーダルオブジェクト認識のためのアクティブな認識手法を提案する。マルチモーダル階層的ディリクレ過程(MHDP)を用い、IGの下で部分集合に下に減衰する性質と非減少性を有するため、計算コストを低減しながら近似的に最適な行動シーケンスを特定するための、モンテカルロ近似を用いたラジカルグリーディアルゴリズムを採用する。これにより、リアルタイムのロボット環境において高速かつ正確なオブジェクト分類が可能となる。

ABSTRACT

In this paper, we propose an active perception method for recognizing object categories based on the multimodal hierarchical Dirichlet process (MHDP). The MHDP enables a robot to form object categories using multimodal information, e.g., visual, auditory, and haptic information, which can be observed by performing actions on an object. However, performing many actions on a target object requires a long time. In a real-time scenario, i.e., when the time is limited, the robot has to determine the set of actions that is most effective for recognizing a target object. We propose an MHDP-based active perception method that uses the information gain (IG) maximization criterion and lazy greedy algorithm. We show that the IG maximization criterion is optimal in the sense that the criterion is equivalent to a minimization of the expected Kullback--Leibler divergence between a final recognition state and the recognition state after the next set of actions. However, a straightforward calculation of IG is practically impossible. Therefore, we derive an efficient Monte Carlo approximation method for IG by making use of a property of the MHDP. We also show that the IG has submodular and non-decreasing properties as a set function because of the structure of the graphical model of the MHDP. Therefore, the IG maximization problem is reduced to a submodular maximization problem. This means that greedy and lazy greedy algorithms are effective and have a theoretical justification for their performance. We conducted an experiment using an upper-torso humanoid robot and a second one using synthetic data. The experimental results show that the method enables the robot to select a set of actions that allow it to recognize target objects quickly and accurately. The results support our theoretical outcomes.

研究の動機と目的

  • 時間制約のもとでマルチモーダルオブジェクト認識のアクティブな認識における効率的行動選択の課題に対処すること。
  • MHDPの確率的構造を活用して理論的裏付けのある最適な行動選択を実現する、アクティブな認識手法を開発すること。
  • 視覚的、聴覚的、触覚的モダリティを用いて、ロボットがオブジェクトのカテゴリに関する情報利得を最大化する行動を自律的に選択できること。
  • MHDP下での情報利得関数の下に減衰する性質と非減少性を証明することで、グリーディおよびラジカルグリーディアルゴリズムを行動選択に用いる理論的根拠を提供すること。
  • 人間型ロボットと合成データを用いた実験的評価により、行動予算が限られた条件下でも、認識の高速化と正確性の向上を示すこと。

提案手法

  • 視覚的、聴覚的、触覚的モダリティにおけるマルチモーダルオブジェクトカテゴリを表現するために、非パラメトリックベイズモデルとしてのマルチモーダル階層的ディリクレ過程(MHDP)を用いる。
  • 行動選択の目的関数として、事後分布間の期待Kullback–Leibler距離を最小化するという理論的に最適な情報利得(IG)最大化基準を採用する。
  • MHDPの条件付き共役性およびグラフィカルモデル構造を活用して、IGの効率的なモンテカルロ近似を導出する。
  • MHDPの階層的構造のおかげで、IG関数が集合関数として部分集合に下に減衰する性質と非減少性を示すことを証明し、グリーディアルゴリズムの理論的保証を可能にする。
  • 計算コストを低減しながらもほぼ最適な性能を維持するため、部分集合最大化問題を効率的に解くためにラジカルグリーディアルゴリズムを適用する。
  • 行動が期待される情報利得に基づいて選択されるロボットシステムに本手法を統合し、人間型ロボット上でリアルタイムで実行可能であることを確認する。

実験結果

リサーチクエスチョン

  • RQ1MHDP下での情報利得最大化は、マルチモーダルオブジェクト認識のための最適な行動選択をもたらすか?
  • RQ2MHDP下での情報利得関数は、部分集合に下に減衰する性質と非減少性を示すか? これにより、効率的なグリーディ最適化が可能か?
  • RQ3MHDPの条件付き分布を活用することで、情報利得のモンテカルロ近似を効率的に計算できるか?
  • RQ4提案手法であるMHDPに基づくアクティブな認識手法は、行動予算制限のもとで認識時間の短縮と正確性の向上にどの程度効果的か?
  • RQ5本手法は、実際のセンサデータを用いたリアルタイムのロボット環境でも実用的に応用可能か?

主な発見

  • MHDP下での情報利得最大化基準は理論的に最適であり、最終的および中間の事後分布間の期待Kullback–Leibler距離を最小化する。
  • 情報利得関数が部分集合に下に減衰する性質と非減少性を示すことが証明され、グリーディおよびラジカルグリーディアルゴリズムの使用に理論的根拠が与えられる。
  • MHDPモデルの条件付き共役性を活用して、情報利得の効率的なモンテカルロ近似手法が導出された。
  • 人間型ロボットを用いた実験結果から、本手法は高速かつ正確なオブジェクト認識を可能にする行動シーケンスを選択することが確認され、ベースライン戦略を上回る性能を示した。
  • 合成データを用いた実験により、IGの理論的性質が確認され、ラジカルグリーディアルゴリズムが計算コストを削減しながらも高い認識正確性を維持していることが実証された。
  • 本手法は、正確なオブジェクト分類に必要な行動回数を効果的に削減でき、リアルタイムのロボット認識タスクにおける実用的妥当性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。