Skip to main content
QUICK REVIEW

[論文レビュー] Exploiting Egocentric Object Prior for 3D Saliency Detection

Gedas Bertasius, Hyun Soo Park|arXiv (Cornell University)|Nov 9, 2015
Visual Attention and Saliency Detection参考文献 24被引用数 5
ひとこと要約

本論文では、エゴセントリックRGBD画像から形状、位置、サイズ、深度の特徴を符号化するEgoObject表現を提案し、3次元サリエンシー検出のための固定サイズの事前知識をモデル化する。人間の視覚認識に関する心理学的知見を活用することで、3次元サリエンシー検出において30%の相対的向上を達成し、新規のエゴセントリックRGBDサリエンシー・データセットを用いて、将来のサリエンシー予測とインタラクション分類の両方を正確に実行可能となる。

ABSTRACT

On a minute-to-minute basis people undergo numerous fluid interactions with objects that barely register on a conscious level. Recent neuroscientific research demonstrates that humans have a fixed size prior for salient objects. This suggests that a salient object in 3D undergoes a consistent transformation such that people's visual system perceives it with an approximately fixed size. This finding indicates that there exists a consistent egocentric object prior that can be characterized by shape, size, depth, and location in the first person view. In this paper, we develop an EgoObject Representation, which encodes these characteristics by incorporating shape, location, size and depth features from an egocentric RGBD image. We empirically show that this representation can accurately characterize the egocentric object prior by testing it on an egocentric RGBD dataset for three tasks: the 3D saliency detection, future saliency prediction, and interaction classification. This representation is evaluated on our new Egocentric RGBD Saliency dataset that includes various activities such as cooking, dining, and shopping. By using our EgoObject representation, we outperform previously proposed models for saliency detection (relative 30% improvement for 3D saliency detection task) on our dataset. Additionally, we demonstrate that this representation allows us to predict future salient objects based on the gaze cue and classify people's interactions with objects.

研究の動機と目的

  • 神経科学的知見に基づき、顕著な物体に対して固定サイズの事前知識が第一人称視覚認識に一貫して存在するかどうかを調査すること。
  • 物体クラスのテンプレートや手作業による検出に依存せずに、形状、位置、サイズ、深度の特徴を捉える表現を開発すること。
  • 現実世界のエゴセントリックなシナリオにおける3次元サリエンシー検出、将来のサリエンシー予測、インタラクション分類のタスクにおいて、この表現を評価すること。
  • 複数のタスクに適合するようにアノテートされた新しいエゴセントリックRGBDサリエンシー・データセットを構築・公開し、サリエンシー・モデルの堅牢な評価を支援すること。

提案手法

  • エゴセントリックRGBDフレームから形状、位置、サイズ、深度の特徴を符号化するEgoObject表現を提案し、一貫したエゴセントリック物体事前知識をモデル化する。
  • RGBD画像から抽出した領域レベルの特徴を用いてトレーニングすることで、ランダムフォレスト分類器を用いてサリエンシー地図を学習する。
  • エゴセントリックステレオカメラから得られる深度情報を活用して、物体までの距離を推定し、これはサリエンシーおよびインタラクション予測の重要な手がかりである。
  • 日常的な活動(調理、食事、ショッピングなど)を捉えた新しいエゴセントリックRGBDサリエンシー・データセットを用いて、モデルをトレーニングおよび評価する。
  • 時間的フレームを入力として用いることで、視線と近接性の手がかりをモデル化し、EgoObject表現を用いて将来のサリエンシーを予測する。
  • 深度に基づくしきい値を学習し、EgoObject特徴を用いて、インタラクションタイプを区別することで、「視認」または「接触」としてのインタラクションを分類する。

実験結果

リサーチクエスチョン

  • RQ1顕著な3次元物体に対して、予測可能な形状、サイズ、位置、深度のパターンを特徴とする一貫したエゴセントリック物体事前知識が、第一人称視覚認識に存在するか?
  • RQ2形状、位置、サイズ、深度の特徴を符号化するエゴセントリックRGBD表現は、従来の手法と比較して3次元サリエンシー検出性能を向上させることができるか?
  • RQ3EgoObject表現は、現在の視線と近接性の手がかりに基づいて、将来の顕著な物体を予測できるか?
  • RQ4EgoObject表現は、深度と空間的特徴を用いて、人間-物体インタラクションを「視認」と「接触」に分類できるか、その程度はどの程度か?
  • RQ5個々の特徴(形状、位置、サイズ、深度、文脈)はサリエンシー検出にどの程度寄与しており、どの特徴が最も情報量が多いか?

主な発見

  • EgoObject表現は、提案されたデータセット上で、従来モデルと比較して30%の相対的向上を達成した。
  • 形状特徴がサリエンシー検出に最も寄与し、次いで位置、サイズ、深度の順であり、文脈特徴が最も情報量が少なかった。
  • 将来のサリエンシー検出器(FSD)は、2秒予測において平均8.7 Fスコアポイントの向上を示し、2、4、6秒予測の最大Fスコアではそれぞれ26.1、24.5、22.1の向上を示した。
  • EgoObjectに基づくインタラクション分類器は、8つのインタラクションカテゴリにおいて、深度しきい値ベースラインと比較して平均9.7%高い正確性を達成した。
  • 可視化結果から、スーパーマーケットのような複雑な環境でも、モデルが意味のある将来のサリエンシー予測を生成していることが示された。
  • 特徴の重要度分析により、深度とサイズの特徴が非常に情報量が多く、心理学的直観(物体の近接性と認識されるサイズがエゴセントリックサリエンシーの主要な手がかりである)が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。