Skip to main content
QUICK REVIEW

[論文レビュー] Egocentric Object Manipulation Graphs

Eadom Dessalene, Michael Maynord|arXiv (Cornell University)|Jun 5, 2020
Human Pose and Action Recognition参考文献 34被引用数 17
ひとこと要約

Ego-OMG は、グラフ畳み込みネットワーク (GCN) と CSN 特徴量を用いて、意味的な時間的構造、短期的ダイナミクス、外見特徴を統合する、エゴセントリックなアクション予測のための新しいグラフベースの表現を提案する。これは、ハンドオブジェクト相互作用の構造的モデリングのおかげで、長期間にわたる予測性能に優れ、EPIC Kitchens アクション予測チャレンジにおいて未観測テストセットで1位、観測テストセットで2位を達成し、最先端の性能を発揮した。

ABSTRACT

We introduce Egocentric Object Manipulation Graphs (Ego-OMG) - a novel representation for activity modeling and anticipation of near future actions integrating three components: 1) semantic temporal structure of activities, 2) short-term dynamics, and 3) representations for appearance. Semantic temporal structure is modeled through a graph, embedded through a Graph Convolutional Network, whose states model characteristics of and relations between hands and objects. These state representations derive from all three levels of abstraction, and span segments delimited by the making and breaking of hand-object contact. Short-term dynamics are modeled in two ways: A) through 3D convolutions, and B) through anticipating the spatiotemporal end points of hand trajectories, where hands come into contact with objects. Appearance is modeled through deep spatiotemporal features produced through existing methods. We note that in Ego-OMG it is simple to swap these appearance features, and thus Ego-OMG is complementary to most existing action anticipation methods. We evaluate Ego-OMG on the EPIC Kitchens Action Anticipation Challenge. The consistency of the egocentric perspective of EPIC Kitchens allows for the utilization of the hand-centric cues upon which Ego-OMG relies. We demonstrate state-of-the-art performance, outranking all other previous published methods by large margins and ranking first on the unseen test set and second on the seen test set of the EPIC Kitchens Action Anticipation Challenge. We attribute the success of Ego-OMG to the modeling of semantic structure captured over long timespans. We evaluate the design choices made through several ablation studies. Code will be released upon acceptance

研究の動機と目的

  • 人間-オブジェクト相互作用の意味的な時間的構造をモデル化することで、エゴセントリック動画におけるアクション予測を向上させること。
  • 外見特徴のみまたはエンドツーエンドの動画モデルの限界を克服し、長期間にわたる予測性能を向上させること。
  • 外見特徴を簡単に交換可能にするモジュラーなフレームワークを構築することで、既存の手法との互換性を高めること。
  • EPIC Kitchens の一貫したエゴセントリック視点を活用し、ハンド中心の手がかりをモデル化することで、アクション予測の精度を向上させること。
  • グラフ構造による相互作用状態のモデリングが、順序付きまたはプーリングベースの特徴集約に比べて顕著に優れていることを実証すること。

提案手法

  • Ego-OMG は、ハンド-オブジェクト接触イベントによって定義される状態をノードとするグラフを構築し、時間的経過に伴うハンドとオブジェクト間の意味的関係を捉える。
  • グラフのノードは、グラフ畳み込みネットワーク (GCN) を用いて低次元ベクトルに埋め込まれ、相互作用ダイナミクスの構造的モデリングを可能にする。
  • 短期的なハンドのダイナミクスは3次元畳み込みと、軌道に基づく接触点予測を用いてモデル化され、相互作用セグメントを分離する。
  • 外見特徴は、空間的・時間的運動と外見を捉える3次元畳み込みを用いた CSN (畳み込みシアン・ネットワーク) で抽出される。
  • 長短期記憶 (LSTM) ネットワークが、グラフ埋め込み状態の系列を処理し、時間的変化をモデル化し、長期間にわたる予測を支援する。
  • 最終的な予測ヘッドは、LSTM による状態履歴に基づいて将来のアクションを分類する。アブレーションスタディにより、各構成要素の寄与度が検証されている。

実験結果

リサーチクエスチョン

  • RQ1ハンドオブジェクト相互作用グラフによる意味的な時間的構造のモデリングは、エンドツーエンドの動画モデルと比較して、長期間にわたるアクション予測性能をどのように向上させるか?
  • RQ2GCN を用いたグラフ埋め込みは、単純なプーリングや終端状態分類と比較して、アクション予測性能にどの程度寄与するか?
  • RQ3CSN を用いた外見特徴と、ハンドの軌道に基づくダイナミクスモデリングの統合は、予測精度をどの程度向上させるか?
  • RQ4事前学習済みの単語埋め込み (GloVe) は、グラフ内の相互作用状態の表現をどの程度改善するか?
  • RQ5LSTM を用いた状態履歴の集約は、平均プーリングや終端状態分類といった代替戦略と比較して、どの程度優れているか?

主な発見

  • Ego-OMG は、EPIC Kitchens アクション予測チャレンジにおいて、未観測テストセットで1位、観測テストセットで2位を達成し、これまでに発表されたすべての手法を上回った。
  • CSN と GCN の両ストリームを統合した統合モデルは、片方のストリームのみを用いたアブレーションより優れた性能を示し、5秒の予測ホライズンにおいて GCN 単体でも CSN を上回った。
  • LSTM を用いたグラフ埋め込み状態の集約は、トップ1正解率12.81%を達成し、平均集約 (9.74%) や終端状態分類 (11.70%) を顕著に上回った。
  • GCN に GloVe 埋め込みを用いることで、トップ1正解率は12.81%に達したが、GCN を除去した場合や単位行列を用いた場合、正解率はそれぞれ6.67%および3.62%に低下した。
  • アブレーションスタディにより、グラフ埋め込みと LSTM を用いた順序付きモデリングが、長期間にわたる予測において不可欠であることが確認され、予測時間の延長に伴い性能が滑らかに低下した。
  • モジュラーな設計により、外見特徴の簡単な交換が可能であり、Ego-OMG は既存のアクション予測フレームワークと相性が良い。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。