Skip to main content
QUICK REVIEW

[論文レビュー] Trespassing the Boundaries: Labeling Temporal Bounds for Object Interactions in Egocentric Video

Davide Moltisanti, Michael Wray|arXiv (Cornell University)|Mar 27, 2017
Human Pose and Action Recognition参考文献 32被引用数 4
ひとこと要約

本論文は、3つのデータセットにおけるエゴセントリックなオブジェクトインタラクションの時間的境界アノテーションに顕著な不一致が存在することを特定し、開始時刻/終了時刻のわずかなずれが、最先端モデルにおいて認識精度を最大で10%低下させることを示している。これを是正するため、認知心理学にインspiredされた「Rubicon Boundaries」を提案。行動の段階に応じたラベル付け基準を定めることで、GTEA Gaze+で4%の精度向上を達成し、55%の行動クラスで分類性能が向上した。

ABSTRACT

Manual annotations of temporal bounds for object interactions (i.e. start and end times) are typical training input to recognition, localization and detection algorithms. For three publicly available egocentric datasets, we uncover inconsistencies in ground truth temporal bounds within and across annotators and datasets. We systematically assess the robustness of state-of-the-art approaches to changes in labeled temporal bounds, for object interaction recognition. As boundaries are trespassed, a drop of up to 10% is observed for both Improved Dense Trajectories and Two-Stream Convolutional Neural Network. We demonstrate that such disagreement stems from a limited understanding of the distinct phases of an action, and propose annotating based on the Rubicon Boundaries, inspired by a similarly named cognitive model, for consistent temporal bounds of object interactions. Evaluated on a public dataset, we report a 4% increase in overall accuracy, and an increase in accuracy for 55% of classes when Rubicon Boundaries are used for temporal annotations.

研究の動機と目的

  • エゴセントリック動画におけるオブジェクトインタラクションの時間的境界アノテーションの整合性が、3つの公開データセット間および内部でどの程度保たれているかを調査すること。
  • 時間的境界の摂動に対して、最先端の行動認識モデル(Improved Dense Trajectories および Two-Stream Convolutional Neural Networks)のロバストネスを評価すること。
  • 認知心理学にインspiredされたラベル付けフレームワーク「Rubicon Boundaries」を提案し、行動の段階に基づいて時間的境界アノテーションを標準化すること。
  • Rubicon Boundariesによる一貫性のあるラベル付けが、データ拡張を適用した場合でさえも認識精度と一般化性能の向上に寄与することを実証すること。

提案手法

  • GTEA Gaze+, GTEA Gaze+ Extended, EPFL-CD の3つのエゴセントリックデータセットにおける時間的境界の不一致を体系的に分析する。
  • 正解の時間的境界(IoU > 0.5)に対して制御された摂動を加え、IDTおよび2SCNNモデルの認識ロバストネスを評価する。
  • 認知心理学を基盤にしたラベル付けスキーム「Rubicon Boundaries」を導入。行動の段階(前行動的、行動的、後行動的)を定義する。
  • GTEA Gaze+ データセットをRubicon Boundariesに基づいて再アノテートし、2つのバージョンを作成:'act'(行動的段階のみ)と'full'(Rubiconセグメント全体)。
  • 2SCNNを、従来のラベル付けとRubiconラベル付けの両方のセグメントで同一条件で学習・評価し、境界の一貫性の影響を明確に分離する。
  • 時間的境界の開始時刻/終了時刻を変化させた正解および生成されたセグメントを用いて、従来ラベル付けとRubiconラベル付けの性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1エゴセントリック動画データセット間および内部で、オブジェクトインタラクションの時間的境界アノテーションはどの程度整合しているか?
  • RQ2ラベル付けされた時間的境界のばらつきが、最先端の行動認識モデルの性能にどの程度影響を与えるか?
  • RQ3認知心理学にインspiredされたラベル付けフレームワークは、エゴセントリック行動認識における一貫性と認識精度の向上に寄与できるか?
  • RQ4従来のアノテーションと比較して、Rubicon Boundariesを用いることで一般化性能およびロバストネスが向上するか?

主な発見

  • 3つのエゴセントリックデータセット間および内部で、時間的境界アノテーションに顕著な不一致が認められ、同じ行動クラスに対しても著しいばらつきが見られた。
  • 正解とのIoUが0.5を超える範囲で時間的境界を摂動させた場合でも、IDTおよび2SCNN両モデルの認識精度が最大で10%低下した。
  • GTEA Gaze+ データセットにおいて、Rubicon Boundariesによるラベル付けを適用することで、従来のラベル付けと比較して全体の認識精度が4%向上した。
  • 42の行動クラスのうち55%(23クラス)で、全Rubicon境界セグメントを用いることで認識精度が向上した。一方、10クラスは変化がなかった。
  • Rubiconラベル付けセグメントは境界摂動に対してより高いロバストネスを示し、同じ条件下で従来の生成セグメントよりも高い精度を達成した。
  • 精度向上は、データ拡張のみでは再現できない。これは、境界の一貫性の向上に起因する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。