Skip to main content
QUICK REVIEW

[論文レビュー] Building Unified Human Descriptors For Multi-Type Activity Recognition.

Ilaria Gori, J.K. Aggarwal|arXiv (Cornell University)|Jul 9, 2015
Human Pose and Action Recognition参考文献 33被引用数 6
ひとこと要約

本論文は、関係履歴画像(RHI)記述子を提案することで、単一の表現内で多様な活動タイプ—単一行動、相互作用、エゴセントリック活動—を捉える統合フレームワークを導入する。この手法により、活動認識と人物関連付けを統合的に実行でき、新たに収集したデータセットおよび公開ベンチマークにおいて優れた性能を示し、RHIが複雑なマルチタイプ活動シーンに有用かつ効果的な記述子であることが確立される。

ABSTRACT

Activity recognition is an important as well as a difficult task in computer vision. In the past years many types of activities -- single actions, two persons interactions or ego-centric activities to name a few -- have been analyzed. Nevertheless, researchers have always treated such types of activities separately. In this paper, we propose a new problem: labeling a complex scene where activities of different types happen in sequence or concurrently. We first present a new unified descriptor, called Relation History Image (RHI), which can be extracted from all the activity types we are interested in. We then propose a new method to recognize the activities and at the same time associate them to the humans who are performing them. Next, we evaluate our approach on a newly recorded dataset which is representative of the problem we are considering. Finally, we show the efficacy of the RHI descriptor on publicly available datasets performing extensive evaluations.

研究の動機と目的

  • 複雑なシーンにおいて、単一行動、二人の相互作用、エゴセントリック活動などの多様なタイプの人体活動を同時に認識する課題に対処すること。
  • 異なる活動タイプを1つの一貫した記述子で統合的に表現することで、活動認識と人物関連付けを統合的に実行すること。
  • 一度のフレームワーク内で順次的および同時的な活動を処理できる手法を開発し、活動タイプ間での一般化を向上させること。
  • 実世界の複雑さを反映する、新たに記録したデータセットを用いて、提案手法の有効性を評価すること。

提案手法

  • すべての活動タイプにおいて、人体部品と物体間の関係的特徴を時間経過にわたって符号化する統合的時空間的記述子として、関係履歴画像(RHI)を提案する。
  • RHI表現を用いて、活動ラベルの同時予測とそれらの実行者との関連付けを実行する認識パイプラインを設計する。
  • マルチタイプ、同時に発生するおよび順次的な活動をアノテートした新たに収集したデータセット上で、モデルをエンドツーエンドで学習および微調整する。
  • RHI記述子を公開データセットに移行・評価することで、異なる活動ドメインにわたる一般化性と頑健性を検証する。

実験結果

リサーチクエスチョン

  • RQ1単一の統合的記述子が、単一行動、相互作用、エゴセントリック活動を含む多様な活動タイプを効果的に表現できるか?
  • RQ2統合モデルは、複雑なシーン内で同時に発生するか順次的に発生する複数の活動タイプをどれほど正確に認識・関連付けることができるか?
  • RQ3RHI記述子は、再訓練なしに異なるデータセットや活動ドメインに一般化できるか?
  • RQ4複雑なマルチタイプ活動シナリオにおいて、活動認識と人物関連付けを統合することの性能への影響は何か?

主な発見

  • 関係履歴画像(RHI)記述子は、複数の公開データセットで優れた性能を発揮し、学習ドメインを超えた有効性と一般化能力を示している。
  • 提案手法は、順次的および同時的な活動タイプを含む複雑なシーンにおいて、活動を正しく認識し、実行者と関連付けることに成功している。
  • 新たに記録したデータセットにおける評価により、重複する活動パターンや多様な活動パターンを含む実世界の複雑さに対処できる能力が確認された。
  • 活動タイプ間で共有表現を活用することで、分類タスクに特化したアプローチに比べ、各活動カテゴリごとに別々のモデルを必要としなくてもよくなるため、統合フレームワークは優れた性能を発揮している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。