Skip to main content
QUICK REVIEW

[論文レビュー] BON: An extended public domain dataset for human activity recognition

Girmaw Abebe Tadesse, Oliver Bent|arXiv (Cornell University)|Sep 12, 2022
Context-Aware Activity Recognition Systems被引用数 5
ひとこと要約

本論文では、バルセロナ、オックスフォード、ナイロビの3か所で、25名の被験者を対象に胸に装着したGoProカメラを用いて収集した、18の一般的なオフィス行動からなる大規模かつ公開可能な第一人称視覚(FPV)データセット、BONを紹介する。このデータセットは、詳細なアノテーションが施された2,639個の5秒間の動画セグメントを含み、IEEE VIP Cup 2019で上位3名のモデルが提供されており、クラス内変動やクラス間類似性といった課題が存在するものの、エゴセントリックなオフィス行動認識のための堅実なベンチマークが可能となる。

ABSTRACT

Body-worn first-person vision (FPV) camera enables to extract a rich source of information on the environment from the subject's viewpoint. However, the research progress in wearable camera-based egocentric office activity understanding is slow compared to other activity environments (e.g., kitchen and outdoor ambulatory), mainly due to the lack of adequate datasets to train more sophisticated (e.g., deep learning) models for human activity recognition in office environments. This paper provides details of a large and publicly available office activity dataset (BON) collected in different office settings across three geographical locations: Barcelona (Spain), Oxford (UK) and Nairobi (Kenya), using a chest-mounted GoPro Hero camera. The BON dataset contains eighteen common office activities that can be categorised into person-to-person interactions (e.g., Chat with colleagues), person-to-object (e.g., Writing on a whiteboard), and proprioceptive (e.g., Walking). Annotation is provided for each segment of video with 5-seconds duration. Generally, BON contains 25 subjects and 2639 total segments. In order to facilitate further research in the sub-domain, we have also provided results that could be used as baselines for future studies.

研究の動機と目的

  • 第一人称視覚を用いたエゴセントリックなオフィス行動認識のための、大規模かつ公開可能なデータセットの不足に応えること。
  • 異なる地理的場所における多様で現実世界のオフィス行動データを収集し、モデルの汎化性能を向上させること。
  • 18種類の異なるオフィス行動を人間同士、人間と物、自己認識の3つのカテゴリに分類した、豊富なアノテーションが施されたデータセットを提供すること。
  • IEEE VIP Cup 2019の上位3名のベースラインモデルを公開することで、BONデータセットを用いたベンチマークを容易にすること。
  • オフィス環境における実世界の課題、例えば照明の変化、遮蔽、クラス内変動、クラス間類似性を強調すること。

提案手法

  • バルセロナ、オックスフォード、ナイロビの3か所のオフィス環境で、25名の被験者を対象に、1280×720解像度、30 fpsで胸に装着したGoPro Hero3+カメラを用いて動画データを収集した。
  • 18種類のオフィス行動に分類された、5秒間の動画セグメント2,639個をアノテーション処理した。行動は人間同士、人間と物、自己認識の3つのカテゴリに分類された。
  • 地域(バルセロナ、オックスフォード、ナイロビ)および被験者ごとに層別的にデータ収集を行い、モデル学習における多様性と耐性を確保した。
  • ベースラインモデル開発には、空間的・時間的注意機構を備えたネットワーク(STANet)、Inception-V3にMLPを組み合わせたアーキテクチャ、および注意機構付きアンサンブルRNNを採用した。
  • クラスの不均衡に対処するため、事前学習済みImageNetモデル(例:DenseNet、Wide-ResNet)を特徴抽出に用い、微調整およびバッチのバランスサンプリングを実施した。
  • 最良のSTANetベースのベースラインでは、光流とRGBフレームを入力として統合し、空間的・時間的モデリングを強化した。

実験結果

リサーチクエスチョン

  • RQ1多様な地理的および環境的条件下で、大規模かつ公開可能なFPVデータセットとしてのオフィス行動認識データセットをどのように構築できるか?
  • RQ2第一人称動画からのオフィス行動認識において、クラス内変動やクラス間類似性といった主な課題は何か?
  • RQ3さまざまなディープラーニングアーキテクチャは、現実世界のエゴセントリックなオフィス行動認識ベンチマークでどのように性能を発揮するか?
  • RQ4トランスファー学習と注意機構は、BONのような困難で多様なデータセットにおいて、認識精度をどの程度向上させられるか?
  • RQ5主要なコンペティションから公開されたベースラインモデルは、将来的なBONに関する研究の信頼できる性能ベンチマークとして機能できるか?

主な発見

  • BONデータセットには、3か国にまたがる25名の被験者から収集された18種類の異なるオフィス行動のラベル付き動画セグメント2,639個が含まれており、地理的および環境的多様性が保証されている。
  • STANetを用いた最良のベースラインモデルは、BONデータセット上で平均F1スコア0.749を達成し、IEEE VIP Cup 2019のコンテストで他の手法を上回った。
  • 2番目に高いスコアを記録したInception-V3とMLPを組み合わせたモデルは、平均F1スコア0.678を達成し、シンプルなアーキテクチャでも優れた性能を示した。
  • 3番目に高いスコアを記録したアンサンブルRNNモデルは、平均F1スコア0.658を達成し、注意機構とクラスのバランスサンプリングを組み合わせた複数モデルの統合の有効性を示した。
  • このデータセットは、照明の変化、遮蔽、顕著なクラス内変動(例:ボランティアマシンの異なる使い方)およびクラス間類似性(例:ReadとTypeset、MachineとTake)といった顕著な現実世界の課題を示している。
  • 異なる手の乾かし機器や歩行環境といった多様なオフィス環境の統合は、実世界での展開に向けた耐障害性と汎化性能が求められるモデルの重要性を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。