[論文レビュー] WEAR: An Outdoor Sports Dataset for Wearable and Egocentric Activity Recognition
本稿では、18名の参加者が10の多様な場所で18のアクティビティを実施する際のエゴセントリック動画とインertialセンサデータを組み合わせた新しい屋外スポーツデータセットWEARを紹介する。ActionFormerのようなビジョンベースの時系列アクティビティ検出モデルを両モダリティおよびそれらのイ早融合に適用した結果、視覚的およびインエラシャル特徴を単純な連結によって融合することで、最高の平均平均精度(mAP)とほぼ最適なF1スコアが達成され、単一モダリティおよびオラクル・レイトフェージングベースラインを上回ることが示された。
Though research has shown the complementarity of camera- and inertial-based data, datasets which offer both egocentric video and inertial-based sensor data remain scarce. In this paper, we introduce WEAR, an outdoor sports dataset for both vision- and inertial-based human activity recognition (HAR). The dataset comprises data from 18 participants performing a total of 18 different workout activities with untrimmed inertial (acceleration) and camera (egocentric video) data recorded at 10 different outside locations. Unlike previous egocentric datasets, WEAR provides a challenging prediction scenario marked by purposely introduced activity variations as well as an overall small information overlap across modalities. Benchmark results obtained using each modality separately show that each modality interestingly offers complementary strengths and weaknesses in their prediction performance. Further, in light of the recent success of temporal action localization models following the architecture design of the ActionFormer, we demonstrate their versatility by applying them in a plain fashion using vision, inertial and combined (vision + inertial) features as input. Results demonstrate both the applicability of vision-based temporal action localization models for inertial data and fusing both modalities by means of simple concatenation, with the combined approach (vision + inertial features) being able to produce the highest mean average precision and close-to-best F1-score. The dataset and code to reproduce experiments is publicly available via: https://mariusbock.github.io/wear/
研究の動機と目的
- エゴセントリック動画とインエラシャルセンサデータを組み合わせたマルチモーダルデータセットの不足を解消すること。
- 自然でトリムされていないアクティビティシーケンスと、モダリティ間の最小限の重複を備えた挑戦的なHARベンチマークを提供し、融合技術の検証を可能とすること。
- 元々動画向けに設計されたビジョンベースの時系列アクティビティ検出モデルが、インエラシャルセンサデータおよび視覚的特徴との融合にどのように適用できるかを評価すること。
- 視覚的およびインエラシャル特徴のイ早融合により、マルチモーダルHARの新たな基準を確立すること。
- 今後の研究のための公開可能で再現可能なベンチマークを提供すること。
提案手法
- 18名の参加者が、10の屋外の場所で、4台のオープンソーススマートウォッチ(両手首および両足首に装着)とヘッドマウントカメラを装着し、連続的かつトリムされていないデータを収集した。
- インエラシャルおよび視覚的モダリティの間で意図的に変動が生じ、情報の重複が少ない18の異なるスポーツアクティビティを含む。
- 最先端のモデルをベンチマーク化:インエラシャルデータにはDeepConvLSTMおよびAttend-and-Discriminate、エゴセントリック動画にはTriDetおよびActionFormerを適用。
- インエラシャルデータにビジョンベースの時系列アクティビティ検出モデル(例:ActionFormer)を直接適用し、3次元加速度ベクトルの系列として扱った。
- 視覚的およびインエラシャル特徴埋め込みを単純な連結によって融合し、モダリティ固有の融合モジュールを一切使用しない。
- mAPおよびF1スコアを用いて性能を評価し、インエラシャルおよび視覚的モダリティの最良モデルの予測を統合したオラクル・レイトフェージングベースラインも評価した。
実験結果
リサーチクエスチョン
- RQ1元々動画向けに設計されたビジョンベースの時系列アクティビティ検出モデルは、HARのための生のインエラシャルセンサデータに対しても効果的に適用可能か?
- RQ2mAPおよびF1スコアの観点から、視覚的およびインエラシャル特徴のイ早融合は、レイトフェージングおよび単一モダリティベースラインと比べてどのように差がつくか?
- RQ3低モダリティ重複および自然なアクティビティの変動を特徴とする本稿で提案するマルチモーダルデータセットは、インエラシャルおよび視覚的モダリティの相補的な強みを効果的に露呈するか?
- RQ4イ早融合の視覚的およびインエラシャル特徴が、オラクル・レイトフェージングを上回る程度はどの程度か? これは、学習された融合が手作業で設計された戦略を上回る可能性を示唆するか?
- RQ5視覚的およびインエラシャルモデルからの特徴を単純に連結することで、マルチモーダルHARで最先端の性能を達成できるか?
主な発見
- 視覚的およびインエラシャル特徴をイ早融合によって統合したアプローチが、全評価手法の中で最高の平均平均精度(mAP)を達成した。
- 融合モデルは、単一モダリティモデルおよびオラクル・レイトフェージングベースラインを上回るmAPを達成したF1スコアに近い値を記録した。
- インエラシャルデータで最も優れた性能を示したモデル(Attend-and-Discriminate)と、視覚データで最も優れたモデル(TriDet)は、それぞれ異なるアクティビティクラスで失敗し、相補的な強みを示した。
- ActionFormerのようなビジョンベースのモデルを生のインエラシャルデータに直接適用した結果、競争力のある性能が得られ、これらのアーキテクチャが複数のモダリティにわたって汎用的であることが示された。
- オラクル・レイトフェージング(インエラシャル、視覚的、およびイ早融合モデルの最良予測を統合)は、最良のイ早融合モデルよりもmAPで10%の向上を示し、データセットがまだ飽和していないことを示唆しており、今後の融合手法が現在の結果を上回る可能性があることを示している。
- 自然な変動と低モダリティ重複を特徴とするデータセットの設計は、単一モダリティモデルが異なるアクティビティサブセットで失敗することを効果的に露呈しており、頑健なマルチモーダル融合の必要性を明確にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。