[论文解读] WEAR: An Outdoor Sports Dataset for Wearable and Egocentric Activity Recognition
本论文提出了 WEAR,一个新颖的户外运动数据集,结合了 18 名参与者在 10 个不同地点进行的 18 种活动的第一视角视频与惯性传感器数据。通过在两种模态及其早期融合上应用基于视觉的时序动作定位模型(如 ActionFormer),研究发现通过简单拼接融合视觉与惯性特征,可实现最高的平均平均精度(mAP)和接近最优的 F1 分数,优于单模态和最优后期融合基线模型。
Though research has shown the complementarity of camera- and inertial-based data, datasets which offer both egocentric video and inertial-based sensor data remain scarce. In this paper, we introduce WEAR, an outdoor sports dataset for both vision- and inertial-based human activity recognition (HAR). The dataset comprises data from 18 participants performing a total of 18 different workout activities with untrimmed inertial (acceleration) and camera (egocentric video) data recorded at 10 different outside locations. Unlike previous egocentric datasets, WEAR provides a challenging prediction scenario marked by purposely introduced activity variations as well as an overall small information overlap across modalities. Benchmark results obtained using each modality separately show that each modality interestingly offers complementary strengths and weaknesses in their prediction performance. Further, in light of the recent success of temporal action localization models following the architecture design of the ActionFormer, we demonstrate their versatility by applying them in a plain fashion using vision, inertial and combined (vision + inertial) features as input. Results demonstrate both the applicability of vision-based temporal action localization models for inertial data and fusing both modalities by means of simple concatenation, with the combined approach (vision + inertial features) being able to produce the highest mean average precision and close-to-best F1-score. The dataset and code to reproduce experiments is publicly available via: https://mariusbock.github.io/wear/
研究动机与目标
- 为解决当前缺乏结合第一视角视频与惯性传感器数据的多模态数据集,以支持人体动作识别(HAR)研究。
- 构建一个具有挑战性的 HAR 基准,包含自然、未剪辑的动作序列,并尽量减少模态间的重叠,以测试融合技术。
- 评估原本专为视频设计的基于视觉的时序动作定位模型在惯性传感器数据上的适用性,以及其与视觉特征融合的效果。
- 通过视觉与惯性特征的早期融合,确立多模态 HAR 的新标准,实现卓越性能。
- 为未来可穿戴设备与第一视角 HAR 领域的研究提供公开、可复现的基准。
提出的方法
- 从 18 名参与者处采集了连续、未剪辑的数据,其佩戴四款开源智能手表(手腕与脚踝各两块)及头戴式摄像头,覆盖 10 个户外地点。
- 数据集包含 18 种不同的体育活动,其中惯性与视觉模态之间故意引入差异与低信息重叠。
- 基准测试了最先进模型:针对惯性数据使用 DeepConvLSTM 与 Attend-and-Discriminate;针对第一视角视频使用 TriDet 与 ActionFormer。
- 通过将原始惯性数据视为 3D 加速度向量序列,直接将基于视觉的时序动作定位模型(如 ActionFormer)应用于惯性数据。
- 通过简单拼接视觉与惯性特征嵌入的方式融合模态,未使用模态特定的融合模块。
- 采用 mAP 与 F1 分数评估性能,包括一个结合最佳单模态模型预测结果的最优后期融合基线。
实验结果
研究问题
- RQ1原本专为视频设计的基于视觉的时序动作定位模型,能否有效应用于原始惯性传感器数据进行 HAR?
- RQ2在 mAP 与 F1 分数方面,视觉与惯性特征的早期融合相较于后期融合与单模态基线表现如何?
- RQ3所提出的多模态数据集(模态间重叠低、活动自然变化多样)是否揭示了惯性与视觉模态之间的互补优势?
- RQ4早期融合在多大程度上优于最优后期融合,表明学习型融合方法可能超越人工设计策略?
- RQ5通过简单拼接视觉与惯性模型的特征,能否在多模态 HAR 中实现最先进性能?
主要发现
- 通过早期融合视觉与惯性特征的联合方法,在所有评估方法中实现了最高的平均平均精度(mAP)。
- 融合模型的 F1 分数接近最优,且在 mAP 上优于单模态模型与最优后期融合基线。
- 在惯性数据上表现最佳的模型(Attend-and-Discriminate)与在视觉数据上表现最佳的模型(TriDet)均展现出互补优势,各自在不同类别的活动中表现不佳。
- 将如 ActionFormer 等基于视觉的模型直接应用于惯性数据,取得了具有竞争力的结果,证明了这些架构在跨模态应用中的通用性。
- 最优后期融合(结合惯性、视觉及早期融合模型的最佳预测)相比最佳早期融合模型,mAP 提升了 10%,表明数据集尚未饱和,未来融合方法有望超越当前结果。
- 数据集的设计(包含自然变化与低模态重叠)有效凸显了对鲁棒多模态融合的需求,因为单模态模型在不同活动子集上均会失效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。