[论文解读] Efficient Dense Labeling of Human Activity Sequences from Wearables using Fully Convolutional Networks
本文提出一种基于全卷积网络(FCN)的方法,用于从可穿戴传感器高效进行人体活动序列的密集标注,消除了对固定大小滑动窗口的需求,并解决了标签不一致问题。该方法在三个数据集上实现了最先进性能,包括一个新的人类医院数据集,在Opportunity数据集上达到59.0%的加权F1值——比先前的CNN方法高出11%,且推理速度提升五倍。
Recognizing human activities in a sequence is a challenging area of research in ubiquitous computing. Most approaches use a fixed size sliding window over consecutive samples to extract features---either handcrafted or learned features---and predict a single label for all samples in the window. Two key problems emanate from this approach: i) the samples in one window may not always share the same label. Consequently, using one label for all samples within a window inevitably lead to loss of information; ii) the testing phase is constrained by the window size selected during training while the best window size is difficult to tune in practice. We propose an efficient algorithm that can predict the label of each sample, which we call dense labeling, in a sequence of human activities of arbitrary length using a fully convolutional network. In particular, our approach overcomes the problems posed by the sliding window step. Additionally, our algorithm learns both the features and classifier automatically. We release a new daily activity dataset based on a wearable sensor with hospitalized patients. We conduct extensive experiments and demonstrate that our proposed approach is able to outperform the state-of-the-arts in terms of classification and label misalignment measures on three challenging datasets: Opportunity, Hand Gesture, and our new dataset.
研究动机与目标
- 解决人体活动识别(HAR)中因固定大小滑动窗口导致的标签不一致问题,即单个窗口内可能存在多个标签。
- 克服测试中窗口尺寸依赖的限制,该限制会降低模型灵活性,并在实时应用中增加预测延迟。
- 实现端到端的特征与分类器学习,无需手动特征工程或基于窗口的分割。
- 发布一个新的人类日常活动数据集,从住院老年人中收集,以支持HAR研究。
- 通过密集的样本级标注,提升对类别不平衡的鲁棒性,尤其在长时长或低频活动上。
提出的方法
- 采用全卷积网络(FCN)架构,处理任意长度的原始传感器序列,无需固定大小窗口。
- 将传统的滑动窗口特征提取替换为全卷积框架,直接对每个输入样本进行标签预测。
- 使用端到端训练联合学习判别性特征与分类边界,消除对手动特征或启发式方法的依赖。
- 应用具有可学习滤波器的时间卷积层,以捕捉跨传感器通道和时间步的时空模式。
- 在输出层使用全局平均池化与Softmax分类,生成所有活动类别的逐样本预测。
- 使用带类别权重的交叉熵损失进行模型训练,以减轻真实HAR数据中类别不平衡的影响。
实验结果
研究问题
- RQ1全卷积网络是否能在密集人体活动标注中优于基于滑动窗口的方法,特别是在处理标签模糊性方面?
- RQ2与具有固定窗口约束的标准CNN相比,所提出方法在减少预测延迟和提升推理效率方面达到何种程度?
- RQ3该模型在类别不平衡数据集上的表现如何,特别是在识别长时长或低频活动方面?
- RQ4由于其窗口尺寸无关的推理机制,该方法是否能在无需微调的情况下泛化到不同受试者和数据集?
- RQ5发布一个来自住院患者的新临床相关数据集,是否能提升HAR模型在真实场景中的评估效果?
主要发现
- 在完整的Opportunity数据集上,所提方法实现了59.0%的加权F1值,相比Yang等人(2015)的CNN方法高出11%。
- 在混淆矩阵中显示,该方法在处理活动转换(如起立、躺下)方面表现更优,时间边界处的错位更少。
- 该方法对输入子序列的长度不敏感,可在无需微调或窗口尺寸约束的情况下对任意长度序列进行推理。
- 推理速度显著更快——仅为Yang等人(2015)CNN方法的五分之一,以及基线方法的十分之一。
- 在错位度量(碎片化、删除、替换)方面,该模型优于所有对比方法,表明其在检测真实活动起止时间方面具有更高精度。
- 在新的人类医院数据集上,尽管未设置空类,该模型仍显著优于其他方法,加权F1值更高,证实了其对类别不平衡的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。