Skip to main content
QUICK REVIEW

[论文解读] Learning behavioral context recognition with multi-stream temporal convolutional networks

Aaqib Saeed, Tanır Özçelebi|TU/e Research Portal|Aug 27, 2018
Context-Aware Activity Recognition Systems被引用 5
一句话总结

本文提出一种多流时间卷积网络(multi-stream temporal convolutional network),用于从日常设备的原始多模态传感器数据(加速度计、陀螺仪、音频和手机状态)中实现端到端的多标签行为上下文识别。该模型通过模态特定的流与上下文建模模块融合表征,结合实例加权和正则化技术,在类别不平衡且标签稀疏的真实世界数据上实现高性能,同时通过多任务学习实现对缺失模态的鲁棒性。

ABSTRACT

Smart devices of everyday use (such as smartphones and wearables) are increasingly integrated with sensors that provide immense amounts of information about a person's daily life such as behavior and context. The automatic and unobtrusive sensing of behavioral context can help develop solutions for assisted living, fitness tracking, sleep monitoring, and several other fields. Towards addressing this issue, we raise the question: can a machine learn to recognize a diverse set of contexts and activities in a real-life through joint learning from raw multi-modal signals (e.g. accelerometer, gyroscope and audio etc.)? In this paper, we propose a multi-stream temporal convolutional network to address the problem of multi-label behavioral context recognition. A four-stream network architecture handles learning from each modality with a contextualization module which incorporates extracted representations to infer a user's context. Our empirical evaluation suggests that a deep convolutional network trained end-to-end achieves an optimal recognition rate. Furthermore, the presented architecture can be extended to include similar sensors for performance improvements and handles missing modalities through multi-task learning without any manual feature engineering on highly imbalanced and sparsely labeled dataset.

研究动机与目标

  • 解决利用日常设备中无感的多模态传感器数据识别多样化真实行为上下文的挑战。
  • 实现从原始传感器信号端到端学习,无需人工特征工程。
  • 提升在现实环境中常见类别高度不平衡且标签稀疏的数据集上的识别性能。
  • 开发一种可在不同环境、设备使用方式和传感器配置下泛化,包括缺失模态情况下的模型。
  • 提供一个通用框架,适用于多变量时间序列中人类行为分析的多模态时间表征学习。

提出的方法

  • 该架构采用四个模态特定的流(加速度计、陀螺仪、音频和手机状态),利用时间卷积网络(TCNs)从原始传感器信号中提取分层表征。
  • 通过晚期交互方式,上下文建模模块将所有流的表征进行融合,实现多标签行为上下文的联合推理。
  • 模型采用实例加权交叉熵损失进行端到端训练,以应对类别不平衡问题,同时结合L1/L2正则化和Dropout防止过拟合。
  • 通过多任务学习,使网络能够处理缺失模态的情况,共享层在可用输入上学习鲁棒表征。
  • 对最终全连接层的特征应用t-SNE可视化,以评估学习表征的语义聚类与解耦程度。
  • 在大规模真实世界多模态数据集上评估该方法,采用标准的训练/验证/测试划分及多标签评估指标。

实验结果

研究问题

  • RQ1深度端到端多流TCN能否在真实场景中有效识别来自原始多模态传感器数据的多样化行为上下文?
  • RQ2实例加权与正则化如何提升在高度不平衡且标签稀疏的数据集上的模型泛化能力?
  • RQ3当某些传感器模态缺失时,该模型在多大程度上能保持性能?
  • RQ4学习到的表征在语义上是否能解耦行为上下文中的有意义变化因素,如t-SNE可视化所示?
  • RQ5在联合学习中,不同模态流对最终预测性能的贡献如何?

主要发现

  • 端到端训练的多流TCN实现最优识别性能,优于依赖手工特征或单模态学习的模型。
  • 实例加权交叉熵损失显著提升对罕见正样本标签的性能,当该损失被移除时,性能急剧下降至随机猜测水平。
  • 正则化技术(Dropout、L1/L2)可减少过拟合,当移除正则化时,测试集平均召回率降至0.58,表明其有效性。
  • 通过多任务学习,模型在缺失模态情况下表现出鲁棒性,无需微调即可保持预测性能。
  • t-SNE可视化显示,融合后的特征形成语义上合理的聚类,对应于互斥标签(如室内与室外),表明上下文因素的有效解耦。
  • 各模态特定网络第一层的特征图揭示了各模态中独特的学习模式(如加速度计中的运动动力学、陀螺仪中的旋转模式、音频中的频谱特征)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。