Skip to main content
QUICK REVIEW

[论文解读] Discovering Hidden Structure in High Dimensional Human Behavioral Data via Tensor Factorization

Homa Hosseinmardi, Hsien-Te Kao|arXiv (Cornell University)|May 21, 2019
Tensor decomposition and applications参考文献 18被引用 10
一句话总结

本文提出非负张量分解(NTF)以揭示来自StudentLife研究的可穿戴传感器数据中隐藏的低维结构。通过对48名学生的10周多模态行为数据进行分析,NTF识别出可解释的潜在时间因素——如学习、聚会和与截止日期相关的活动——同时揭示了在学术表现、人格特质和活动模式方面具有显著差异的个体聚类,并通过真实元数据得到验证。

ABSTRACT

In recent years, the rapid growth in technology has increased the opportunity for longitudinal human behavioral studies. Rich multimodal data, from wearables like Fitbit, online social networks, mobile phones etc. can be collected in natural environments. Uncovering the underlying low-dimensional structure of noisy multi-way data in an unsupervised setting is a challenging problem. Tensor factorization has been successful in extracting the interconnected low-dimensional descriptions of multi-way data. In this paper, we apply non-negative tensor factorization on a real-word wearable sensor data, StudentLife, to find latent temporal factors and group of similar individuals. Meta data is available for the semester schedule, as well as the individuals' performance and personality. We demonstrate that non-negative tensor factorization can successfully discover clusters of individuals who exhibit higher academic performance, as well as those who frequently engage in leisure activities. The recovered latent temporal patterns associated with these groups are validated against ground truth data to demonstrate the accuracy of our framework.

研究动机与目标

  • 揭示真实世界人类行为研究中高维、噪声大、多模态可穿戴传感器数据中的低维、可解释结构。
  • 在不跨维度聚合数据的情况下,识别具有相似行为模式的个体的潜在时间因素和分组。
  • 通过真实元数据(包括GPA、人格特质以及自我报告的情绪和活动水平)验证所发现因素的准确性。
  • 展示非负张量分解在从异构、稀疏且高维的纵向数据中提取有意义、可解释模式方面的有效性。

提出的方法

  • 将行为数据建模为三阶张量 X ∈ ℝ^{I×J×K},其中 I 为个体数量,J 为行为变量数量,K 为时间帧数量。
  • 应用非负张量分解(NTF)将张量分解为一组非负分量,表示个体、变量和时间上的潜在因素。
  • 使用CANDECOMP/PARAFAC(CP)分解提取秩-R 分量,以捕捉多维数据的相互关联的低维表示。
  • 通过分析变量(如安静、运动、语音)的权重和个体在各分量中的隶属度,解释每个分量的因子载荷,推断行为主题。
  • 通过比较各分量中前25%个体在元数据(包括GPA、人格特质(如外向性)以及自我报告的情绪和放松水平)中的分布,验证所发现分量。
  • 应用统计检验(t检验、ANOVA)评估不同分量间元数据分布差异的显著性。

实验结果

研究问题

  • RQ1非负张量分解能否有效揭示高维、噪声大且异质的可穿戴传感器数据中隐藏的低维时间结构?
  • RQ2所提取的潜在分量是否对应于可解释的行为模式,如学习、聚会或与截止日期相关的活动?
  • RQ3与特定分量强关联的个体是否可在学术表现、人格特质或自我报告情绪方面被区分?
  • RQ4所恢复的时间模式能否通过已知的真实数据(如学期日程安排和自我报告行为)进行验证?

主要发现

  • 与分量1相比,与聚会相关的分量2表现出显著更高的平均外向性得分(p值 = 0.01),支持其作为社交/休闲因素的解释。
  • 在分量2中具有高隶属度的学生GPA显著低于其他分量中的学生(p值 = 0.008),表明社交参与与学业表现之间存在权衡。
  • 分量1(学习因素)中的个体报告显著更少的放松时间,并在在线课程论坛(Piazza)中参与度更高,表明学术参与度更高。
  • 与其它分量相比,分量1与显著更高的积极情绪得分相关(p值 = 0.03),表明情绪幸福感更好。
  • 在分量3(与截止日期相关)中具有高隶属度的学生在10周内平均拥有更多截止日期(p值 = 0.06),支持其作为学习/学术压力因素的解释。
  • 分量3与清晨的安静、静止行为以及活动减少高度相关,与作业截止日期模式一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。