Skip to main content
QUICK REVIEW

[论文解读] Exploring Motion Boundaries in an End-to-End Network for Vision-based Parkinson's Severity Assessment

Amirhossein Dadashzadeh, Alan Whone|arXiv (Cornell University)|Jan 1, 2020
Parkinson's Disease Mechanisms and Treatments被引用 8
一句话总结

该论文提出了一种端到端的深度学习框架,采用膨胀3D卷积神经网络(I3D)结合时间注意力机制与运动边界,通过视频评估帕金森病的严重程度,在步态任务中达到77.1%的top-1准确率,在手部运动任务中达到72.3%,表明运动边界显著提升了对摄像机运动的鲁棒性,并优于仅使用RGB和光流的模型表现。

ABSTRACT

Evaluating neurological disorders such as Parkinson's disease (PD) is a challenging task that requires the assessment of several motor and non-motor functions. In this paper, we present an end-to-end deep learning framework to measure PD severity in two important components, hand movement and gait, of the Unified Parkinson's Disease Rating Scale (UPDRS). Our method leverages on an Inflated 3D CNN trained by a temporal segment framework to learn spatial and long temporal structure in video data. We also deploy a temporal attention mechanism to boost the performance of our model. Further, motion boundaries are explored as an extra input modality to assist in obfuscating the effects of camera motion for better movement assessment. We ablate the effects of different data modalities on the accuracy of the proposed network and compare with other popular architectures. We evaluate our proposed method on a dataset of 25 PD patients, obtaining 72.3% and 77.1% top-1 accuracy on hand movement and gait tasks respectively.

研究动机与目标

  • 开发一种基于视频数据的自动化、端到端视觉方法,用于评估帕金森病的严重程度。
  • 通过引入运动边界作为辅助输入模态,提升对摄像机运动的鲁棒性。
  • 通过稀疏时间采样策略利用长程时间结构,增强对运动任务的时间建模能力。
  • 通过集成时间注意力机制聚焦关键视频片段,提升分类准确率。
  • 单独与组合评估运动边界、光流和RGB输入在UPDRS任务表现中的有效性。

提出的方法

  • 该框架采用膨胀3D卷积神经网络(I3D)从视频片段中提取时空联合特征。
  • 采用稀疏时间采样策略处理非重叠的视频片段,实现对长程时间动态的高效建模。
  • 时间注意力机制为每个视频片段分配可学习权重,使模型能够聚焦于最具判别性的片段。
  • 从光流中计算运动边界,并作为额外的输入模态,以抑制摄像机运动的影响。
  • 使用焦点损失函数进行端到端训练,以解决UPDRS评分中的类别不平衡问题。
  • 输入模态包括RGB、光流和运动边界,实验采用单流与多流配置。

实验结果

研究问题

  • RQ1在存在摄像机运动的情况下,运动边界能否作为鲁棒且有效的输入模态,以提升帕金森病严重程度的评估效果?
  • RQ2时间注意力机制的集成如何提升帕金森病患者运动任务评估的分类准确率?
  • RQ3在端到端视频-based UPDRS评分中,不同输入模态(RGB、光流、运动边界)的性能表现如何比较?
  • RQ4所提出的方法在相同帕金森病严重程度评估任务中,相较于TSN、I3D和SlowFast等最先进架构,优势程度如何?
  • RQ5与标准交叉熵损失相比,使用焦点损失对模型性能有何影响?

主要发现

  • 仅使用运动边界在手部运动任务中达到72.3%的top-1准确率,分别优于RGB(68.4%)和光流(71.0%)3.9和1.3个百分点。
  • 光流与运动边界的组合在步态任务中表现最佳,达到77.1%的top-1准确率,优于所有其他单模态或双模态组合。
  • 所提方法在两项任务上的平均准确率达到74.4%,超过最先进模型如TSN(72.9%)、I3D(71.1%)和SlowFast(67.0%)。
  • 引入时间注意力机制后,所有模态的性能均得到提升,其中手部运动任务的增益最为显著。
  • 与分类交叉熵损失相比,使用焦点损失使平均准确率提升1.3%,表明其在处理UPDRS评分中的类别不平衡问题中具有重要意义。
  • 消融实验证实,运动边界是一种显著且有效的模态,即使与RGB和光流结合也能提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。