Skip to main content
QUICK REVIEW

[论文解读] Deep Multimodal Feature Analysis for Action Recognition in RGB+D Videos

Amir Shahroudy, Tian-Tsong Ng|arXiv (Cornell University)|Mar 23, 2016
Human Pose and Action Recognition参考文献 78被引用 17
一句话总结

本文提出了一种深度多模态特征分析框架 DSSCA,通过基于堆叠自编码器的网络,将 RGB+D 视频特征分层分解为共享(公共)和模态特定的组成部分。该框架进一步采用具有混合范数正则化的结构化稀疏学习机器(SSLM),通过选择信息性组件来增强分类性能,在五个 RGB+D 动作识别基准上实现了最先进(SOTA)的准确率,包括在 Online RGBD 数据集上达到 99.0% 的准确率。

ABSTRACT

Single modality action recognition on RGB or depth sequences has been extensively explored recently. It is generally accepted that each of these two modalities has different strengths and limitations for the task of action recognition. Therefore, analysis of the RGB+D videos can help us to better study the complementary properties of these two types of modalities and achieve higher levels of performance. In this paper, we propose a new deep autoencoder based shared-specific feature factorization network to separate input multimodal signals into a hierarchy of components. Further, based on the structure of the features, a structured sparsity learning machine is proposed which utilizes mixed norms to apply regularization within components and group selection between them for better classification performance. Our experimental results show the effectiveness of our cross-modality feature analysis framework by achieving state-of-the-art accuracy for action classification on five challenging benchmark datasets.

研究动机与目标

  • 为解决单模态动作识别的局限性,通过利用 RGB 和深度模态在 RGB+D 视频中的互补信息。
  • 开发一种深度神经网络,通过分层分解多模态特征为共享(公共)和模态特定的组成部分,以提升鲁棒性与可分性。
  • 设计一种基于结构化稀疏性的学习机器,实现对有效组件和层的选择,以增强分类性能。
  • 在多个具有挑战性的 RGB+D 动作识别数据集上,证明所提出框架相较于现有方法的优越性。

提出的方法

  • 提出一种基于深度自编码器的共享-特定特征分解网络,其中每一层将输入的 RGB 和深度特征分解为共享成分与模态特定成分。
  • 通过堆叠深层架构,实现端到端训练,以学习多模态信号的分层非线性表示。
  • 引入一种结构化稀疏学习机器(SSLM),利用混合范数(如 ℓ2,1)在组件内部及跨组件和层实现正则化。
  • SSLM 分类器学习为更具判别性的组件分配更高权重,例如深层中的共享特征和模态特定特征。
  • 通过反向传播进行端到端训练,联合优化特征分解与分类目标。
  • 在输入网络前,从 RGB 和深度流中提取局部与整体特征(如 HOG、HOF、HON4D)。

实验结果

研究问题

  • RQ1深度神经网络能否在保留分层非线性表示的前提下,有效将多模态 RGB+D 特征分解为共享与模态特定的组成部分?
  • RQ2同时引入共享与模态特定组成部分是否能带来优于仅使用共享成分或单模态特征的动作识别性能?
  • RQ3通过混合范数正则化的结构化稀疏学习能否通过跨层选择性融合信息性组件来提升分类性能?
  • RQ4所提框架在标准 RGB+D 动作识别基准上的性能与最先进方法相比如何?

主要发现

  • 所提出的 DSSCA 框架在 Online RGBD 数据集上实现了 99.0% 的最先进准确率,显著优于先前方法。
  • 在 MSR Daily Activity 3D 数据集上,该方法达到了 96.3% 的准确率,优于单模态基线(RGB 为 89.4%,深度为 92.5%)及其他多模态方法。
  • 结构化稀疏学习机器(SSLM)为共享成分(如 Y³ 的 ℓ2 范数为 0.20–0.42)和模态特定成分(Zr³, Zd³)分配了高权重,证实了其判别价值。
  • 贡献分析显示,部分组件获得接近零的权重(如 Online S3 中的 Zd¹ 为 0.00),表明尽管存在于数据中,但其对动作分类的贡献较小。
  • 框架的性能增益在深层网络中更为显著,证明了分层特征分解的优势。
  • 与原子级局部分析相比,该方法在 Online RGBD 数据集上的错误率降低超过 50%,证实了堆叠深层分解的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。