[论文解读] Learning Mid-level Words on Riemannian Manifold for Action Recognition
本文提出了一种新颖的动作识别框架,通过全局对齐从密集提取的低级特征(HOG、HOF、MBH)构建中层视觉词,并在黎曼流形上进行建模(通过子空间、协方差矩阵和高斯统计)。该方法将基于欧几里得空间的编码方法(BoVW、VLAD、FV)扩展至黎曼流形,采用内在码书,在YouTube、UCF50、HMDB51和ASLAN数据集上实现了最先进性能,准确率具有竞争力,且计算速度优于以往的中层方法。
Human action recognition remains a challenging task due to the various sources of video data and large intra-class variations. It thus becomes one of the key issues in recent research to explore effective and robust representation to handle such challenges. In this paper, we propose a novel representation approach by constructing mid-level words in videos and encoding them on Riemannian manifold. Specifically, we first conduct a global alignment on the densely extracted low-level features to build a bank of corresponding feature groups, each of which can be statistically modeled as a mid-level word lying on some specific Riemannian manifold. Based on these mid-level words, we construct intrinsic Riemannian codebooks by employing K-Karcher-means clustering and Riemannian Gaussian Mixture Model, and consequently extend the Riemannian manifold version of three well studied encoding methods in Euclidean space, i.e. Bag of Visual Words (BoVW), Vector of Locally Aggregated Descriptors (VLAD), and Fisher Vector (FV), to obtain the final action video representations. Our method is evaluated in two tasks on four popular realistic datasets: action recognition on YouTube, UCF50, HMDB51 databases, and action similarity labeling on ASLAN database. In all cases, the reported results achieve very competitive performance with those most recent state-of-the-art works.
研究动机与目标
- 为解决真实动作识别场景中类内差异大和高维视频数据的问题。
- 通过引入具有几何结构的中层视觉词,提升表征的鲁棒性与判别能力。
- 在黎曼流形上建模中层特征,以更好地捕捉内在统计多样性。
- 将标准的欧几里得空间编码方法(BoVW、VLAD、FV)扩展至黎曼空间,以提升视频表征能力。
- 在计算成本低于现有中层表征方法的前提下,实现最先进性能。
提出的方法
- 使用通用高斯混合模型(GMM)对密集提取的低级特征(HOG、HOF、MBH)进行全局对齐,以在视频间建立语义对应关系。
- 将对齐后的特征组作为中层视觉词,在三种不同的黎曼流形上进行统计建模:线性子空间(Grassmann流形)、协方差矩阵(SPD流形)和高斯分布。
- 通过K-Karcher均值聚类和黎曼高斯混合模型构建内在黎曼码书,实现流形感知的聚类。
- 利用测地线距离和黎曼梯度,将三种标准编码方法——视觉词袋(BoVW)、局部聚合描述符向量(VLAD)和Fisher向量(FV)——扩展至黎曼空间。
- 融合多种中层视觉词表征(子空间、协方差、高斯)与描述符(HOG、HOF、MBH),以提升鲁棒性。
- 将最终的视频表征输入线性SVM进行分类,采用晚期融合策略以进一步提升性能。
实验结果
研究问题
- RQ1低级特征的全局对齐是否能改善中层视觉词的构建,并减少真实世界视频变化带来的噪声?
- RQ2与欧几里得方法相比,不同黎曼流形模型(Grassmann、SPD、高斯)在中层特征表征方面有何提升?
- RQ3黎曼空间中BoVW、VLAD和FV的扩展在真实数据集上的动作识别准确率提升程度如何?
- RQ4结合多种中层视觉词建模策略是否能获得优于单一方法的性能?
- RQ5所提方法是否能在计算成本低于现有中层表征技术的前提下,实现最先进性能?
主要发现
- 在YouTube数据集上,该方法达到90.3%的准确率,超越了先前的最先进方法。
- 在UCF50数据集上,准确率达到90.7%,优于包括Action-Gons和Actons在内的先前工作。
- 在HMDB51数据集上,准确率达到56.4%,显著优于早期中层方法如Action-parts和Motionlets。
- 在ASLAN数据集上的动作相似性标注任务中,准确率达到65.17%,AUC为70.29%,优于所有先前的无监督基线方法。
- 平均每视频计算时间缩短至43.9秒,显著快于Motionlets(70秒)、Action-parts(227秒)和Action Bank(1156秒)。
- 描述符与中层视觉词模型的晚期融合在所有数据集上均取得最佳性能,证实了多模态与多结构表征的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。