[论文解读] The Best of Both Worlds: Combining Data-independent and Data-driven Approaches for Action Recognition
该论文提出了一种混合方法,将数据无关的手工设计特征(IDT)与基于堆叠卷积独立子空间分析(ConvISA)的端到端无监督学习相结合,以提升视频动作识别性能。通过在IDT轨迹体上学习局部描述符——LOP与LOF,并利用无需训练的多类别重排序(MIR)技术将这些描述符与传统特征融合,该方法在HMDB51、Hollywood2和UCF101数据集上均取得了最先进性能,其中在HMDB51上的平均准确率为59.4%,在UCF101上为88.0%。
Motivated by the success of data-driven convolutional neural networks (CNNs) in object recognition on static images, researchers are working hard towards developing CNN equivalents for learning video features. However, learning video features globally has proven to be quite a challenge due to its high dimensionality, the lack of labelled data and the difficulty in processing large-scale video data. Therefore, we propose to leverage effective techniques from both data-driven and data-independent approaches to improve action recognition system. Our contribution is three-fold. First, we propose a two-stream Stacked Convolutional Independent Subspace Analysis (ConvISA) architecture to show that unsupervised learning methods can significantly boost the performance of traditional local features extracted from data-independent models. Second, we demonstrate that by learning on video volumes detected by Improved Dense Trajectory (IDT), we can seamlessly combine our novel local descriptors with hand-crafted descriptors. Thus we can utilize available feature enhancing techniques developed for hand-crafted descriptors. Finally, similar to multi-class classification framework in CNNs, we propose a training-free re-ranking technique that exploits the relationship among action classes to improve the overall performance. Our experimental results on four benchmark action recognition datasets show significantly improved performance.
研究动机与目标
- 解决由于高维性、标注数据有限以及视频学习中计算成本高所带来的学习判别性视频特征的挑战。
- 通过在小范围局部视频体积上进行无监督学习,克服纯数据驱动CNN在视频动作识别中的局限性。
- 通过使用ConvISA学习的数据驱动描述符替代IDT中使用的传统手工特征(如HOG、HOF),提升传统手工特征的性能。
- 通过一种无需训练的多类别迭代重排序(MIR)方法,利用类别间关系提升分类性能。
提出的方法
- 提出一种双流堆叠卷积ISA架构,在从改进密集轨迹(IDT)导出的小型视频体积上,无监督地学习视觉外观(LOP)和运动(LOF)描述符。
- 在轨迹跟随的视频体积(像素与光流)上学习描述符,而非整个视频,从而降低维度和计算成本。
- 在统一的特征表示流程中,将学习到的LOP与LOF描述符与传统手工描述符(如HOG、HOF)进行融合。
- 设计一种多类别迭代重排序(MIR)技术,通过建模类别间关系,在无需额外训练的情况下提升平均平均精度(MAP)。
- 应用一种简单的排名分数融合技术,将MIR结果与原始分数结合,提升最终分类准确率。
- 在大规模视频数据上进行无监督预训练,以避免弱监督学习中常见的昂贵标注与错误标签分配问题。
实验结果
研究问题
- RQ1在小范围视频体积上进行无监督、数据驱动学习,能否提升IDT等传统手工设计局部视频特征的性能?
- RQ2将数据驱动描述符(LOP/LOF)与手工描述符结合,对基准数据集上的动作识别准确率有何影响?
- RQ3一种无需训练的重排序方法(如MIR)能否有效利用类别间关系,提升动作识别中的平均平均精度?
- RQ4当使用无监督特征学习时,一个在某一数据集(如Hollywood2)上训练的模型,能在多大程度上泛化到另一数据集(如HMDB51)?
- RQ5在所提出的ConvISA-based描述符学习框架中,哪些超参数(如步长、感受野大小、描述符维度)能实现最佳性能?
主要发现
- 通过在IDT轨迹体上使用堆叠卷积ISA学习得到的LOP与LOF描述符,在相同流程中显著优于传统手工特征(HOG/HOF)。
- 该方法在HMDB51上达到59.4%的平均准确率,在UCF101上达到88.0%,在所测试的四个基准数据集中均达到或超过最先进水平。
- 采用更大的空间和时间步长(如16和5)可提升性能,因更少的重叠导致特征冗余减少,从而实现更快的训练与推理。
- 感受野大小为(16,5)在性能与计算成本之间提供了最佳平衡,更大的感受野并未带来更好结果。
- 描述符维度为200时,在信息保留与噪声抑制之间实现了最佳权衡,与先前研究结果一致。
- 在Hollywood2上训练的模型在HMDB51上泛化良好,性能仅下降约2%,表明具有较强的跨数据集迁移能力,尤其在训练于具有挑战性的数据集时更为显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。