Skip to main content
QUICK REVIEW

[论文解读] Extreme Low Resolution Activity Recognition with Multi-Siamese Embedding Learning

Michael S. Ryoo, Kiyoon Kim|arXiv (Cornell University)|Aug 3, 2017
Anomaly Detection Techniques and Applications被引用 22
一句话总结

本文提出一种双流多Siamese CNN,用于极端低分辨率(16x12)的人类活动识别,显式建模对变换鲁棒的视频嵌入,以统一同一高分辨率视频在不同低分辨率变换下的表示。该方法在16x12 HMDB数据集上达到SOTA性能,准确率达到37.70%,相比之前方法提升超过8个百分点,使用双流特征。

ABSTRACT

This paper presents an approach for recognizing human activities from extreme low resolution (e.g., 16x12) videos. Extreme low resolution recognition is not only necessary for analyzing actions at a distance but also is crucial for enabling privacy-preserving recognition of human activities. We design a new two-stream multi-Siamese convolutional neural network. The idea is to explicitly capture the inherent property of low resolution (LR) videos that two images originated from the exact same scene often have totally different pixel values depending on their LR transformations. Our approach learns the shared embedding space that maps LR videos with the same content to the same location regardless of their transformations. We experimentally confirm that our approach of jointly learning such transform robust LR video representation and the classifier outperforms the previous state-of-the-art low resolution recognition approaches on two public standard datasets by a meaningful margin.

研究动机与目标

  • 解决在极端低分辨率视频(如16x12)中识别人类活动的挑战,其中像素值在亚像素变换下发生剧烈变化。
  • 通过使用可防止面部识别的匿名化低分辨率视频数据,实现隐私保护的活动识别。
  • 克服先前方法将变换后的低分辨率视频视为独立样本所导致的泛化能力差的问题。
  • 联合学习对低分辨率变换(如平移、旋转、缩放)不变的鲁棒视频表示和分类器。
  • 在HMDB和DogCentric等标准基准数据集上,于极端低分辨率设置下展示优越性能。

提出的方法

  • 设计一种双流多Siamese卷积神经网络,以学习从同一高分辨率源生成的多个低分辨率视频片段的共享嵌入空间。
  • 采用Siamese架构,确保同一内容在不同低分辨率变换下的特征嵌入在嵌入空间中保持接近。
  • 在训练过程中通过不同的低分辨率变换(如亚像素平移)进行数据增强,以模拟现实世界中的低分辨率变化。
  • 联合优化视频表示和分类器,使用对比损失,以鼓励相同内容的低分辨率片段具有相同的嵌入。
  • 在双流设置中使用光流特征,采用Farneback算法实现在边缘设备上的高效实时推理。
  • 在高分辨率视频数据集(如YouTube)上进行训练,并在低分辨率版本上进行微调以用于下游识别。

实验结果

研究问题

  • RQ1深度学习模型能否为源自同一高分辨率源的低分辨率视频学习到共享且对变换鲁棒的嵌入空间?
  • RQ2显式建模对亚像素变换的不变性是否能提升极端低分辨率设置下的识别准确率?
  • RQ3所提出的多Siamese嵌入学习方法与标准数据增强和基线CNN在低分辨率活动识别中的表现相比如何?
  • RQ4该方法在极端低分辨率(16x12)下能否在HMDB和DogCentric等多样化数据集上实现泛化?
  • RQ5该模型在NVIDIA Jetson TX2等边缘硬件上的实时推理性能如何?

主要发现

  • 所提方法在16x12 HMDB数据集上达到37.70%的准确率,相比之前SOTA方法提升超过8个百分点。
  • 在DogCentric数据集上,该方法达到69.43%的准确率,显著优于先前工作如ISR(67.36%)和PoT(64.6%)。
  • 在Hardcore Henry数据集上,该方法将二值事件检测F1-score提升至0.885,优于基线(0.838)和数据增强(0.871)。
  • 该模型在NVIDIA Jetson TX2 GPU上以约50 fps的速度实时运行,展示了实际可部署性。
  • 与标准数据增强相比,采用共享嵌入学习的多Siamese方法能更有效地减少对特定低分辨率变换的过拟合。
  • 结合光流和空间金字塔池化的双流架构进一步提升了性能,尤其在人类目标较小的场景中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。