Skip to main content
QUICK REVIEW

[论文解读] Convolutional Neural Networks for Aerial Multi-Label Pedestrian Detection

Amir Soleimani, Nasser M. Nasrabadi|arXiv (Cornell University)|Jul 16, 2018
Advanced Neural Network Applications参考文献 11被引用 4
一句话总结

该论文提出了一种用于航拍多标签行人动作检测的两阶段框架,采用SSD生成候选区域,利用基于VGG的网络在高分辨率候选区域与多动作标签之间学习共享潜在空间。该方法在Okutama-Action数据集上达到28.30%的mAP,显著优于单阶段SSD基线模型(例如,SSD960为18.80%),通过高分辨率特征融合与多标签学习实现了更高的准确性。

ABSTRACT

The low resolution of objects of interest in aerial images makes pedestrian detection and action detection extremely challenging tasks. Furthermore, using deep convolutional neural networks to process large images can be demanding in terms of computational requirements. In order to alleviate these challenges, we propose a two-step, yes and no question answering framework to find specific individuals doing one or multiple specific actions in aerial images. First, a deep object detector, Single Shot Multibox Detector (SSD), is used to generate object proposals from small aerial images. Second, another deep network, is used to learn a latent common sub-space which associates the high resolution aerial imagery and the pedestrian action labels that are provided by the human-based sources

研究动机与目标

  • 为解决航拍图像中低分辨率行人检测的挑战,其中目标通常仅几个像素大小。
  • 通过利用高分辨率候选区域而非低分辨率输入来提升航拍图像中多标签行人动作检测的性能。
  • 开发一种将高分辨率候选区域图像特征与多动作标签信息融合的框架,以提升检测准确性。
  • 克服单阶段检测器(如SSD)在航拍视角下对小目标检测和多标签动作识别能力有限的问题。

提出的方法

  • 首先,使用SSD512从小型航拍图像(300x300或512x512)生成目标候选区域,输出潜在行人的边界框。
  • 从原始全分辨率航拍图像中提取对应于这些候选区域的高分辨率图像块,以保留细粒度细节。
  • 采用基于VGG的卷积神经网络从高分辨率候选区域中提取深层特征。
  • 在图像特征与多动作标签嵌入之间学习共享潜在空间,实现联合表征学习。
  • 框架采用是/否问题问答机制,判断检测到的行人是否正在执行特定动作(或多个动作)。
  • 应用多标签学习以挖掘动作之间的共享语义信息,提升泛化能力与检测性能。

实验结果

研究问题

  • RQ1与单阶段检测器相比,两阶段框架是否能提升低分辨率航拍图像中的多标签行人动作检测性能?
  • RQ2尽管目标尺寸很小,但使用从原始图像中提取的高分辨率候选区域是否能提升动作识别准确率?
  • RQ3在图像特征与多动作标签之间学习共享潜在空间,在多大程度上提升了检测性能?
  • RQ4多标签学习在航拍行人动作检测中对性能提升的贡献如何?

主要发现

  • 所提出的两阶段框架在Okutama-Action数据集上实现28.30%的mAP,显著优于SSD512(15.39%)和SSD960(18.80%)。
  • 与处理低分辨率输入相比,使用从原始图像中提取的高分辨率候选区域可提升检测准确率,即使初始检测器(SSD)在小图像上运行。
  • 在潜在空间中应用多标签学习使模型能够利用动作之间的共享语义模式,增强泛化能力与性能。
  • SSD512在行人检测任务上达到75.3%的mAP@0.35,表明其基线性能强劲,但两阶段框架在动作检测上进一步提升了10–15个百分点。
  • 该框架通过在第二阶段保持分辨率,有效应对航拍图像中目标尺寸过小的问题,减轻了分辨率退化对动作识别的影响。
  • 结果表明,将高分辨率图像特征与多标签动作嵌入融合,相比仅依赖低分辨率检测头,能实现更准确、更鲁棒的检测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。