Skip to main content
QUICK REVIEW

[论文解读] Delving into Robust Object Detection from Unmanned Aerial Vehicles: A Deep Nuisance Disentanglement Approach

Zhenyu Wu, Karthik Suresh|arXiv (Cornell University)|Aug 11, 2019
Advanced Neural Network Applications参考文献 38被引用 5
一句话总结

本文提出一种深度干扰因子解耦方法——干扰因子解耦特征变换(NDFT),通过利用免费获取的无人机元数据(如高度、视角角度、天气)在对抗训练过程中解耦领域特异性干扰因子,从而提升无人机影像中的鲁棒目标检测性能。该方法在UAVDT和VisDrone2018基准上实现了最先进单模型性能,在VisDrone2018上较DE-FPN提升4.36 mAP,在跨数据集迁移学习中实现4.23 AP的增益。

ABSTRACT

Object detection from images captured by Unmanned Aerial Vehicles (UAVs) is becoming increasingly useful. Despite the great success of the generic object detection methods trained on ground-to-ground images, a huge performance drop is observed when they are directly applied to images captured by UAVs. The unsatisfactory performance is owing to many UAV-specific nuisances, such as varying flying altitudes, adverse weather conditions, dynamically changing viewing angles, etc. Those nuisances constitute a large number of fine-grained domains, across which the detection model has to stay robust. Fortunately, UAVs will record meta-data that depict those varying attributes, which are either freely available along with the UAV images, or can be easily obtained. We propose to utilize those free meta-data in conjunction with associated UAV images to learn domain-robust features via an adversarial training framework dubbed Nuisance Disentangled Feature Transform (NDFT), for the specific challenging problem of object detection in UAV images, achieving a substantial gain in robustness to those nuisances. We demonstrate the effectiveness of our proposed algorithm, by showing state-of-the-art performance (single model) on two existing UAV-based object detection benchmarks. The code is available at https://github.com/TAMU-VITA/UAV-NDFT.

研究动机与目标

  • 解决通用目标检测器在应用于无人机拍摄图像时因无人机特异性干扰因子(如高度变化、视角角度差异和天气条件)导致的显著性能下降问题。
  • 利用免费获取的无人机元数据(如GPS高度、气压、天气数据)作为弱监督信号,实现领域鲁棒的特征学习。
  • 开发一种深度对抗框架,将干扰因子与任务相关特征解耦,提升在细粒度领域间的泛化能力。
  • 在不使用模型集成或过度参数化的情况下,实现在现有无人机目标检测基准上的最先进单模型性能。
  • 展示所学习特征在未见数据集(如从UAVDT迁移到VisDrone2018)中的改进可迁移性。

提出的方法

  • 所提出的干扰因子解耦特征变换(NDFT)框架采用对抗训练范式,将干扰因子(高度、视角角度、天气)从目标检测特征中解耦。
  • NDFT采用多任务学习设置,其中特征提取器通过联合优化,既保留检测相关特征,又对抗性地抑制与干扰因子相关的表征。
  • 该方法引入三种辅助损失(AL)用于干扰因子解耦,通过域判别器强制实现对干扰变量的不变性。
  • 框架通过检测损失与对抗干扰损失的加权组合进行端到端训练,其中超参数γi通过网格搜索进行调优,以平衡解耦效果与检测性能。
  • NDFT应用于Faster R-CNN和DE-FPN主干网络,无需架构修改即可在各种无人机飞行条件下实现鲁棒检测。
  • 通过在UAVDT上预训练NDFT后,仅微调检测头的方式评估可迁移性,保持特征提取器不变。

实验结果

研究问题

  • RQ1利用免费获取的无人机元数据是否能提升因高度、视角角度和天气变化引起的细粒度领域间对象检测的鲁棒性?
  • RQ2与标准辅助损失训练相比,对抗性干扰因子解耦是否能带来更好的泛化性能?
  • RQ3NDFT特征能否在极小微调下有效迁移到未见的无人机数据集(如VisDrone2018)?
  • RQ4NDFT在无人机专用基准上的性能与最先进单模型检测器相比如何?
  • RQ5与仅解耦一个或两个干扰因子相比,同时解耦多个干扰因子(高度、视角、天气)在多大程度上提升了检测准确率?

主要发现

  • 在VisDrone2018验证集上,NDFT相比DE-FPN基线模型mAP提升4.36,达到最先进单模型性能。
  • 在UAVDT基准上,NDFT-Faster R-CNN总体mAP达到59.56,显著优于基线Faster R-CNN(52.14 mAP)和辅助损失基线(53.64 mAP)。
  • NDFT-DE-FPN在VisDrone2018上达到52.77 mAP(γi = 0.005),证明对抗性解耦优于标准辅助损失方法。
  • 在从UAVDT到VisDrone2018的跨数据集迁移中,NDFT-DE-FPN(r)在车辆类别上达到79.50 AP,较非解耦迁移基线(75.27 AP)提升4.23 AP。
  • 图1的可视化对比显示,随着每一种额外干扰因子被解耦(从基线到A+V+W完全解耦),检测准确率持续提升。
  • 表6的消融实验确认,即使在标准辅助损失方法经网格搜索优化后,NDFT的对抗性解耦仍持续优于其表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。