[论文解读] Towards Resolving the Challenge of Long-tail Distribution in UAV Images for Object Detection
该论文提出 DSHNet,一种新型无人机图像目标检测框架,通过引入类别偏置采样器(CBS)和双边框头(BBH)来解决长尾类别分布问题。CBS 通过重新采样候选区域以优先关注低频尾部类别,而 BBH 则利用在类别偏置样本上训练的双分类器提升检测性能。DSHNet 在 VisDrone 上达到 24.6 的 SOTA mAP,在 UAVDT 上达到 26.2,显著提升了尾部类别性能,且未增加推理延迟。
Existing methods for object detection in UAV images ignored an important challenge - imbalanced class distribution in UAV images - which leads to poor performance on tail classes. We systematically investigate existing solutions to long-tail problems and unveil that re-balancing methods that are effective on natural image datasets cannot be trivially applied to UAV datasets. To this end, we rethink long-tailed object detection in UAV images and propose the Dual Sampler and Head detection Network (DSHNet), which is the first work that aims to resolve long-tail distribution in UAV images. The key components in DSHNet include Class-Biased Samplers (CBS) and Bilateral Box Heads (BBH), which are developed to cope with tail classes and head classes in a dual-path manner. Without bells and whistles, DSHNet significantly boosts the performance of tail classes on different detection frameworks. Moreover, DSHNet significantly outperforms base detectors and generic approaches for long-tail problems on VisDrone and UAVDT datasets. It achieves new state-of-the-art performance when combining with image cropping methods. Code is available at https://github.com/we1pingyu/DSHNet
研究动机与目标
- 为解决无人机目标检测中的长尾分布问题,其中头部类别(如汽车、行人)占主导,而尾部类别(如 awn.、三轮车)严重缺失。
- 识别为何现有自然图像数据集上的长尾解决方案在无人机数据上失效,原因在于小批量训练和高分辨率图像中密集的头部类别物体。
- 设计一种检测框架,在不扭曲原始数据分布或无需架构大规模修改的前提下,提升尾部类别性能。
- 验证双路径学习(分别对头部和尾部类别进行优化)可带来更好的泛化能力和性能表现。
提出的方法
- 提出类别偏置采样器(CBS),在训练过程中重新采样候选区域,优先选择尾部类别物体,确保低频类别的充分表示。
- 采用双边框头(BBH),包含两个独立分类器:BBH(T) 用于尾部类别候选区域,BBH(H) 用于头部类别候选区域,二者均基于类别偏置样本进行训练。
- 在 BBH 中应用类别特定的损失重加权,分别计算头部和尾部类别的损失,并通过超参数 λ 平衡其贡献。
- 采用两阶段训练策略:CBS 生成类别偏置的候选区域,随后由 BBH 生成预测结果,推理阶段通过 NMS 进行融合。
- 通过在裁剪图像块上进行训练,实现与图像裁剪方法的兼容性,提升与前沿图像块生成技术(如 DMNet)结合时的性能。
- 通过最小化计算开销保持推理效率,仅导致 FPS 略有下降,相比基线检测器保持高效。
实验结果
研究问题
- RQ1为何现有长尾再平衡方法在自然图像数据集上表现良好,却在无人机数据集上失效?
- RQ2是否可通过双路径检测框架,分别处理头部和尾部类别候选区域,从而提升长尾无人机数据集上的性能?
- RQ3类别偏置采样结合双头分类是否在尾部类别 mAP 和总体 mAP 上优于标准再平衡技术?
- RQ4当与图像裁剪技术结合时,所提方法在多大程度上提升了无人机目标检测的性能?
主要发现
- DSHNet 在 VisDrone 数据集上达到 24.6 的平均精度均值(mAP),显著优于基线 Faster R-CNN(21.7)和现有 SOTA 基线模型。
- 在 UAVDT 数据集上,DSHNet 实现 26.2 的 mAP,优于基线 Cascade R-CNN(23.2)和现有长尾方法。
- 消融实验表明,CBS 相较于基线模型提升 2.9 个 mAP 点,BBH 再提升 2.9 个 mAP 点,验证了两个组件的有效性。
- 当与基于 DMNet 的图像裁剪结合时,DSHNet 将整体 mAP 提升 2.2 个点(从 28.1 提升至 30.3),表明其与数据增强技术具有良好的兼容性和协同效应。
- BBH 中损失重加权的最优 λ 值为 2.0,当 λ > 4.0 时性能下降,表明对类别不平衡权重敏感。
- 推理速度影响极小,DSHNet 在 Faster R-CNN 基线(原为 20.1 FPS)上运行速度为 15.7 FPS,证实其在实时无人机应用中的实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。