Skip to main content
QUICK REVIEW

[论文解读] Bird Species Classification using Transfer Learning with Multistage Training

Sourya Dipta Das, Akash Kumar|arXiv (Cornell University)|Oct 9, 2018
Animal Vocal Communication and Behavior被引用 6
一句话总结

本文提出一种基于迁移学习的多阶段训练方法,用于鸟类物种分类,结合Mask R-CNN进行目标定位,以及使用集成Inception网络(InceptionV3与InceptionResNetV2)进行细粒度特征学习。该方法在CVIP 2018基准数据集上实现了55.67%的F1分数,通过数据增强和在完整图像及定位到的鸟类ROI上分阶段训练,显著提升了分类准确率。

ABSTRACT

Bird species classification has received more and more attention in the field of computer vision, for its promising applications in biology and environmental studies. Recognizing bird species is difficult due to the challenges of discriminative region localization and fine-grained feature learning. In this paper, we have introduced a Transfer learning based method with multistage training. We have used both Pre-Trained Mask-RCNN and an ensemble model consisting of Inception Nets (InceptionV3 & InceptionResNetV2 ) to get localization and species of the bird from the images respectively. Our final model achieves an F1 score of 0.5567 or 55.67 % on the dataset provided in CVIP 2018 Challenge.

研究动机与目标

  • 为解决在训练数据有限且不平衡的情况下,从高分辨率图像中进行细粒度鸟类物种分类的挑战。
  • 通过Mask R-CNN实现的目标定位与预训练Inception网络的深度特征学习相结合,提升分类准确率。
  • 通过在完整图像和定位到的鸟类区域上进行数据增强与多阶段训练,缓解类别不平衡与过拟合问题。
  • 开发一个端到端系统,能够在自然户外环境中同时实现鸟类检测与物种分类。

提出的方法

  • 使用预训练的Mask R-CNN(COCO权重)对图像中的鸟类进行定位,生成感兴趣区域(ROI)裁剪图像。
  • 采用多阶段训练:首先在全分辨率图像上训练以学习全局空间特征,随后在Mask R-CNN生成的鸟类ROI上训练以学习细粒度局部特征。
  • 应用数据增强技术,包括高斯噪声、模糊、翻转、对比度、色相、加法、乘法、锐化以及仿射变换,以增加训练样本并减少过拟合。
  • 使用InceptionV3与InceptionResNetV2训练集成模型,并选择Swish激活函数以获得最佳性能。
  • 在检测与分类两个阶段均使用分类交叉熵损失函数与Adam优化器。
  • 通过集成平均法融合InceptionV3与InceptionResNetV2的预测结果,以提升最终分类性能。

实验结果

研究问题

  • RQ1在完整图像上进行多阶段训练,随后在定位到的ROI上继续训练,是否能提升细粒度鸟类物种分类的准确率?
  • RQ2基于Inception架构的迁移学习在处理小样本、类别不平衡数据集进行鸟类物种识别时,效果如何?
  • RQ3数据增强在少量样本的鸟类分类任务中,对缓解过拟合的程度有多大?
  • RQ4基于Mask R-CNN的定位在存在背景杂乱与遮挡的情况下,如何促进更好的特征学习?

主要发现

  • 结合Mask R-CNN与InceptionV3及InceptionResNetV2的集成模型在测试集上取得了最高的F1分数55.67%。
  • 在原始图像与Mask R-CNN裁剪区域上微调的InceptionResNetV2模型,验证集F1分数达到33.69%,表明泛化能力得到提升。
  • 与仅在完整图像上训练相比,多阶段训练使测试F1分数提升了10.4个百分点(InceptionResNetV2从41.66%提升至49.09%)。
  • 采用集成方法后,模型的精确率为56.58%,召回率为54.8%,表明在各类别间具有良好的鲁棒性。
  • 尽管性能有所提升,但训练样本少于10个的类别(如cmnmyn、gretit、rebimg)仍表现较差,主要由于数据稀缺与视觉相似性。
  • 光照变化以及小尺寸、低对比度的ROI显著降低了模型性能,尤其对微特征学习造成严重影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。