Skip to main content
QUICK REVIEW

[论文解读] Automatic Detection and Classification of Tick-borne Skin Lesions using Deep Learning

Lauren Michelle Pfeifer, Matías Valdenegro-Toro|arXiv (Cornell University)|Nov 23, 2020
Viral Infections and Vectors参考文献 5被引用 5
一句话总结

本研究提出一种深度学习方法,通过多种卷积神经网络架构,利用通过多语言谷歌图片搜索收集的6,080张图像,自动检测并分类蜱传皮肤病变——具体为游走性红斑、蚊虫叮咬和健康皮肤。表现最佳的模型DenseNet121实现了80.72%的准确率,显示出在不同肤色间的更好泛化能力,并减少了数据集偏差。

ABSTRACT

Around the globe, ticks are the culprit of transmitting a variety of bacterial, viral and parasitic diseases. The incidence of tick-borne diseases has drastically increased within the last decade, with annual cases of Lyme disease soaring to an estimated 300,000 in the United States alone. As a result, more efforts in improving lesion identification approaches and diagnostics for tick-borne illnesses is critical. The objective for this study is to build upon the approach used by Burlina et al. by using a variety of convolutional neural network models to detect tick-borne skin lesions. We expanded the data inputs by acquiring images from Google in seven different languages to test if this would diversify training data and improve the accuracy of skin lesion detection. The final dataset included nearly 6,080 images and was trained on a combination of architectures (ResNet 34, ResNet 50, VGG 19, and Dense Net 121). We obtained an accuracy of 80.72% with our model trained on the DenseNet 121 architecture.

研究动机与目标

  • 提高对蜱传皮肤病变(特别是与莱姆病相关的游走性红斑)自动检测的准确率与公平性。
  • 通过在不同肤色、肤质和全球地理区域中多样化训练数据,减少皮肤病变分类模型中的偏差。
  • 超越二元分类,开发针对游走性红斑、蚊虫叮咬和健康皮肤的三分类模型。
  • 评估多语言搜索查询对皮肤病变图像分类中数据集多样性和模型性能的影响。
  • 为未来公开共享一个多样化、多语言的皮肤病变数据集奠定基础,以支持早期诊断的更广泛研究。

提出的方法

  • 使用七种语言(英语、西班牙语、法语、德语、葡萄牙语、中文和俄语)的谷歌图片搜索查询,收集6,080张图像,以增加肤色和病变外观的多样性。
  • 构建一个三分类图像分类数据集,包含游走性红斑、蚊虫叮咬和健康皮肤,其中健康皮肤定义为无任何昆虫叮咬或病变的皮肤。
  • 在数据集上训练四种深度学习架构(ResNet34、ResNet50、VGG19和DenseNet121),以比较不同模型的性能。
  • 使用多语言搜索查询提升数据多样性,尤其针对深色皮肤人群,通过谷歌翻译验证翻译准确性以确保查询质量。
  • 以准确率为首要指标评估模型性能,并通过跨架构比较识别最优模型架构。
  • 未来工作计划包括公开发布数据集、测试其他模型(如SVM、InceptionV4、MobileNet、EfficientNet)以及集成学习方法。

实验结果

研究问题

  • RQ1多语言图像搜索策略能否提升皮肤病变分类模型训练数据的多样性和代表性?
  • RQ2将非英语地区图像纳入模型是否能增强其在不同皮肤类型和病变外观上的泛化能力?
  • RQ3多种深度学习架构在分类游走性红斑、蚊虫叮咬和健康皮肤方面的性能差异如何?
  • RQ4数据集偏差(特别是与肤色和肤质相关)如何影响深度学习模型在皮肤病学诊断中的准确率与公平性?
  • RQ5多语言数据收集策略能否减少将游走性红斑误诊为蚊虫叮咬的情况,这是临床中常见的错误?

主要发现

  • DenseNet121架构在分类游走性红斑、蚊虫叮咬和健康皮肤方面达到最高准确率80.72%。
  • ResNet34以79.16%的准确率位列第二,而VGG19和ResNet50分别获得78.64%和53.12%的准确率,表明模型架构差异对性能有显著影响。
  • 使用多语言搜索查询成功提升了数据集多样性,尤其增加了三类中深色皮肤人群的图像数量。
  • 与仅使用单一语言收集的数据集相比,本模型在肤色和肤质表示上表现出更低的偏差,尤其改善了非高加索人种皮肤类型的覆盖。
  • 研究发现准确分类“健康皮肤”存在挑战,表明该类别需要更精细的搜索查询和数据整理。
  • 研究人员计划公开发布该数据集,并探索InceptionV4、MobileNet和EfficientNet等其他模型以进一步提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。