Skip to main content
QUICK REVIEW

[論文レビュー] Supervised classification of Dermatological diseases by Deep learning

Sourav Mishra, Toshihiko Yamasaki|arXiv (Cornell University)|Feb 11, 2018
Cutaneous Melanoma Detection and Management参考文献 1被引用数 10
ひとこと要約

本論文は、約47,000枚の画像から構成される洗練されたデータセットを用いて、9種の一般的な皮膚科疾患を分類する深層学習ベースの分類器を提案している。ResNetおよびDenseNetアーキテクチャを微調整し、未学習のテストデータで最大82.3%のトップ1精度を達成した。モデルはモバイルデバイスへのデプロイに最適化されており、一般医の57%の精度を上回り、アクセスが制限された地域における皮膚疾患の早期発見を可能にする。

ABSTRACT

This paper introduces a deep-learning based efficient classifier for common dermatological conditions, aimed at people without easy access to skin specialists. We report approximately 80% accuracy, in a situation where primary care doctors have attained 57% success rate, according to recent literature. The rationale of its design is centered on deploying and updating it on handheld devices in near future. Dermatological diseases are common in every population and have a wide spectrum in severity. With a shortage of dermatological expertise being observed in several countries, machine learning solutions can augment medical services and advise regarding existence of common diseases. The paper implements supervised classification of nine distinct conditions which have high occurrence in East Asian countries. Our current attempt establishes that deep learning based techniques are viable avenues for preliminary information to aid patients.

研究の動機と目的

  • 専門医が不足する地域における皮膚科診断の予備的評価を目的とした、モバイルデバイスにデプロイ可能な深層学習システムの開発。
  • 一般医の診断精度(57%)を上回る、皮膚科画像に基づく深層学習の活用による精度向上。
  • 9種の一般的な皮膚疾患にわたる、バランスの取れた臨床的レビュー済みの47,000枚の画像からなるデータセットを収集・公開し、一般利用を可能にする。
  • 実用的デプロイの観点から、モデルの精度、学習時間、推論速度のトレードオフを評価する。
  • 複数の一般的な皮膚疾患を高信頼性で同時に検出する可能性の検討。

提案手法

  • 著者らは、9種の皮膚科疾患にわたる47,000枚の臨床画像からなるデータセットを収集し、1枚の画像に1つの疾患を保証し、クラスの分布がバランスされるようにした。
  • クラスの分布をバランスさせ、一般化性能を向上させるためにデータオーグメンテーション技術を適用した。学習・検証に90:10の分割を実施し、別個の盲検証用テストセット(530枚)を用意した。
  • 交差エントロピー損失を用いて、事前学習済みの深層ニューラルネットワーク(ResNet18, ResNet50, ResNet152, DenseNet161)を微調整し、分類誤差を最小化した。
  • 検証精度と推論速度を基準に、最良のモデル(ResNet152)を選定。完全な微調整後、検証精度は84.38%に達した。
  • CPU上で推論を評価した結果、1枚あたりの平均予測時間は0.4秒であり、モバイルデプロイに適していることが確認された。
  • アブレーションスタディにより、バックボーンを固定した特徴抽出やトランスファー学習よりも、全ネットワークの微調整が優れた性能を示した。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、一般的な皮膚科疾患の診断精度を、一般医の診断精度(57%)を上回ることができるか?
  • RQ2皮膚科画像分類において、異なる深層ニューラルネットワークアーキテクチャ(例:ResNet、DenseNet)の精度と学習時間はどのように比較されるか?
  • RQ3データオーグメンテーションとデータセットのバランスは、モデルの一般化性能や性能にどのような影響を与えるか?
  • RQ4最小限の推論遅延で、モバイルデバイスに効率的にデプロイ可能な深層学習モデルは実現可能か?
  • RQ5皮膚疾患の視覚的特徴が明確な疾患と、ウエールやクラストのような曖昧な視覚パターンを示す疾患では、モデルの性能にどのような差が生じるか?

主な発見

  • ResNet152モデルは、82.30%の最高テスト精度を達成し、一般医の57%の成功率を顕著に上回った。
  • 9疾患のうち5つが80%以上のテスト精度を達成した。特にアフタリューム(93.1%)と色素性マクラ(96.4%)は、視覚的に明確な特徴を持つ疾患であるため、優れた性能を示した。
  • ウエール(72.0%)やクラスト(60.4%)のような疾患では、低コントラスト・低テクスチャのため、精度が低かった。これは、曖昧な視覚パターンに対する課題を示している。
  • 学習時間は著しく変動し、ResNet152は完全な微調整に840.7分(14時間)を要したが、ResNet18は140.5分で完了した。これは、精度と速度のトレードオフを示している。
  • CPU上での平均推論時間は1枚あたり0.4秒であり、リアルタイムのモバイルデプロイに適していることが確認された。
  • 本研究では、データセット、コード、微調整済みモデルを公開し、再現性と医療AI分野のさらなる研究を支援した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。