Skip to main content
QUICK REVIEW

[論文レビュー] Visual Diagnosis of Dermatological Disorders: Human and Machine Performance

Jeremy Kawahara, Ghassan Hamarneh|arXiv (Cornell University)|Jun 4, 2019
Cutaneous Melanoma Detection and Management参考文献 90被引用数 7
ひとこと要約

本論文は、臨床的および皮膚鏡的皮膚画像を用いた皮膚科疾患の診断において、人間と機械の性能を比較し、最近の機械学習モデルがテレ皮膚科の状況では皮膚科医と同等の診断正確性を達成していることを明らかにした。ただし、画像品質や集団の多様性の課題がある現実世界では性能が著しく低下する。

ABSTRACT

Skin conditions are a global health concern, ranking the fourth highest cause of nonfatal disease burden when measured as years lost due to disability. As diagnosing, or classifying, skin diseases can help determine effective treatment, dermatologists have extensively researched how to diagnose conditions from a patient's history and the lesion's visual appearance. Computer vision researchers are attempting to encode this diagnostic ability into machines, and several recent studies report machine level performance comparable with dermatologists. This report reviews machine approaches to classify skin images and consider their performance when compared to human dermatologists. Following an overview of common image modalities, dermatologists' diagnostic approaches and common tasks, and publicly available datasets, we discuss approaches to machine skin lesion classification. We then review works that directly compare human and machine performance. Finally, this report addresses the limitations and sources of errors in image-based skin disease diagnosis, applicable to both machines and dermatologists in a teledermatology setting.

研究の動機と目的

  • 臨床的および皮膚鏡的画像を用いた皮膚病変の分類において、皮膚科医と機械学習モデルの診断性能を評価・比較すること。
  • 画像品質、患者歴統合、データセットの移行性の面で、人間および機械の両方に影響を及ぼす主な制限要因を同定すること。
  • 機械学習システムが現実のテレ皮膚科応用において人間並みの診断正確性に達するかどうかを評価すること。
  • 年齢、場所、家族歴などの視覚以外の患者データが、人間および機械の両方の診断性能に与える影響を検討すること。
  • 臨床的および自動化システムの両方に影響を及ぼす画像ベースの皮膚疾患診断における誤差およびばらつきの原因を強調すること。

提案手法

  • 臨床的および皮膚鏡的画像を用いた皮膚病変分類の機械学習アプローチに関する系統的レビュー。
  • Derm750、ISIC、Dermofitなどの公開データセットの分析。画像収集プロトコルおよびラベル品質に注目。
  • 皮膚病変画像で訓練されたディープラーニングモデルの評価。正確性、AUC、トップ5誤差率などのパフォーマンス指標を用いる。
  • 静的画像を用いた対面診察とテレ皮膚科の両方における皮膚科医のパフォーマンスを比較。
  • 視覚以外の患者データ(例:年齢、性別、病変部位)が、人間および機械の両方の診断正確性に与える影響の調査。
  • 特に人種や画像基準の違いを考慮した、集団および画像プロトコルをまたがるモデルの移行性の評価。

実験結果

リサーチクエスチョン

  • RQ1機械学習モデルは、臨床的および皮膚鏡的画像を用いた皮膚病変の分類において、皮膚科医と同等の診断正確性を達成できるか?
  • RQ2対面診察と静的画像を用いたテレ皮膚科の両方において、診断パフォーマンスにどのような差が生じるか?
  • RQ3視覚以外の患者データ(例:年齢、性別、病変部位)が、皮膚科医および機械モデルの両方の診断正確性に与える影響は何か?
  • RQ4集団ごとの皮膚病変の外観の違いが、訓練済みの機械学習モデルの移行性および一般化性能にどの程度影響を及えるか?
  • RQ5画像ベースの皮膚疾患診断における主な誤差の原因は何であり、それらが人間および機械のパフォーマンスにどのように影響を及えるか?

主な発見

  • 機械学習モデルは、制御されたテレ皮膚科の状況では皮膚科医と同等の診断正確性を達成しており、一部の研究では専門家皮膚科医と1〜2%の差にとどまる。
  • 皮膚科医の診断正確性は、対面診察に比べてテレ皮膚科において著しく低下しており、39%の症例で診断に不十分な画像品質が確認された。
  • アジア人集団で訓練された機械モデルは、ヨーロッパ系集団でテストした際、正確性が低下(55.7%)し、集団間の移行性が著しく低いことが示された。
  • 視覚以外の患者データは、経験が浅い臨床医の診断正確性を向上させるが、熟練した皮膚科医にはほとんど影響を及ぼさないため、スキルレベルによって有効性が異なる。
  • 人間による皮膚疾患分類のトップ5誤差率は非常に高く(ImageNetの5.1〜12%誤差と比較して示唆される)、複雑な皮膚科疾患を区別する困難さが顕著に表れている。
  • トレーニングデータセットにおける真値の誤りと、現実世界の低品質な画像収集プロセスが誤差を蓄積させ、人間および機械の両方の診断の信頼性を低下させている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。