Skip to main content
QUICK REVIEW

[論文レビュー] An Active Learning Approach for Reducing Annotation Cost in Skin Lesion Analysis

Xueying Shi, Qi Dou|arXiv (Cornell University)|Sep 5, 2019
Cutaneous Melanoma Detection and Management参考文献 13被引用数 7
ひとこと要約

本論文は、分離基準を用いて同時に有用性(不確実性)と代表性(特徴空間における多様性)を最適化することで、皮膚腫瘍の分析のための新しいアクティブラーニングフレームワークを提案する。さらに、ピクセル空間におけるクラス内画像の集約によりモデル性能を向上させ、ISIC 2017 タスクにおいて完全な学習データの 40–50% のみを用いて最先端の精度を達成した。

ABSTRACT

Automated skin lesion analysis is very crucial in clinical practice, as skin cancer is among the most common human malignancy. Existing approaches with deep learning have achieved remarkable performance on this challenging task, however, heavily relying on large-scale labelled datasets. In this paper, we present a novel active learning framework for cost-effective skin lesion analysis. The goal is to effectively select and utilize much fewer labelled samples, while the network can still achieve state-of-the-art performance. Our sample selection criteria complementarily consider both informativeness and representativeness, derived from decoupled aspects of measuring model certainty and covering sample diversity. To make wise use of the selected samples, we further design a simple yet effective strategy to aggregate intra-class images in pixel space, as a new form of data augmentation. We validate our proposed method on data of ISIC 2017 Skin Lesion Classification Challenge for two tasks. Using only up to 50% of samples, our approach can achieve state-of-the-art performances on both tasks, which are comparable or exceeding the accuracies with full-data training, and outperform other well-known active learning methods by a large margin.

研究の動機と目的

  • 皮膚腫瘍分析における大規模なラベル付き皮膚鏡的画像の高コストと不足問題に対処する。
  • コスト効率の良いアクティブラーニングフレームワークの開発により、大規模なラベル付きデータセットへの依存を低減する。
  • 多様(代表的)かつ不確実(有用)なサンプルを同時に選択することで、モデルの汎化性能を向上させる。
  • ピクセル空間における新しいクラス内画像集約戦略を用いて、限られたラベル付きサンプルからの特徴学習を強化する。

提案手法

  • 有用性(予測の不確実性に基づく)と代表性(潜在空間における特徴の多様性に基づく)を分離した二重基準のサンプル選択戦略を提案する。
  • モデルの予測のエントロピーを用いて、高い不確実性を持つ有用なサンプルを特定する。
  • 事前学習済みネットワークの特徴空間におけるクラスタリングを適用し、多様なデータ分布をカバーする代表的なサンプルを同定する。
  • 学習された重みを用いて複数のクラス内画像をステッチすることで、拡張されたサンプルを生成するピクセル空間における集約戦略を導入する。
  • 二段階の反復的プロセス(サンプル選択 → オリジナルおよび拡張データを用いたモデルのファインチューニング)を採用する。
  • 選択されたサンプルとその拡張版を組み合わせ、教師あり学習に適したコンパクトで豊富な訓練データセットを構築する。

実験結果

リサーチクエスチョン

  • RQ1有用性と代表性を分離するアプローチ(分離)により、皮膚腫瘍分類におけるアクティブラーニングの効率性が向上するか?
  • RQ2限られたラベル付きデータで学習する際、ピクセル空間におけるクラス内画像の集約は、モデル性能にどのように影響するか?
  • RQ3アクティブラーニングは、完全なデータ学習性能を維持または上回る状態で、どの程度ラベル付けコストを削減できるか?
  • RQ4提案された集約戦略は、データが少ない状況における過学習を緩和し、汎化ギャップを縮小するか?

主な発見

  • 本手法は、Task 1 において訓練データの 50% のみを用いて 86.0% の精度を達成し、完全データ学習の 86.3% に非常に近い性能を示した。
  • Task 2 では、ラベル付きサンプルをたった 40% にまで減らしても、完全データ学習の性能を上回った。これは、顕著なデータ効率性を示している。
  • 本フレームワークは、両タスクの全クエリ比において、AIFT や他の最先端のアクティブラーニング手法を一貫して上回った。
  • アブレーションスタディの結果、同じ画像を複製するのではなく、異なるクラス内画像をステッチすることで、より高い性能が得られることを確認した。これにより、集約戦略の有効性が裏付けられた。
  • 集約的ラベル付けを用いることで、訓練集合と検証集合の間の汎化ギャップが顕著に縮小された。これは、より高いロバストネスと過学習の低減を示している。
  • γ = 0.7 のとき、有用なサンプルと代表的なサンプルの最適なバランスが達成された。全テストされた γ 値において、ランダム選択よりも優れた性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。