[論文レビュー] Semantic Segmentation of Skin Lesions using a Small Data Set
本稿では、41枚のスマートフォンで撮影された画像からなる小さなデータセットを用いて、皮膚レセントの意味的セグメンテーション手法を提案している。完全畳み込みネットワーク(FCN16/FCN32)に、事前学習済みのVGG16からの転移学習を適用し、データのクロッピングと増強を組み合わせることで、限られたデータでも最適な性能が達成されることを示している。これは、ランダム初期化や単純なアーキテクチャーよりも、正解度、IoU、F1スコアにおいて優れた性能を発揮した。
Early detection of melanoma is difficult for the human eye but a crucial step towards reducing its death rate. Computerized detection of these melanoma and other skin lesions is necessary. The central research question in this paper is "How to segment skin lesion images using a neural network with low available data?". This question is divided into three sub questions regarding best performing network structure, training data and training method. First theory associated with these questions is discussed. Literature states that U-net CNN structures have excellent performances on the segmentation task, more training data increases network performance and utilizing transfer learning enables networks to generalize to new data better. To validate these findings in the literature two experiments are conducted. The first experiment trains a network on data sets of different size. The second experiment proposes twelve network structures and trains them on the same data set. The experimental results support the findings in the literature. The FCN16 and FCN32 networks perform best in the accuracy, intersection over union and mean BF1 Score metric. Concluding from these results the skin lesion segmentation network is a fully convolutional structure with a skip architecture and an encoder depth of either one or two. Weights of this network should be initialized using transfer learning from the pre trained VGG16 network. Training data should be cropped to reduce complexity and augmented during training to reduce the likelihood of overfitting.
研究の動機と目的
- 限られたアノテーション付きデータしか入手できない状況において、皮膚レセントの正確な意味的セグメンテーションモデルを訓練するという課題に対処すること。
- データサイズ、ネットワークアーキテクチャ、トレーニング手法の違いが、低データ環境下でのセグメンテーション性能に与える影響を調査すること。
- 頑健な皮膚レセントセグメンテーションを実現するための、ネットワーク構造、重み初期化、データ前処理の最適な組み合わせを同定すること。
- 最小限のトレーニングデータで十分な性能を発揮するモデルを構築することで、早期のメラノーマ検出を促進すること。
提案手法
- スマートフォンカメラで撮影された41枚の皮膚レセント画像からなる小さなデータセット上で、完全畳み込みネットワーク(FCN16, FCN32, FCN8, およびSGNバージョン)をトレーニングした。
- 事前学習済みのVGG16ネットワークからの特徴を用いて重みを部分的に初期化することで、転移学習を活用し、一般化性能を向上させた。
- 有効なトレーニングデータを増やすとともに、計算複雑性を低減するために、データ増強と画像クロッピングを適用した。
- 過学習を防ぎ、トレーニング時間を短縮するために、エポックの早期停止を用いた正則化を実施した。
- IoU、正解度、F1スコアなどの指標を用いて、さまざまなネットワークアーキテクチャーやトレーニング戦略の性能を比較した。
- 一般化性能の評価および比較分析のため、追加の2つの公開データセット(126枚および10枚)を用いた。
実験結果
リサーチクエスチョン
- RQ1トレーニングデータセットのサイズが、皮膚レセントの意味的セグメンテーションにおける性能と一般化性能に与える影響は何か?
- RQ2限られたデータで皮膚レセントの意味的セグメンテーションに最も優れた性能を発揮するニューラルネットワークアーキテクチャは何か?
- RQ3特に転移学習とランダム重み初期化の違いが、性能とトレーニング効率に与える影響は何か?
- RQ4データがスパースな状況で、モデル性能を向上させるための前処理技術は何か?
主な発見
- FCN32およびFCN16ネットワークが、正解度、交差率(IoU)、平均F1スコアのすべての指標で最高の性能を示した。
- VGG16からの部分的初期化を用いた転移学習は、ランダム初期化に比べ、特定のタスクおよび一般化されたセグメンテーション性能を顕著に向上させた。
- 転移学習でトレーニングされたネットワークは、顕著に短いトレーニング時間で済み、特に未学習データに対する一般化性能も優れていた。
- トレーニング画像のクロッピングはモデルの一般化性能を向上させた。クロップドデータでトレーニングされたSGN3ネットワークは、新しいサンプルに対して優れた性能を示した。
- エンコーダーの深さを増やすのではなく、各エンコーディングブロック内の畳み込み層の数を増やすことで、性能向上がより顕著に得られた。
- 高レベルの処理済み特徴と、深く低レベルの特徴を組み合わせたスキップ接続が、より処理が進んだ特徴と組み合わせたものよりも優れた性能を発揮した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。