Skip to main content
QUICK REVIEW

[論文レビュー] LCAUnet: A skin lesion segmentation network with enhanced edge and body fusion

Qisen Ma, Keming Mao|arXiv (Cornell University)|May 1, 2023
Cutaneous Melanoma Detection and ManagementMedicine被引用数 3
ひとこと要約

LCAUnetは、二重ブランチエンコーダ、局所クロスアテンション融合モジュール(LCAF)、およびプロパー Guided Multi-Scale Fusion(PGMF)を用いてエッジ特徴とボディ特徴を統合するU字型のセグメンテーションネットワークを提案する。ISIC 2017、ISIC 2018、PH2データセットにおいて最先端の性能を達成し、ベースラインモデル比でIoUが最大8.87%向上、Diceが7.03%向上した。

ABSTRACT

Accurate segmentation of skin lesions in dermatoscopic images is crucial for the early diagnosis of skin cancer and improving the survival rate of patients. However, it is still a challenging task due to the irregularity of lesion areas, the fuzziness of boundaries, and other complex interference factors. In this paper, a novel LCAUnet is proposed to improve the ability of complementary representation with fusion of edge and body features, which are often paid little attentions in traditional methods. First, two separate branches are set for edge and body segmentation with CNNs and Transformer based architecture respectively. Then, LCAF module is utilized to fuse feature maps of edge and body of the same level by local cross-attention operation in encoder stage. Furthermore, PGMF module is embedded for feature integration with prior guided multi-scale adaption. Comprehensive experiments on public available dataset ISIC 2017, ISIC 2018, and PH2 demonstrate that LCAUnet outperforms most state-of-the-art methods. The ablation studies also verify the effectiveness of the proposed fusion techniques.

研究の動機と目的

  • 皮膚鏡画像における不規則な形状とぼやけた境界を示す皮膚腫瘍の不正確なセグメンテーションの課題に対処すること。
  • 従来の手法が主に腫瘍のボディに注目する一方でエッジ特徴を無視するという限界を克服すること。
  • 髪、ルーラー、染色などの画像の干渉要因が存在する状況でもセグメンテーションのロバスト性を向上させること。
  • アテンションおよびガイド付き統合メカニズムを用いて、マルチスケールで補完的なエッジ・ボディ特徴を統合することで特徴表現を強化すること。
  • CNNとTransformerの両方を活用する統合されたディープラーニングフレームワークを構築し、優れたセグメンテーション性能を実現すること。

提案手法

  • エッジ特徴抽出のためのCNNベースのブランチと、ボディ特徴学習のためのTransformerベースのブランチを有する二重ブランチエンコーダを採用する。
  • 局所クロスアテンションを用いて同じエンコーダレベルでエッジ特徴とボディ特徴を統合する局所クロスアテンション融合(LCAF)モジュールを導入する。
  • デコーダで隣接スケール間の特徴統合に事前知識を用いるために、プロパー Guided Multi-Scale Fusion(PGMF)モジュールを適用する。
  • 空間的詳細を保持し、特徴伝搬を強化するために、連結と要素ごとの演算を用いたスキップ接続を用いる。
  • セグメンテーション精度を最適化するために、バイナリクロスエントロピー損失とDice損失を用いてネットワークをエンドツーエンドで訓練する。
  • Grad-CAM可視化を用いて、エッジエンコーダが腫瘍境界に注目しているのに対し、ボディエンコーダが全体的な意味を捉えていることを検証する。

実験結果

リサーチクエスチョン

  • RQ1エッジとボディ特徴を別々に処理する二重ブランチアーキテクチャは、単一ブランチモデルと比較して皮膚腫瘍のセグメンテーション精度を向上させることができるか?
  • RQ2補完的なエッジ特徴とボディ特徴を統合するための局所クロスアテンション融合(LCAF)は、より良い境界明確化にどの程度効果的か?
  • RQ3プロパー Guided Multi-Scale Fusion(PGMF)は、デコーダにおけるスケール間の特徴統合をどの程度向上させるか?
  • RQ4統合されたネットワークアーキテクチャ内でCNNとTransformerアーキテクチャを組み合わせることで、困難な皮膚鏡画像においてより優れた一般化性とロバスト性が得られるか?
  • RQ5エッジ特徴とボディ特徴はセグメンテーション性能にどのように異なる寄与をするか?また、それらの統合は個々のモodal特徴表現の限界を緩和できるか?

主な発見

  • LCAUnetはISIC 2017、ISIC 2018、PH2データセットで最先端の性能を達成し、既存のSOTA手法をDiceとIoU指標で上回った。
  • アブレーションスタディの結果、エッジエンコーダを追加するだけでISIC 2017でDiceが5.27%、IoUが6.74%向上し、エッジ特徴の重要性が示された。
  • LCAFモジュールはエッジエンコーダオンリーベースライン比でDiceを1.02%、IoUを0.63%向上させ、クロスモダリティ統合の有効性を裏付けた。
  • PGMFモジュールは顕著な貢献を示し、ベースライン比でDiceが2.52%、IoUが2.63%向上し、マルチスケール特徴統合における役割を示した。
  • 完全なLCAUnetモデルは、ISIC 2017でベースライン比でIoUが8.87%、Diceが7.03%向上し、ISIC 2018およびPH2でも一貫した向上が確認された。
  • Grad-CAM可視化により、エッジエンコーダが腫瘍境界に注目しているのに対し、ボディエンコーダが全体的な腫瘍の意味を捉えていることが確認され、二重ブランチアーキテクチャの補完的設計が妥当であることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。