[論文レビュー] TESL-Net: A Transformer-Enhanced CNN for Accurate Skin Lesion Segmentation
TESL-Netは、畳み込みニューラルネットワーク(CNN)エンコーダ・デコーダとスウィン変換器ブロック、およびバイ・コンボリューショナルLSTM(Bi-ConvLSTM)モジュールを組み合わせたハイブリッド深層学習アーキテクチャを提案する。スイッチバック接続における変換器によるグローバルコンテキストの統合と、Bi-ConvLSTMによる逐次モデリングにより、ISIC 2017およびISIC 2018データセットにおいて、JaccardインデックスでSOTA手法を最大11.22%上回る最先端の性能を達成した。
Early detection of skin cancer relies on precise segmentation of dermoscopic images of skin lesions. However, this task is challenging due to the irregular shape of the lesion, the lack of sharp borders, and the presence of artefacts such as marker colours and hair follicles. Recent methods for melanoma segmentation are U-Nets and fully connected networks (FCNs). As the depth of these neural network models increases, they can face issues like the vanishing gradient problem and parameter redundancy, potentially leading to a decrease in the Jaccard index of the segmentation model. In this study, we introduced a novel network named TESL-Net for the segmentation of skin lesions. The proposed TESL-Net involves a hybrid network that combines the local features of a CNN encoder-decoder architecture with long-range and temporal dependencies using bi-convolutional long-short-term memory (Bi-ConvLSTM) networks and a Swin transformer. This enables the model to account for the uncertainty of segmentation over time and capture contextual channel relationships in the data. We evaluated the efficacy of TESL-Net in three commonly used datasets (ISIC 2016, ISIC 2017, and ISIC 2018) for the segmentation of skin lesions. The proposed TESL-Net achieves state-of-the-art performance, as evidenced by a significantly elevated Jaccard index demonstrated by empirical results.
研究の動機と目的
- 不規則な形状、ぼやけた境界、髪やマーカー色などのアーティファクトによる、皮膚病変の正確な分類の課題に対処する。
- 勾配消失やパラメータの重複といった、深層畳み込みニューラルネットワーク(CNN)の限界を克服し、分類性能の低下を防ぐ。
- 長距離依存関係と時系列モデリングをU-Netに類似したアーキテクチャに統合することで、特徴表現を向上させる。
- CNN、スウィン変換器、およびBi-ConvLSTMの新規な統合により、ベンチマークデータセット(ISIC 2016, 2017, 2018)における分類精度を向上させる。
- 複数の公開皮膚病変分類ベンチマークにおいて、Jaccardインデックス、Diceスコア、その他の指標で最先端の性能を達成する。
提案手法
- 特徴抽出と分類のためのバックボーンとして、U-Net風のエンコーダ・デコーダアーキテクチャを採用する。
- エンコーダにスウィン変換器ブロックを統合し、長距離の文脈的関係やグローバルな画像依存性を捉える。
- スイッチバック接続にバイ・コンボリューショナルLSTM(Bi-ConvLSTM)モジュールを挿入し、特徴マップ間の時空間的依存性をモデリングする。
- マルチスケール特徴マッピングの統合とスイッチバック接続を活用し、空間的詳細を保持するとともに、意味的表現を強化する。
- スウィン変換器におけるマルチヘッド自己注意機構を活用し、局所的およびグローバルな受容 field の両方で特徴の重要度を動的に重みづけする。
- 皮膚病変の境界における分類性能を最適化するため、バイナリクロスエントロピー損失とDice損失を併用して、エンドツーエンドのモデルを訓練する。

実験結果
リサーチクエスチョン
- RQ1CNN、変換器、およびBi-ConvLSTMを組み合わせたハイブリッドアーキテクチャは、標準のU-NetやSOTAモデルと比較して、皮膚病変分類の正確性を向上させることができるか?
- RQ2スウィン変換器ブロックの統合は、複雑なテクスチャやアーティファクトを有する皮膚画像において、長距離の文脈的特徴を効果的に捉えることができるか?
- RQ3スイッチバック接続に組み込まれたBi-ConvLSTMモジュールは、特徴マップ間の時空間的依存性をモデリングすることで、特徴表現をどの程度向上させるか?
- RQ4提案されたTESL-Netアーキテクチャは、病変の形態、コントラスト、アーティファクトの有無に差がある多様な皮膚病変データセットに一般化可能か?
- RQ5局所的(CNN)、グローバル(変換器)、および逐次的(Bi-ConvLSTM)モデリングの統合は、JaccardインデックスやDiceスコアといった標準評価指標で優れた性能を達成できるか?
主な発見
- ISIC 2017データセットでは、TESL-NetがJaccardインデックス(IoU)86.91%を達成し、以前のSOTA手法(RA-Net)を2.02%上回った。
- ISIC 2018データセットでは、TESL-NetがJaccardインデックス90.56%を達成し、次善の手法(RA-Net)を2.22%上回った。
- ISIC 2018では、Diceスコアが94.22%に達し、予測マスクと正解マスクの重複度が非常に高いことを示した。
- ISIC 2016ベンチマークでは、TESL-NetのJaccardインデックスはSOTA手法を8.13%上回り、データセット全体にわたる一貫した優位性を確認した。
- 可視化比較により、TESL-Netは不規則な病変形状、低コントラスト、髪、インクアーティファクトといった挑戦的ケースを効果的に処理できることを示した。
- ISIC 2017では特異性が97.29%、ISIC 2018では97.21%を達成し、正常皮膚領域を正しく同定する強力な性能を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。